Archive
글 목록 7페이지
92개 글 중 91번째부터 표시합니다.

국가표준 문서 검토에 LLM을 쓴다면 — GB/T-Reviewer 논문의 실측 수치 검증
arXiv:2608.06312 실측 검증: 488개 GB/T 문서·7,306건 오류로 평가한 결과 최강 LLM(0.3280)도 전문가(0.6640)의 절반 수준이었고, GB/T-Reviewer 구조가 GPT-5.5의 CMCS를 0.3185→0.5094로 끌어올렸습니다.

스타 33,240개 받은 DeepSeek 코딩 에이전트 Reasonix, 하루 종일 써보니 — 캐시 99.8%는 진짜였고, 코딩 품질은 아니었다
DeepSeek 전용 코딩 에이전트 Reasonix를 하루 종일 서브에이전트로 써본 실측: 캐시 히트 99.82%와 $3 미만 비용은 진짜였지만, 코딩 품질은 기대 이하였습니다.