Tag
#논문리뷰
이 주제로 기록된 글 6개를 모았습니다.

AI가 코드를 너무 많이 쓴다 — Ponytail과 최소 수정의 실측
Ponytail은 "가장 게으른 시니어 개발자처럼 사고하라"는 에이전트 스킬로, 벤치마크상 코드 줄 수 -54%를 실측했다. 이 스킬이 다루는 과잉수정을 NUS 논문(arXiv 2609.04061)이 통제 실험으로 측정한 결과를 겹쳐, 왜 프롬프트가 작동하고 어디까지이며 견고한 해법이 RL 학습인지를 정리한다.

LLM 판정기의 안정성을 재기 전에, 계측기부터 재야 한다 — 5만 2천 회 감사가 밝힌 것
LLM 판정기(judge)를 그대로 신뢰하면 안 되는 이유를 arXiv 2609.04198이 52,988회 재실행 감사로 실측했다. 같은 요청을 두 번 보내도 순위가 달라지고(스칼라는 안정·랭킹은 붕괴), 샘플링을 늘려도(최대 74만 콜) 통과율 0/500, 제공자 4곳 모두 같은 바닥을 공유한다. 결론은 "판정 게이트를 얼리기 전에 계측기부터 잡아라"는 설계 규율 8가지와 실행 체크리스트.

AutoGraphForge — AI가 그래프 이론을 자동으로 찾아내고 증명한다
그래프 정리를 발견·반례·증명까지 자동화하는 파이프라인 AutoGraphForge(arXiv 2609.03478). 348K 그래프에서 6,522개 추측을 걸러내고 Lean 4로 형식 검증. 아이디어→검증 루프 설계 사례.

자가개선은 되긴 한다 — 다만 검증 게이트가 있을 때만 (Phantom Gains vs Recuris)
Phantom Gains는 측정 게이트 없는 자가개선이 유령 이득임을 실측했다. Recuris(2608.24876)는 검증 게이트와 실패 국소화를 갖춘 자가개선이 tau-bench +17.8pt를 달성함을 보였다. 차이는 전제조건이다.

에이전트가 기억하는 것은 거짓말을 영구적으로 당한다는 뜻 — 메모리 중독 공격의 실측
코퍼스의 1.2% 거짓 주입만으로 에이전트 메모리 가치 2/3가 사라진다(정확도 0.850→0.300). 내용 필터는 거짓 기억 360개 중 0개를 거부했다(arXiv 2608.21230).

하네스 하나로 단시간 자가개선은 일어나지 않는다 — Phantom Gains가 밝힌 유령 이득
자가개선은 실재하지만, 대조군 없이 측정하면 7가지 경로로 유령 이득(phantom gains)이 생긴다(arXiv 2608.20290). 하네스 하나로 단시간 자가개선은 측정 artifact다.