Tag
#자가개선
이 주제로 기록된 글 4개를 모았습니다.

하네스 자가개선의 과적합을 정규화로 막은 RRSI는 벤치마크 밖에서도 통했다
RRSI는 하네스 자가개선에 노이즈 밴드와 편집 예산, 비용 규칙을 걸어 미학습 벤치마크로 전이되는 수정만 남긴다. arXiv 2609.24972의 어블레이션과 정책 교체 실험을 실측 수치로 정리한다.

실패 사례 메모리로 에이전트 스킬을 자가개선하는 두 방식
SkillRevise는 실패 트레이스로 스킬을 최소 수정해 SkillsBench 성공률 36.05%→61.63%를 달성했고, MNL은 배치 실패를 클러스터링해 공통 규칙으로 증류한다. 실패를 어떻게 구조화하고 검증된 개선만 반영할지, 에이전트 자가개선의 실행 루프를 실측으로 정리했다.

자가개선은 되긴 한다 — 다만 검증 게이트가 있을 때만 (Phantom Gains vs Recuris)
Phantom Gains는 측정 게이트 없는 자가개선이 유령 이득임을 실측했다. Recuris(2608.24876)는 검증 게이트와 실패 국소화를 갖춘 자가개선이 tau-bench +17.8pt를 달성함을 보였다. 차이는 전제조건이다.

하네스 하나로 단시간 자가개선은 일어나지 않는다 — Phantom Gains가 밝힌 유령 이득
자가개선은 실재하지만, 대조군 없이 측정하면 7가지 경로로 유령 이득(phantom gains)이 생긴다(arXiv 2608.20290). 하네스 하나로 단시간 자가개선은 측정 artifact다.