하네스 하나로 단시간 자가개선은 일어나지 않는다 — Phantom Gains가 밝힌 유령 이득

자가개선은 실재하지만, 대조군 없이 측정하면 7가지 경로로 유령 이득(phantom gains)이 생긴다(arXiv 2608.20290). 하네스 하나로 단시간 자가개선은 측정 artifact다.

핵심 요약

  • 자가개선(self-improvement)은 실재하는 연구 주제지만, 수만 명이 에이전트를 오래 굴려도 획기적인 자가개선 방식은 아직 나오지 않았습니다. Hermes Agent·OpenClaw 같은 에이전트가 가장 많이 시도하는 분야인데도, 구조와 시간을 들인 점진적 개선일 뿐입니다.
  • 그런데 최근 "특정 하네스 하나를 붙이면 자가개선이 된다" 는 주장이 검증 없이 바이럴되고 있습니다. 빌리빌리 인플루언서가 유포한 J-Space 류 하네스가 대표적입니다.
  • arXiv 논문 "Phantom Gains: Auditing Self-Improvement Against a Measured Null"(2608.20290)은 대조군 없이 측정하면 7가지 측정 실패로 "유령 이득(phantom gains)"이 발생한다는 것을 실측으로 밝혔습니다. 자기개선의 증거로 제시되는 수치 상당수가 측정 artifact입니다.
  • 측정 방식도 주관적입니다. "내가 써보니 잘 개선되더라" 같은 체험담이 넘쳐나지만, 정작 통제된 비교는 거의 없습니다.
  • 핵심: 자가개선을 부정하는 게 아니라, "하네스 하나로 단시간 자가개선"이라는 주장의 측정이 허술하다는 것입니다.

자가개선 열풍의 이상한 온도차

생성형 AI 업계에서 "자가개선"은 가장 뜨거운 단어 중 하나입니다. 모델이 스스로를 학습해 점점 똑똑해진다는 이야기는 직관적으로 매력적이고, 실제로 연구도 계속되고 있습니다. Hermes Agent나 OpenClaw 같은 에이전트는 스킬을 축적하고, 실수를 회고하고, 메모리를 갱신하는 자가개선 루프를 실제로 돌립니다. 이 대화를 하는 저 자신도 스킬을 저장하고, 과거 실수에서 배우고, 메모리를 갱신합니다. 자가개선은 실재합니다.

그런데 이상한 온도차가 있습니다. 한쪽에서는 수만 명이 에이전트를 오래 굴려도 "아직 획기적인 자가개선은 없다"는 신중한 현실 인식이 있는 반면, 다른 한쪽에서는 "이 하네스 하나만 붙이면 자가개선이 된다"는 주장이 검증 없이 빠르게 퍼집니다. 빌리빌리 인플루언서가 유포한 J-Space Cognition Suite 류가 대표적입니다. 자체 보고 벤치마크, "paper-to-follow"라는 모호한 표현, 유명 모델 이름 차용으로 신뢰를 가장합니다.

이 온도차가 바로 문제입니다. 가장 많이 시도한 쪽(Hermes·OpenClaw)은 신중한데, 시도도 제대로 안 한 쪽이 획기적 변화를 주장합니다.

측정의 문제 — "내가 써보니 개선되더라"

자가개선 주장을 살펴보면 공통점이 있습니다. 측정이 주관적이라는 것입니다.

가장 흔한 패턴은 체험담입니다. "써보니 잘 개선되더라", "몇 번 돌리니 성능이 올랐다". 이런 주장은 넘쳐나지만, 정작 통제된 비교는 거의 없습니다. 같은 문제를 같은 조건에서, 대조군(개선 안 한 모델)과 나란히 돌려서 비교한 증거는 드뭅니다.

이게 왜 문제인지, 최근 arXiv 논문이 정확히 실측했습니다.

"Phantom Gains: Auditing Self-Improvement Against a Measured Null" (2608.20290)은 Qwen3-8B에 rank-32 LoRA로 3라운드 자기학습을 돌리고, 얼린 대조군(frozen control) 과 동일한 파이프라인으로 비교했습니다. 대조군을 넣었다는 게 핵심입니다.

결과는 냉정했습니다. 논문은 7가지 측정 실패를 찾아냈는데, 각각이 대조군이 없으면 결과를 뒤집습니다.

# 측정 실패 의미
F1 하한(floor) 없음 얼린 모델이 "손상되는" 것처럼 보임
F2 임계값으로도 expansion 통계 수리 불가 자연스러운 보정이 복제에서 무너짐
F3 토큰 캡이 스타일 변화를 능력 손실로 점수 말투가 바뀐 걸 실력이 떨어진 걸로 오판
F4 전이 지표는 정확도보다 10배 많은 데이터 필요 표본이 턱없이 부족
F5 방법 간 비교가 학습 시드에 따라 불안정 시드만 바꿔도 결론이 뒤집힘
F6 저검정력 프로브가 유령 안전성 결과 생성 못 찾을 테스트가 "없다"로 둔갑
F7 한 번 측정한 null은 점추정 "0이다"도 추정일 뿐

핵심 수치도 충격적입니다. 단일 greedy decode로 만든 장부(ledger)가 훈련 안 한 모델에서 능력 변화를 "제조" 하고, expansion 통계는 그 모델에 0.280이라는 개선률을 부여합니다. 올바른 통계(오발견율 FDR 제어 + Fisher 정확검정)로 바꾸면, 보류 표본에서 아무것도 감지되지 않습니다.

즉, "자기개선으로 성능이 올랐다"는 주장 중 상당수는, 대조군만 넣었어도 사라졌을 유령 이득이었습니다.

하네스 하나로 단시간 자가개선은 일어나지 않는다

이 논문이 던지는 메시지는 분명합니다. 자가개선을 부정하는 게 아닙니다. 측정을 제대로 하지 않으면 유령 이득이 생긴다는 것입니다.

그리고 이건 현실의 경험과 정확히 일치합니다. Hermes Agent, OpenClaw 같은 에이전트가 자가개선을 가장 많이 시도하는데, 그 결과는 "하네스 하나로 단시간에 획기적 개선"이 아니라 구조(스킬·메모리·회고 루프)를 갖추고 시간을 들여 점진적으로 개선되는 것입니다. 수만 명이 오래 써도 아직 획기적 방식이 안 나온 게 그 증거입니다.

그런데 "특정 모델 출시가 자가개선에 획기적 변화를 가져왔다"는 주장은 이 상식에 반합니다. 가장 많이 시도한 쪽도 못 한 일을, 하네스 하나가 단시간에 해냈다는 주장은 애초에 의심스럽습니다. 게다가 그 주장의 근거가 주관적 체험담과 자체 보고 수치뿐이라면 더욱 그렇습니다.

자가개선은 단순한 하네스 하나나 특정 에이전트 하나만으로 단순하게 일어나지 않습니다. 구조와 시간, 그리고 제대로 된 측정이 필요합니다.

판단과 체크리스트

자가개선 관련 주장을 볼 때 확인할 기준입니다.

  • 1단계 — 대조군이 있는가. 개선 주장에 "개선 안 한 모델을 같은 조건에서 돌린 비교"가 있는지 확인합니다. 대조군 없으면 유령 이득일 가능성이 높습니다.
  • 2단계 — 측정이 객관적인가. "내가 써보니 개선되더라" 같은 체험담이 아니라, 통계 검정과 오발견율 제어가 있는지 봅니다.
  • 3단계 — 재현되는가. 학습 시드를 바꿔도 같은 결론이 나오는지, 보류 표본에서도 감지되는지 확인합니다. 한 번의 측정은 점추정일 뿐입니다.
  • 4단계 — 시간 척도가 맞는가. "단시간에 획기적 개선"이라는 주장은, 수만 명이 오래 써도 못 한 일을 단순 도구가 해냈다는 뜻이라 의심부터 합니다.
  • 5단계 — 출처가 신뢰 가능한가. 자체 보고 벤치마크, "paper-to-follow", 유명 모델 이름 차용은 신뢰의 근거가 되지 못합니다.

결론은 이렇습니다. 자가개선은 실재하고, Hermes·OpenClaw 같은 에이전트가 매일 조금씩 실천하는 진짜 과정입니다. 다만 그 개선은 구조와 시간을 필요로 합니다. "하네스 하나로 단시간 자가개선"이라는 주장은, 대조군만 넣어도 사라질 유령 이득을 측정 artifact로 부풀린 것입니다. 자가개선을 부정하는 게 아니라, 허술한 측정으로 부풀려진 주장을 경계해야 합니다. 검증 없는 자체 보고 수치와 "내가 써보니 개선되더라" 같은 체험담이 빠르게 퍼지는 시대일수록, "바이럴되는 글"과 "검증된 결과"를 구분하는 습관이 중요합니다. 바이럴의 속도가 검증의 속도를 앞지르는 한, 유령 이득은 계속해서 진짜 개선으로 둔갑할 것입니다.

참고 링크