
하네스 자가개선의 과적합을 정규화로 막은 RRSI는 벤치마크 밖에서도 통했다
RRSI는 하네스 자가개선에 노이즈 밴드와 편집 예산, 비용 규칙을 걸어 미학습 벤치마크로 전이되는 수정만 남긴다. arXiv 2609.24972의 어블레이션과 정책 교체 실험을 실측 수치로 정리한다.
Tag
이 주제로 기록된 글 50개를 모았습니다.

RRSI는 하네스 자가개선에 노이즈 밴드와 편집 예산, 비용 규칙을 걸어 미학습 벤치마크로 전이되는 수정만 남긴다. arXiv 2609.24972의 어블레이션과 정책 교체 실험을 실측 수치로 정리한다.

코딩 에이전트 하네스의 계획, 도구, 컨텍스트 관리를 176개 설정으로 측정한 arXiv 논문(2609.20804)을 실측 수치 중심으로 정리합니다.

코딩 에이전트가 코드를 대량으로 쓰면서 Anthropic의 CI 부하가 6개월 만에 25배로 늘었습니다. 테스트 선택 서비스가 세 번의 임시방편 끝에 stateless 구조로 재설계된 과정을 실측 수치로 정리합니다.

Manifold Security가 공개한 GitSpawn 취약점은 AI 코딩 에이전트가 저장소를 열기만 해도 악성 .git/config의 명령을 실행하게 한다. 7개 에이전트에서 8건이 확인됐고, 게시 시점까지 4건이 미패치로 남았다.

Fastpotify는 Rust 기반 네이티브 Spotify 클라이언트로, RAM 100~250MB를 쓴다. 공식 데스크탑(600MB~1GB+)과 비교해 브라우저 엔진을 제거한 가벼움을 실측으로 정리한다. egui+librespot, 1초 미만 시작, MPRIS/CLI 제어 지원. MIT·+268★/일.

모델을 바꾸면 에이전트 메모리가 조용히 손상될 수 있다. 고정 스키마 그래프는 +0.0004로 무손실이지만, 압축 노트는 ±9.91/13.28pp로 결핍되고 RAG 절반 이전은 효과 일부만 얻는다. 원본 히스토리 보존이 유일한 회복 안전망이다. arXiv 2609.05339 실측.

SkillRevise는 실패 트레이스로 스킬을 최소 수정해 SkillsBench 성공률 36.05%→61.63%를 달성했고, MNL은 배치 실패를 클러스터링해 공통 규칙으로 증류한다. 실패를 어떻게 구조화하고 검증된 개선만 반영할지, 에이전트 자가개선의 실행 루프를 실측으로 정리했다.

GPT-6 Astra는 기존 두꺼운 프롬프트·스킬 파일이 오히려 작업을 차단한다고 OpenAI가 경고한다. 의도는 또렷하게, 절차는 최소로, 결정 경계만 명시하는 방식으로 프롬프트·스킬·Codex 컨텍스트 압축(config.toml)을 재설계하는 법을 기존 문구와 수정 문구 대조로 정리했다.

ChatGPT Plus/Pro 웹 구독을 계획·리뷰 두뇌로, Codex는 실행만 맡기는 오픈소스 브릿지. API 키 없이 읽기 전용 MCP + OAuth 2.1로 동작하며, 쓰기 도구가 아예 없어 프롬프트 주입에도 면역이다. 2,553★·MIT·V1.

KC-Bench는 LLM 에이전트가 모순된 증거를 행동 전에 감지·검증하는지를 측정한다. 9개 모델 실측 결과, 지역 0.07~0.68 / 리테일 0.19~0.65 / 개인비서 0.38~0.80으로 도메인별 편차가 극심하다. 2026-09-03 논문.

Strix(런타임 다이내믹)와 Shannon(소스코드 선행)은 둘 다 "검증된 PoC만 리포트"라 주장하는 AI 펜테스터다. 같은 슬로건인데 구현이 반대인 이유를 설계 철학·오탐 커버리지·실측 기준으로 정리한다.

Ponytail은 "가장 게으른 시니어 개발자처럼 사고하라"는 에이전트 스킬로, 벤치마크상 코드 줄 수 -54%를 실측했다. 이 스킬이 다루는 과잉수정을 NUS 논문(arXiv 2609.04061)이 통제 실험으로 측정한 결과를 겹쳐, 왜 프롬프트가 작동하고 어디까지이며 견고한 해법이 RL 학습인지를 정리한다.

LLM 판정기(judge)를 그대로 신뢰하면 안 되는 이유를 arXiv 2609.04198이 52,988회 재실행 감사로 실측했다. 같은 요청을 두 번 보내도 순위가 달라지고(스칼라는 안정·랭킹은 붕괴), 샘플링을 늘려도(최대 74만 콜) 통과율 0/500, 제공자 4곳 모두 같은 바닥을 공유한다. 결론은 "판정 게이트를 얼리기 전에 계측기부터 잡아라"는 설계 규율 8가지와 실행 체크리스트.

그래프 정리를 발견·반례·증명까지 자동화하는 파이프라인 AutoGraphForge(arXiv 2609.03478). 348K 그래프에서 6,522개 추측을 걸러내고 Lean 4로 형식 검증. 아이디어→검증 루프 설계 사례.

2026-01-09 arXiv 논문 기반 — AI 에이전트의 안전성을 점진적 검증으로 달성하는 Three-Pillar Model (투명성·책임성·신뢰성)