Category
심층 활용 글 모음
심층 활용 글 모음. 기본을 넘어 어디까지 되는지. 모두 28편입니다.

하네스 자가개선의 과적합을 정규화로 막은 RRSI는 벤치마크 밖에서도 통했다
RRSI는 하네스 자가개선에 노이즈 밴드와 편집 예산, 비용 규칙을 걸어 미학습 벤치마크로 전이되는 수정만 남긴다. arXiv 2609.24972의 어블레이션과 정책 교체 실험을 실측 수치로 정리한다.

코딩 에이전트 하네스의 계획·도구·컨텍스트 관리는 언제 도움이 되는가
코딩 에이전트 하네스의 계획, 도구, 컨텍스트 관리를 176개 설정으로 측정한 arXiv 논문(2609.20804)을 실측 수치 중심으로 정리합니다.

Rust로 만든 네이티브 Spotify 클라이언트가 실측으로 얼마나 가벼운가
Fastpotify는 Rust 기반 네이티브 Spotify 클라이언트로, RAM 100~250MB를 쓴다. 공식 데스크탑(600MB~1GB+)과 비교해 브라우저 엔진을 제거한 가벼움을 실측으로 정리한다. egui+librespot, 1초 미만 시작, MPRIS/CLI 제어 지원. MIT·+268★/일.

모델 업그레이드하면 에이전트 메모리가 망가지는가
모델을 바꾸면 에이전트 메모리가 조용히 손상될 수 있다. 고정 스키마 그래프는 +0.0004로 무손실이지만, 압축 노트는 ±9.91/13.28pp로 결핍되고 RAG 절반 이전은 효과 일부만 얻는다. 원본 히스토리 보존이 유일한 회복 안전망이다. arXiv 2609.05339 실측.

실패 사례 메모리로 에이전트 스킬을 자가개선하는 두 방식
SkillRevise는 실패 트레이스로 스킬을 최소 수정해 SkillsBench 성공률 36.05%→61.63%를 달성했고, MNL은 배치 실패를 클러스터링해 공통 규칙으로 증류한다. 실패를 어떻게 구조화하고 검증된 개선만 반영할지, 에이전트 자가개선의 실행 루프를 실측으로 정리했다.

GPT-6 Astra와 함께 프롬프트가 과잉이 된 이유
GPT-6 Astra는 기존 두꺼운 프롬프트·스킬 파일이 오히려 작업을 차단한다고 OpenAI가 경고한다. 의도는 또렷하게, 절차는 최소로, 결정 경계만 명시하는 방식으로 프롬프트·스킬·Codex 컨텍스트 압축(config.toml)을 재설계하는 법을 기존 문구와 수정 문구 대조로 정리했다.

ChatGPT가 계획하고 Codex가 실행하게 만든 오픈소스
ChatGPT Plus/Pro 웹 구독을 계획·리뷰 두뇌로, Codex는 실행만 맡기는 오픈소스 브릿지. API 키 없이 읽기 전용 MCP + OAuth 2.1로 동작하며, 쓰기 도구가 아예 없어 프롬프트 주입에도 면역이다. 2,553★·MIT·V1.

KC-Bench, 에이전트가 지식 충돌을 감지하고 안전하게 해결하는가
KC-Bench는 LLM 에이전트가 모순된 증거를 행동 전에 감지·검증하는지를 측정한다. 9개 모델 실측 결과, 지역 0.07~0.68 / 리테일 0.19~0.65 / 개인비서 0.38~0.80으로 도메인별 편차가 극심하다. 2026-09-03 논문.

AI가 코드를 너무 많이 쓴다 — Ponytail과 최소 수정의 실측
Ponytail은 "가장 게으른 시니어 개발자처럼 사고하라"는 에이전트 스킬로, 벤치마크상 코드 줄 수 -54%를 실측했다. 이 스킬이 다루는 과잉수정을 NUS 논문(arXiv 2609.04061)이 통제 실험으로 측정한 결과를 겹쳐, 왜 프롬프트가 작동하고 어디까지이며 견고한 해법이 RL 학습인지를 정리한다.

LLM 판정기의 안정성을 재기 전에, 계측기부터 재야 한다 — 5만 2천 회 감사가 밝힌 것
LLM 판정기(judge)를 그대로 신뢰하면 안 되는 이유를 arXiv 2609.04198이 52,988회 재실행 감사로 실측했다. 같은 요청을 두 번 보내도 순위가 달라지고(스칼라는 안정·랭킹은 붕괴), 샘플링을 늘려도(최대 74만 콜) 통과율 0/500, 제공자 4곳 모두 같은 바닥을 공유한다. 결론은 "판정 게이트를 얼리기 전에 계측기부터 잡아라"는 설계 규율 8가지와 실행 체크리스트.

AutoGraphForge — AI가 그래프 이론을 자동으로 찾아내고 증명한다
그래프 정리를 발견·반례·증명까지 자동화하는 파이프라인 AutoGraphForge(arXiv 2609.03478). 348K 그래프에서 6,522개 추측을 걸러내고 Lean 4로 형식 검증. 아이디어→검증 루프 설계 사례.

httpx2, 한 번에 보안 권고 5건 — pydantic 차세대 HTTP 클라이언트 코드를 까보니
pydantic의 차세대 HTTP 클라이언트 httpx2가 하루에 보안 권고 5건을 낸 이유. 요청 스머글링·압축 폭탄(64KiB→64MiB)·SOCKS5 평문 WebSocket까지 코드를 까고, 2.12.0 업그레이드·대안을 정리했습니다.

자가개선은 되긴 한다 — 다만 검증 게이트가 있을 때만 (Phantom Gains vs Recuris)
Phantom Gains는 측정 게이트 없는 자가개선이 유령 이득임을 실측했다. Recuris(2608.24876)는 검증 게이트와 실패 국소화를 갖춘 자가개선이 tau-bench +17.8pt를 달성함을 보였다. 차이는 전제조건이다.

벡터 RAG와 FTS5 RAG는 대체재가 아니라 협력자 — 최신 실측이 밝힌 덴스와 스파스의 역할
DESA 논문(arXiv 2608.15851)이 실측: 벡터는 의미를 확장하고 FTS5는 정확 앵커를 잡는다. 하이브리드가 nDCG@10 +3.82%, 접근 깊이 -36%를 달성. SQLite FTS5 하이브리드가 실용적.

에이전트가 기억하는 것은 거짓말을 영구적으로 당한다는 뜻 — 메모리 중독 공격의 실측
코퍼스의 1.2% 거짓 주입만으로 에이전트 메모리 가치 2/3가 사라진다(정확도 0.850→0.300). 내용 필터는 거짓 기억 360개 중 0개를 거부했다(arXiv 2608.21230).