
agent.md로 LLM 코딩 품질을 끌어올리는 법 — 반복하는 코딩 지시를 파일로 저장한다
LLM 코딩은 속도는 빠르지만 코드가 스파게티다. Fabien Sanglard가 agent.md에 반복하는 코딩 지시를 저장해 품질을 손코딩 수준으로 끌어올렸다. 스타일은 잡되 정확성은 사람이 검증.
Tag
이 주제로 기록된 글 9개를 모았습니다.

LLM 코딩은 속도는 빠르지만 코드가 스파게티다. Fabien Sanglard가 agent.md에 반복하는 코딩 지시를 저장해 품질을 손코딩 수준으로 끌어올렸다. 스타일은 잡되 정확성은 사람이 검증.

Qwen3.8-27B(Apache 2.0, 17GB)가 기본 reasoning_effort=xhigh로 과잉 사고를 일으킨다. 펠리컨 SVG 한 장에 추론 토큰 22,276개(21분)를 쓴 실측과, 같은 Qwen 패밀리 4B 모델에서 재현한 thinking on/off 3배 토큰 차이, reasoning_effort·MTP로 끄고 빠르게 쓰는 법까지.

캐릭터 일관성 유지 T2V 생성. 참조 이미지를 재구축하며 생성하는 Context-Aware 디퓨전 프레임워크. 실측: ArcFace 0.6003, VLM-Appearance 0.9457 (VACE/Phantom 대비 SOTA). Emphasize-Attention, 이중 가이던스, Gap-RoPE.

에이전트 코딩에서 프롬프트 파일이 무한정 커지는 문제를 1,867개 레포의 24.7만 인스트럭션 수명으로 실측. +226% 성장, 커밋당 +4.9개, 나이든 규칙은 삭제 불가 — 해결책은 "이유를 남기는 주석".

자가진화 에이전트의 스킬 비대화 문제를 해결하는 SkillZip. 평가 없이 구조적으로 압축해 압축률 31.2%, 성능은 오히려 상승, 3.5배 빠르고 rollout 0회. 자가진화 시리즈 후속작.

LinkedIn의 자가진화 고객지원 에이전트 실측 분석. 진화적 검색으로 프롬프트만 최적화(모델 재훈련 없이), 2주 프로덕션 A/B에서 QA 자가해결 +9.0pp, 라우팅 정확도 +30.6pp.

AI 에이전트 자가진화는 두 가지 방식으로 연구된다. 지식을 진화시키는 SkillProx와 에이전트 자신을 진화시키는 Ouroboros를 실측 수치로 비교합니다.

2026-08-07 공개된 arXiv 논문 SkillProx(2608.07449) — 에이전트 스킬 자기진화를 실측 검증. 사람이 만든 스킬이 오히려 성능을 떨어뜨리는 역설(45.3→36.7), 검증 없는 진화는 폭락(→13.0), 닫힌 루프 검증의 가치(→54.5).

arXiv:2608.06312 실측 검증: 488개 GB/T 문서·7,306건 오류로 평가한 결과 최강 LLM(0.3280)도 전문가(0.6640)의 절반 수준이었고, GB/T-Reviewer 구조가 GPT-5.5의 CMCS를 0.3185→0.5094로 끌어올렸습니다.