Category
심층 활용 글 목록 2페이지
심층 활용: 28개 글 중 16번째부터 표시합니다.

Hermes Agent로 자율 공격 보안 에이전트를 만들다 — Cybermes가 해결한 보안 스캐너의 노이즈 문제
Cybermes는 Hermes Agent로 구동되는 자율 보안 에이전트다. Zero-False-Positive 게이트, 토큰 70~85% 절약, 자율 추론 루프로 전통 스캐너의 노이즈 문제를 해결한다.

Claude의 BuzzFeed 말투를 고치려면 다른 AI로 번역해야 한다 — NoBuzz가 드러낸 AI 슬롭의 실체
Claude의 과장된 말투(load-bearing assumption, the kicker)는 프롬프트로 안 고쳐진다. NoBuzz는 다른 모델(Gemini)로 번역해 말투를 걷어낸다. AI 슬롭이 생각보다 뿌리 깊다는 실측.

하네스 하나로 단시간 자가개선은 일어나지 않는다 — Phantom Gains가 밝힌 유령 이득
자가개선은 실재하지만, 대조군 없이 측정하면 7가지 경로로 유령 이득(phantom gains)이 생긴다(arXiv 2608.20290). 하네스 하나로 단시간 자가개선은 측정 artifact다.

CIMemories — LLM 지속 메모리가 맥락을 무시하고 정보를 새는 문제
Bruce Schneier가 소개한 CIMemories(arXiv 2511.14937) 실측: 프론티어 모델 최대 69% 속성 위반, 태스크 1→40에서 GPT-5 위반률 0.1%→9.6%, 같은 프롬프트 5회 실행 시 25.1%. 프라이버시 프롬프팅은 과일반화로 실패.

Mind Viruses — 에이전트가 생각을 전염시키는 다중 에이전트 위험
Mind Viruses(arXiv 2608.10218) 리뷰. 다중 에이전트에서 생각이 대화로 자기 증식하는 현상. 실측: 6명 코딩 팀에서 감염자가 콜루전, SOUL.md 수정으로 영구 감염, 시스템 프롬프트 한 줄 경고로 거의 완전 면역. 프론티어 모델 저항, 취약 모델 공개.

ContextAnyone — 참조 이미지 1장으로 캐릭터를 끝까지 지키는 영상 생성 (얼굴 너머의 외형까지)
캐릭터 일관성 유지 T2V 생성. 참조 이미지를 재구축하며 생성하는 Context-Aware 디퓨전 프레임워크. 실측: ArcFace 0.6003, VLM-Appearance 0.9457 (VACE/Phantom 대비 SOTA). Emphasize-Attention, 이중 가이던스, Gap-RoPE.

CLAUDE.md는 왜 끝없이 커지는가 — 치명적 기억 과잉(Catastrophic Remembering)
에이전트 코딩에서 프롬프트 파일이 무한정 커지는 문제를 1,867개 레포의 24.7만 인스트럭션 수명으로 실측. +226% 성장, 커밋당 +4.9개, 나이든 규칙은 삭제 불가 — 해결책은 "이유를 남기는 주석".

스킬을 압축해야 하는 이유 — SkillZip의 구조적 압축 실측 31.2%
자가진화 에이전트의 스킬 비대화 문제를 해결하는 SkillZip. 평가 없이 구조적으로 압축해 압축률 31.2%, 성능은 오히려 상승, 3.5배 빠르고 rollout 0회. 자가진화 시리즈 후속작.

LinkedIn이 운영 중인 자가진화 에이전트 — 2주 A/B 실측 +9.0pp
LinkedIn의 자가진화 고객지원 에이전트 실측 분석. 진화적 검색으로 프롬프트만 최적화(모델 재훈련 없이), 2주 프로덕션 A/B에서 QA 자가해결 +9.0pp, 라우팅 정확도 +30.6pp.

자가진화의 두 방식 — 스킬을 진화시키는 SkillProx, 에이전트를 진화시키는 Ouroboros
AI 에이전트 자가진화는 두 가지 방식으로 연구된다. 지식을 진화시키는 SkillProx와 에이전트 자신을 진화시키는 Ouroboros를 실측 수치로 비교합니다.

에이전트 스킬의 자가개선, 정적에서 동적 스킬로
SkillProx 논문이 입증한 "스킬 구조화 = 품질 향상" 원리가 어떻게 프로덕션 도구로 구현됐는지 실측 분석합니다. 24종 스킬, 8개 슬래시 커맨드, 85K★.

에이전트 스킬은 스스로 진화할 수 있을까 — SkillProx 논문의 실측 검증
2026-08-07 공개된 arXiv 논문 SkillProx(2608.07449) — 에이전트 스킬 자기진화를 실측 검증. 사람이 만든 스킬이 오히려 성능을 떨어뜨리는 역설(45.3→36.7), 검증 없는 진화는 폭락(→13.0), 닫힌 루프 검증의 가치(→54.5).

국가표준 문서 검토에 LLM을 쓴다면 — GB/T-Reviewer 논문의 실측 수치 검증
arXiv:2608.06312 실측 검증: 488개 GB/T 문서·7,306건 오류로 평가한 결과 최강 LLM(0.3280)도 전문가(0.6640)의 절반 수준이었고, GB/T-Reviewer 구조가 GPT-5.5의 CMCS를 0.3185→0.5094로 끌어올렸습니다.