Archive
글 목록 2페이지
57개 글 중 16번째부터 표시합니다.

같은 실증을 외치는 두 AI 해커, Strix와 Shannon은 왜 반대로 설계됐나
Strix(런타임 다이내믹)와 Shannon(소스코드 선행)은 둘 다 "검증된 PoC만 리포트"라 주장하는 AI 펜테스터다. 같은 슬로건인데 구현이 반대인 이유를 설계 철학·오탐 커버리지·실측 기준으로 정리한다.

AI가 코드를 너무 많이 쓴다 — Ponytail과 최소 수정의 실측
Ponytail은 "가장 게으른 시니어 개발자처럼 사고하라"는 에이전트 스킬로, 벤치마크상 코드 줄 수 -54%를 실측했다. 이 스킬이 다루는 과잉수정을 NUS 논문(arXiv 2609.04061)이 통제 실험으로 측정한 결과를 겹쳐, 왜 프롬프트가 작동하고 어디까지이며 견고한 해법이 RL 학습인지를 정리한다.

LLM 판정기의 안정성을 재기 전에, 계측기부터 재야 한다 — 5만 2천 회 감사가 밝힌 것
LLM 판정기(judge)를 그대로 신뢰하면 안 되는 이유를 arXiv 2609.04198이 52,988회 재실행 감사로 실측했다. 같은 요청을 두 번 보내도 순위가 달라지고(스칼라는 안정·랭킹은 붕괴), 샘플링을 늘려도(최대 74만 콜) 통과율 0/500, 제공자 4곳 모두 같은 바닥을 공유한다. 결론은 "판정 게이트를 얼리기 전에 계측기부터 잡아라"는 설계 규율 8가지와 실행 체크리스트.

AutoGraphForge — AI가 그래프 이론을 자동으로 찾아내고 증명한다
그래프 정리를 발견·반례·증명까지 자동화하는 파이프라인 AutoGraphForge(arXiv 2609.03478). 348K 그래프에서 6,522개 추측을 걸러내고 Lean 4로 형식 검증. 아이디어→검증 루프 설계 사례.

httpx2, 한 번에 보안 권고 5건 — pydantic 차세대 HTTP 클라이언트 코드를 까보니
pydantic의 차세대 HTTP 클라이언트 httpx2가 하루에 보안 권고 5건을 낸 이유. 요청 스머글링·압축 폭탄(64KiB→64MiB)·SOCKS5 평문 WebSocket까지 코드를 까고, 2.12.0 업그레이드·대안을 정리했습니다.

AI 에이전트의 안전성, 점진적 검증으로 풀다 — Progressive Validation 프레임워크
2026-01-09 arXiv 논문 기반 — AI 에이전트의 안전성을 점진적 검증으로 달성하는 Three-Pillar Model (투명성·책임성·신뢰성)

코딩 에이전트가 영상을 편집한다 — video-use가 45M 토큰을 12KB로 줄인 방법
browser-use 팀의 오픈소스 video-use는 LLM이 영상 프레임을 보는 대신 12KB짜리 구조화 대본을 읽도록 설계했다. 45M 토큰의 노이즈를 12KB 텍스트로 압축하는 원리와, 12개의 하드 룰이 방지하는 조용한 실패를 해부합니다.

자가개선은 되긴 한다 — 다만 검증 게이트가 있을 때만 (Phantom Gains vs Recuris)
Phantom Gains는 측정 게이트 없는 자가개선이 유령 이득임을 실측했다. Recuris(2608.24876)는 검증 게이트와 실패 국소화를 갖춘 자가개선이 tau-bench +17.8pt를 달성함을 보였다. 차이는 전제조건이다.

GPT-5.6-Cyber가 Chrome V8 제로데이를 발견하다 — OpenAI Daybreak이 여는 AI 보안의 새로운 국면
OpenAI GPT-5.6-Cyber가 Chrome V8에서 실제 제로데이(CVE-2026-15903)를 발견했다. Advanced Cybersecurity Completion Rate 95%, Daybreak 858개 이슈, Astra Critical 임계값 일시 중단까지 — AI 보안의 새로운 국면을 실측 데이터로 정리한다.

agent.md로 LLM 코딩 품질을 끌어올리는 법 — 반복하는 코딩 지시를 파일로 저장한다
LLM 코딩은 속도는 빠르지만 코드가 스파게티다. Fabien Sanglard가 agent.md에 반복하는 코딩 지시를 저장해 품질을 손코딩 수준으로 끌어올렸다. 스타일은 잡되 정확성은 사람이 검증.

벡터 RAG와 FTS5 RAG는 대체재가 아니라 협력자 — 최신 실측이 밝힌 덴스와 스파스의 역할
DESA 논문(arXiv 2608.15851)이 실측: 벡터는 의미를 확장하고 FTS5는 정확 앵커를 잡는다. 하이브리드가 nDCG@10 +3.82%, 접근 깊이 -36%를 달성. SQLite FTS5 하이브리드가 실용적.

MCP가 도구 연결 표준에서 에이전트 운영 표준으로 진화한다 — 2026 로드맵이 바꾸는 것
MCP 2026-07-28 릴리스와 새 로드맵은 세션 제거(stateless), 에이전트 ID 보안, 서버 발신 이벤트로 도구 연결을 넘어 에이전트 운영 표준으로 확장된다.

에이전트가 기억하는 것은 거짓말을 영구적으로 당한다는 뜻 — 메모리 중독 공격의 실측
코퍼스의 1.2% 거짓 주입만으로 에이전트 메모리 가치 2/3가 사라진다(정확도 0.850→0.300). 내용 필터는 거짓 기억 360개 중 0개를 거부했다(arXiv 2608.21230).

Hermes Agent로 자율 공격 보안 에이전트를 만들다 — Cybermes가 해결한 보안 스캐너의 노이즈 문제
Cybermes는 Hermes Agent로 구동되는 자율 보안 에이전트다. Zero-False-Positive 게이트, 토큰 70~85% 절약, 자율 추론 루프로 전통 스캐너의 노이즈 문제를 해결한다.

Claude의 BuzzFeed 말투를 고치려면 다른 AI로 번역해야 한다 — NoBuzz가 드러낸 AI 슬롭의 실체
Claude의 과장된 말투(load-bearing assumption, the kicker)는 프롬프트로 안 고쳐진다. NoBuzz는 다른 모델(Gemini)로 번역해 말투를 걷어낸다. AI 슬롭이 생각보다 뿌리 깊다는 실측.