Tag
#AI 글 목록 2페이지
52개 글 중 16번째부터 표시합니다.

AutoGraphForge — AI가 그래프 이론을 자동으로 찾아내고 증명한다
그래프 정리를 발견·반례·증명까지 자동화하는 파이프라인 AutoGraphForge(arXiv 2609.03478). 348K 그래프에서 6,522개 추측을 걸러내고 Lean 4로 형식 검증. 아이디어→검증 루프 설계 사례.

AI 에이전트의 안전성, 점진적 검증으로 풀다 — Progressive Validation 프레임워크
2026-01-09 arXiv 논문 기반 — AI 에이전트의 안전성을 점진적 검증으로 달성하는 Three-Pillar Model (투명성·책임성·신뢰성)

자가개선은 되긴 한다 — 다만 검증 게이트가 있을 때만 (Phantom Gains vs Recuris)
Phantom Gains는 측정 게이트 없는 자가개선이 유령 이득임을 실측했다. Recuris(2608.24876)는 검증 게이트와 실패 국소화를 갖춘 자가개선이 tau-bench +17.8pt를 달성함을 보였다. 차이는 전제조건이다.

GPT-5.6-Cyber가 Chrome V8 제로데이를 발견하다 — OpenAI Daybreak이 여는 AI 보안의 새로운 국면
OpenAI GPT-5.6-Cyber가 Chrome V8에서 실제 제로데이(CVE-2026-15903)를 발견했다. Advanced Cybersecurity Completion Rate 95%, Daybreak 858개 이슈, Astra Critical 임계값 일시 중단까지 — AI 보안의 새로운 국면을 실측 데이터로 정리한다.

agent.md로 LLM 코딩 품질을 끌어올리는 법 — 반복하는 코딩 지시를 파일로 저장한다
LLM 코딩은 속도는 빠르지만 코드가 스파게티다. Fabien Sanglard가 agent.md에 반복하는 코딩 지시를 저장해 품질을 손코딩 수준으로 끌어올렸다. 스타일은 잡되 정확성은 사람이 검증.

벡터 RAG와 FTS5 RAG는 대체재가 아니라 협력자 — 최신 실측이 밝힌 덴스와 스파스의 역할
DESA 논문(arXiv 2608.15851)이 실측: 벡터는 의미를 확장하고 FTS5는 정확 앵커를 잡는다. 하이브리드가 nDCG@10 +3.82%, 접근 깊이 -36%를 달성. SQLite FTS5 하이브리드가 실용적.

MCP가 도구 연결 표준에서 에이전트 운영 표준으로 진화한다 — 2026 로드맵이 바꾸는 것
MCP 2026-07-28 릴리스와 새 로드맵은 세션 제거(stateless), 에이전트 ID 보안, 서버 발신 이벤트로 도구 연결을 넘어 에이전트 운영 표준으로 확장된다.

에이전트가 기억하는 것은 거짓말을 영구적으로 당한다는 뜻 — 메모리 중독 공격의 실측
코퍼스의 1.2% 거짓 주입만으로 에이전트 메모리 가치 2/3가 사라진다(정확도 0.850→0.300). 내용 필터는 거짓 기억 360개 중 0개를 거부했다(arXiv 2608.21230).

Hermes Agent로 자율 공격 보안 에이전트를 만들다 — Cybermes가 해결한 보안 스캐너의 노이즈 문제
Cybermes는 Hermes Agent로 구동되는 자율 보안 에이전트다. Zero-False-Positive 게이트, 토큰 70~85% 절약, 자율 추론 루프로 전통 스캐너의 노이즈 문제를 해결한다.

Claude의 BuzzFeed 말투를 고치려면 다른 AI로 번역해야 한다 — NoBuzz가 드러낸 AI 슬롭의 실체
Claude의 과장된 말투(load-bearing assumption, the kicker)는 프롬프트로 안 고쳐진다. NoBuzz는 다른 모델(Gemini)로 번역해 말투를 걷어낸다. AI 슬롭이 생각보다 뿌리 깊다는 실측.

하네스 하나로 단시간 자가개선은 일어나지 않는다 — Phantom Gains가 밝힌 유령 이득
자가개선은 실재하지만, 대조군 없이 측정하면 7가지 경로로 유령 이득(phantom gains)이 생긴다(arXiv 2608.20290). 하네스 하나로 단시간 자가개선은 측정 artifact다.

AI가 숙제 점수는 올렸지만 시험 점수는 떨어뜨렸다 — AI 의존 학습의 실측
AI를 써서 숙제를 한 학생은 숙제 점수가 18% 올랐지만 시험에서 20% 낮은 점수를 받았다(Economist). AI는 학습의 증폭기다 — 답을 주는 도구로 쓰면 학습이 사라지고, 튜터로 쓰면 유지된다.

Grok Bot 열풍의 실체 — computer-use의 포장, OpenBot의 인기, Manus의 침묵
Grok Bot(8/11) 열풍의 실체를 파헤친다. "컴퓨터 한 대"는 Linux VM+browser-use의 상용 포장. OpenClaw(386K★)·Hermes(232K★)가 이미 하던 일. OpenBot 인기는 CopilotKit 브랜드+AG-UI 창시자 덕. Manus는 Meta 인수→중국 차단→독립 재개. 기술 스택 비교(폐쇄형은 비공개 표기).

GitHub이 무너진 날, 머스크의 Cursor가 Origin을 출시했다 — 에이전트 시대의 코드 호스팅 경쟁
8/17 GitHub critical 장애 그날, 머스크의 Cursor가 자체 코드 호스팅 Origin 출시. 에이전트 떼가 초당 22.6커밋 찍는 시대의 코드 호스팅 경쟁. 전 GitHub CEO Entire($60M), AI 학습 반대 Monohub, Google Git 태그→Drive까지 — 게이트키퍼 교체의 실체.

CIMemories — LLM 지속 메모리가 맥락을 무시하고 정보를 새는 문제
Bruce Schneier가 소개한 CIMemories(arXiv 2511.14937) 실측: 프론티어 모델 최대 69% 속성 위반, 태스크 1→40에서 GPT-5 위반률 0.1%→9.6%, 같은 프롬프트 5회 실행 시 25.1%. 프라이버시 프롬프팅은 과일반화로 실패.