Tag

#AI

이 주제로 기록된 글 50개를 모았습니다.

GPT-6 Astra와 함께 프롬프트가 과잉이 된 이유 대표 이미지

Column

GPT-6 Astra와 함께 프롬프트가 과잉이 된 이유

GPT-6 Astra는 기존 두꺼운 프롬프트·스킬 파일이 오히려 작업을 차단한다고 OpenAI가 경고한다. 의도는 또렷하게, 절차는 최소로, 결정 경계만 명시하는 방식으로 프롬프트·스킬·Codex 컨텍스트 압축(config.toml)을 재설계하는 법을 기존 문구와 수정 문구 대조로 정리했다.

AI가 코드를 너무 많이 쓴다 — Ponytail과 최소 수정의 실측 대표 이미지

Column

AI가 코드를 너무 많이 쓴다 — Ponytail과 최소 수정의 실측

Ponytail은 "가장 게으른 시니어 개발자처럼 사고하라"는 에이전트 스킬로, 벤치마크상 코드 줄 수 -54%를 실측했다. 이 스킬이 다루는 과잉수정을 NUS 논문(arXiv 2609.04061)이 통제 실험으로 측정한 결과를 겹쳐, 왜 프롬프트가 작동하고 어디까지이며 견고한 해법이 RL 학습인지를 정리한다.

LLM 판정기의 안정성을 재기 전에, 계측기부터 재야 한다 — 5만 2천 회 감사가 밝힌 것 대표 이미지

Column

LLM 판정기의 안정성을 재기 전에, 계측기부터 재야 한다 — 5만 2천 회 감사가 밝힌 것

LLM 판정기(judge)를 그대로 신뢰하면 안 되는 이유를 arXiv 2609.04198이 52,988회 재실행 감사로 실측했다. 같은 요청을 두 번 보내도 순위가 달라지고(스칼라는 안정·랭킹은 붕괴), 샘플링을 늘려도(최대 74만 콜) 통과율 0/500, 제공자 4곳 모두 같은 바닥을 공유한다. 결론은 "판정 게이트를 얼리기 전에 계측기부터 잡아라"는 설계 규율 8가지와 실행 체크리스트.