Tag
#추론모델
이 주제로 기록된 글 1개를 모았습니다.

Qwen3.8-27B는 왜 기본값으로 '과하게 생각'할까 — 추론 토큰 폭주 실측과 끄는 법
Qwen3.8-27B(Apache 2.0, 17GB)가 기본 reasoning_effort=xhigh로 과잉 사고를 일으킨다. 펠리컨 SVG 한 장에 추론 토큰 22,276개(21분)를 쓴 실측과, 같은 Qwen 패밀리 4B 모델에서 재현한 thinking on/off 3배 토큰 차이, reasoning_effort·MTP로 끄고 빠르게 쓰는 법까지.