Column
스타 33,240개 받은 DeepSeek 코딩 에이전트 Reasonix, 하루 종일 써보니 — 캐시 99.8%는 진짜였고, 코딩 품질은 아니었다
DeepSeek 전용 코딩 에이전트 Reasonix를 하루 종일 서브에이전트로 써본 실측: 캐시 히트 99.82%와 $3 미만 비용은 진짜였지만, 코딩 품질은 기대 이하였습니다.

핵심 요약
- Reasonix는 DeepSeek API 전용으로 설계된 터미널 코딩 에이전트입니다. 멀티 프로바이더를 지원하지 않는 대신, DeepSeek prefix-cache 안정성 하나에 루프 전체를 맞춘 구조입니다.
- GitHub 실측(2026-08-09 확인): 별 33,240개, 포크 2,148개, 열린 이슈 980개. 생성(2026-04-21) 후 110일 만이라 일평균 약 +302개씩 증가했습니다.
- 캐시 성능은 README 주장 그대로입니다. 실사용 케이스(2026-05-01)는 하루 4억 3,500만 입력 토큰 중 99.82% 캐시 히트를 기록했고, 같은 작업을 캐시 없이 돌리면 약 $61이 들 일을 $1.38에 처리했습니다.
- 비용은 직접 사용 결과도 정말 저렴했습니다. 하루 종일 서브에이전트로 돌려도 $3 미만이었고, 이는 곧 캐시율이 그만큼 좋았다는 뜻입니다.
- 다만 코딩 품질은 기대 이하였습니다. 답변은 잘 내지만 수정을 엉뚱하게 하는 경우가 있었고, Reddit 사용기도 "프로젝트 중간에 선로를 이탈한다"고 지적합니다.
- 결론: 캐시 효율과 비용이 우선이라면 강력한 선택지, 코드 수정 품질이 최우선이라면 다른 도구와 비교가 필요합니다.
DeepSeek API가 저렴해서 좋은데, 이걸 제대로 쓸 만한 전용 CLI가 없어 아쉬웠던 사람 — 이 글은 그런 사람을 위해 썼습니다. OpenAI에는 Codex, Anthropic에는 Claude Code가 있지만 DeepSeek에는 공식 코딩 에이전트가 없었고, 그래서 Reasonix(33,240★) 같은 서드파티 도구에 관심이 몰렸습니다.
다만 "API가 저렴하다"는 것과 "실제로 저렴하게 쓴다"는 것은 다른 문제입니다. DeepSeek v4-flash 기준 입력 토큰은 캐시 미스일 때 100만 개당 $0.14, 캐시 히트일 때 $0.0028입니다. 에이전트는 매 턴 대화 이력 전체를 다시 보내기 때문에, 캐시가 깨지면 이력이 길수록 미스 비용이 계속 쌓입니다. 실제로 이 저장소의 실사용 케이스는 하루 입력 토큰 4억 3,500만 개 중 99.82%를 캐시 히트로 처리했고, 이를 통해 약 $60을 아꼈습니다. DeepSeek v4-flash 기준 입력 토큰은 캐시 미스일 때 100만 개당 $0.14, 캐시 히트일 때 $0.0028입니다. 에이전트는 매 턴 대화 이력 전체를 다시 보내기 때문에, 캐시가 깨지면 이력이 길수록 미스 비용이 계속 쌓입니다. 실제로 이 저장소의 실사용 케이스는 하루 입력 토큰 4억 3,500만 개 중 99.82%를 캐시 히트로 처리했고, 이를 통해 약 $60을 아꼈습니다.
이 글은 이런 비용 문제를 설계로 해결하려는 DeepSeek 전용 코딩 에이전트 Reasonix를, 실제로 써본 경험을 기준으로 검증합니다. 캐시와 비용 주장이 진짜인지, 대신 무엇을 포기했는지를 실측 데이터로 정리했습니다.
왜 지금 주목받나
Reasonix는 2026년 4월 21일에 생성된 저장소입니다. GitHub API 실측 기준 2026-08-09 현재 별 33,240개, 포크 2,148개, 열린 이슈 980개를 기록하고 있습니다. 생성 후 110일이 지났으니 일평균 스타 증가는 약 302개로, 커뮤니티 관심이 빠르게 몰린 프로젝트입니다.
릴리즈도 활발합니다. 최신 안정판은 v1.21.3(2026-08-08)으로, 그 전날인 8월 7일에도 v1.21.1, v1.21.2가 연달아 나왔습니다. 마지막 푸시가 확인 당일(2026-08-09)일 만큼 개발이 진행 중입니다.
oosmetrics Health Check는 이 저장소를 "Agents 부문 개발 속도 2위, LLMs·CLI 부문 3위"로 표시하고 있습니다.
Reasonix란 무엇인가
Reasonix는 DeepSeek 전용 AI 코딩 에이전트입니다. README의 한 줄 정의는 "DeepSeek-native AI coding agent for your terminal"입니다.
특징은 설계 철학에 있습니다. README는 "캐시 안정성은 켜는 기능이 아니라, 루프가 설계된 불변식(invariant)"이라고 설명합니다. 멀티 프로바이더를 지원하는 대신 DeepSeek 하나에 맞추고, DeepSeek prefix-cache가 안정적으로 동작하도록 네 가지 메커니즘을 구현했습니다.
- ImmutablePrefix: 시스템 프롬프트와 도구 스펙을 세션 시작 시 고정해 매 턴 같은 바이트 시퀀스를 유지
- AppendOnlyLog: 대화 이력을 추가만 하고 재정렬·수정을 하지 않음
- VolatileScratch: 사고 과정(chain-of-thought)을 캐시된 프리픽스 밖에 두어 다음 히트를 오염시키지 않음
설치는 npm 한 줄입니다. Node 22 이상이 필요합니다.
# 설치
npm install -g reasonix
# 프로젝트에서 실행
reasonix code my-project
# 짧은 별칭으로도 실행 가능
dsnix code my-project
잠깐, prefix-cache가 뭐예요?
DeepSeek는 같은 프리픽스(대화 앞부분)를 다시 보내면 그 부분을 캐시 히트 가격으로 청구합니다. 에이전트 루프에서는 매 턴 대화 이력 전체를 다시 전송하므로, 앞부분이 조금이라도 바뀌면(예: 사고 과정이 중간에 끼어들면) 그 뒤 전체가 캐시 미스가 됩니다. 그래서 "캐시를 깨지 않게 이력을 다루는 설계"가 에이전트 비용의 핵심이 됩니다. Reasonix의 위 메커니즘 3개는 전부 이 한 가지 목표를 위한 것입니다.
주장 vs 실측: 캐시는 진짜였다
README의 핵심 수치는 실사용 케이스 스터디에 있습니다. 실제 사용자가 공유한 2026-05-01 하루 DeepSeek 대시보드 기준입니다.
| 항목 | 수치 |
|---|---|
| 입력 토큰 (캐시 히트) | 435,033,856 |
| 입력 토큰 (캐시 미스) | 767,616 |
| 출력 토큰 | 179,763 |
| 캐시 히트율 (입력 기준) | 99.82% |
이 수치를 DeepSeek v4-flash 가격(캐시 히트 $0.0028/1M, 미스 $0.14/1M, 출력 $0.28/1M)에 대입하면, 이 사용자는 하루 $1.38을 썼고 같은 작업을 캐시 없이 돌렸다면 $61.06이 들었을 것입니다. 약 97.7% 절감입니다.
이 주장이 마케팅이 아닌지 의심된다면, 직접 사용 결과가 가장 확실한 반증입니다. 하루 종일 서브에이전트로 사용했을 때 $3 미만이 나왔습니다. 대화 이력이 길어지고 반복 작업이 많을수록 캐시 히트가 누적되므로, "캐시율이 그만큼 좋았다"는 것이 비용 데이터로 확인됩니다.
주장 vs 실측: 코딩 품질은 기대 이하
문제는 코딩 품질입니다. README는 성능을 직접 주장하지 않지만, "coding agent"라는 이름과 비교표의 위치는 품질에 대한 기대를 만들게 합니다. 실제 사용에서는 답변은 잘 내는데 수정을 엉뚱하게 하는 경우가 반복됐습니다.
이는 개인 경험만이 아닙니다. Reddit r/DeepSeek 사용기도 "Reasonix는 끔찍했다. 주로 프로젝트 실행 중간에 선로를 이탈(goes off the rails)한다"고 평가합니다. Hacker News 스레드에서는 "OpenCode와 함께 쓰면 괜찮았다", "그렇게 나쁘진 않다"는 온건한 반응도 있지만, 전반적으로 코드 품질을 극찬하는 반응은 찾기 어렵습니다.
벤치마크도 확인했습니다. 저장소에는 SWE-bench Verified 서브셋과 자체 e2e 태스크 스위트(44개 태스크)가 커밋되어 있지만, 실제 pass rate 결과 수치는 README나 벤치마크 문서에 공개되어 있지 않습니다. 측정 인프라는 정교한데 결과값은 공개하지 않는 상태입니다.
README의 non-goals 섹션도 이 맥락을 반영합니다. "Claude Opus가 일부 벤치마크에서는 여전히 이긴다. PhD 증명 같은 작업이 아니라 auth 버그 수정 같은 작업에 맞다"고 명시하고 있습니다.
비교표
| Reasonix | Claude Code | Cursor | Aider | |
|---|---|---|---|---|
| 백엔드 | DeepSeek | Anthropic | OpenAI/Anthropic | OpenRouter 등 |
| 라이선스 | MIT | 클로즈드 | 클로즈드 | Apache 2 |
| 비용 프로필 | 작업당 저렴 | 프리미엄 | 구독+사용량 | 환경 의존 |
| DeepSeek prefix-cache | 설계 기준 | 해당 없음 | 해당 없음 | 부수적 |
| 임베디드 웹 대시보드 | 있음 | 없음 | 없음 | 없음 |
출처: README 비교표
주의사항
- DeepSeek 전용입니다. 다른 모델로 바꿀 수 없습니다. DeepSeek API가 필요하고, API 키 없이는 동작하지 않습니다.
- IDE 통합이 없습니다. 터미널 우선 설계이며 diff는 git diff, 파일 트리는 ls가 기본입니다.
- 데스크톱 클라이언트는 프리릴리즈입니다. 같은 루프를 쓰지만 UI는 다듬는 중이고 인스톨러는 코드사인되지 않았습니다.
- 성능 수치가 미공개입니다. 캐시 수치는 공개되어 있지만, 코딩 정확도 벤치마크(pass rate)는 공개되지 않았습니다.
실무 시나리오 3가지
실제 사용 경험을 세 가지 시나리오로 나눠 정리하면 이렇습니다.
시나리오 1: 하루 종일 서브에이전트로 돌리는 경우 백그라운드에서 계속 태스크를 시키고 결과만 받아보는 방식입니다. 하루 종일 돌려도 $3 미만이 나왔고, 이는 캐시가 세션 내내 유지됐다는 뜻입니다. 대화 이력이 길어질수록 유리한 구조라, 장시간 자동화에는 가장 적합한 사용법입니다.
시나리오 2: 반복적인 리팩토링·수정 작업 코드베이스를 고쳐달라고 시키면 답변은 정상적으로 옵니다. 다만 수정 방향이 어긋나는 경우가 반복됐습니다. 한 파일을 고치라고 했는데 연관된 부분을 엉뚱하게 바꾸거나, 의도와 다른 방식으로 고치는 식입니다. 결과물을 꼭 검토해야 하는 시나리오입니다.
시나리오 3: 코드 품질 검증이 중요한 작업 정확도가 생명인 작업(예: 보안 수정, API 계약 변경)에는 신중해야 합니다. 저장소에 SWE-bench 서브셋이 커밋되어 있지만 실제 pass rate 수치는 공개되지 않았고, README도 "Claude Opus가 일부 벤치마크에서는 여전히 이긴다"고 명시합니다. 검증이 필요한 작업에는 병행 평가가 권장됩니다.
누구에게 맞나
- 비용과 장시간 세션 운영이 우선이라면: 추천합니다. 하루 종일 돌려도 $3 미만인 것은 실측으로 확인됐고, 캐시 설계가 이를 뒷받침합니다.
- 코드 수정 품질이 최우선이라면: 다른 도구와 함께 평가가 필요합니다. 엉뚱한 수정이 반복되면 오히려 검토 시간이 늘어날 수 있습니다.
- 멀티 모델을 쓰고 있다면: Reasonix는 애초에 대상이 아닙니다. OpenCode·Aider처럼 프로바이더를 바꿀 수 있는 도구가 맞습니다.
자주 묻는 질문
Reasonix는 무료인가요? 도구 자체는 MIT 오픈소스지만, DeepSeek API 키가 필요하므로 API 사용 비용은 발생합니다.
캐시 히트율은 항상 99%인가요? 아닙니다. 99.82%는 장시간 세션의 실사용 케이스입니다. 짧은 대화나 세션을 자주 새로 시작하면 히트율은 낮아집니다.
Claude Code 대신 써도 되나요? 예산이 제약이라면 시도할 만합니다. 다만 코드 품질 기준이 높은 작업이라면 두 도구를 같은 작업에 대입해 비교해보는 것이 안전합니다.