Terminus-4B는 에이전트 터미널 실행 과제를 위해 Qwen3-4B를 SFT와 RL로 후훈련한 소형 특화 언어 모델이다. SWE-Bench Pro 등 다양한 벤치마크 평가 결과, 에이전트 성능을 유지하면서 메인 에이전트의 토큰 사용량을 최대 30% 감소시켰다. Claude Sonnet/Opus, GPT-5.3-Codex 등 프론티어 모델과의 격차를 좁히거나 초과하는 성능을 보여 소형 특화 모델이 일부 에이전트 서브태스크에서 프론티어 모델을 대체 가능함을 입증했다.
- •Terminus-4B는 에이전트 터미널 실행에 특화해 Qwen3-4B를 SFT와 RL로 훈훈련한 4B 규모 소형 언어 모델이다.
- •메인 에이전트 성능을 유지하면서 토큰 사용량을 최대 30%까지 감소시켰다.
- •SWE-Bench Pro와 내부 SWE-Bench C# 벤치마크에서 Claude Sonnet/Opus, GPT-5.3-Codex와 경쟁하거나 초과하는 성능을 보였다.
- •소형 특화 서브에이전트가 프론티어 모델을 대체할 수 있다는 가능성을 실증적으로 입증했다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Terminus-4B: Can a Smaller Model Replace Frontier LLMs at Agentic Execution Tasks?
- 1.Qwen3-4B를 SFT·RL로 훈련한 Terminus-4B는 에이전틱 터미널 실행 용 서브에이전트 특화 모델
- 2.주에이전트 토큰 사용량을 기준선 대비 ~30% 절감, SWE-Bench Pro 등 성능 지표 유지
- 3.Claude Sonnet/Opus, GPT-5.3-Codex 등 프론티어 모델과 동등 혹은 초과 성능 일부 확인
왜 중요한가?
소형 특화 모델이 비용이 큰 프론티어 모델을 코딩 에이전트의 서브에이전트 역할에서 대체할 수 있음을 보여줘, 에이전트 시스템의 비용 효율 설계에 중요한 참고점이 된다.
언급 프로젝트
본문 미리보기
arXiv:2605.03195v1 Announce Type: new Abstract: Modern coding agents increasingly delegate specialized subtasks to subagents, which are smaller, focused agentic loops that handle narrow responsibilities like search, debugging or terminal execution. This architectural pattern keeps the main agent's context window clean by isolating verbose outputs (e.g. build logs, test results, etc.) within the subagent context. Typically when agents employ subagents for such tasks, they use frontier models as
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:12AI 초안

