소규모 LLM 에이전트(Qwen3.6-27B, Qwen3-4B)에 명시적 시간 예산을 주면 MLE-Bench Lite와 Zork I 과제에서 할당된 시간을 지키지도, 남는 시간을 생산적으로 쓰지도 못하는 것으로 나타났다. 하네스가 타이밍 정보를 제공하고 데드라인을 강제하면 예산 준수율이 성능 손실 없이 크게 개선됐고, GRPO 강화학습은 Zork I에서 거의 완벽한 예산 준수를 달성했지만 MLE-Bench 성능은 향상시키지 못했다. 예산을 지키게 된 에이전트도 남는 시간을 반복 행동으로 채울 뿐 추가 성능으로 전환하지 못했으며, 여러 예산으로 학습한 GRPO는 가장 짧은 예산에 맞춘 전략으로 수렴하는 경향을 보였다. 이는 시간 예산을 지키는 능력과 그 시간을 실제로 활용하는 능력 사이에 근본적인 간극이 있음을 시사한다.
- •Qwen3.6-27B(MLE-Bench Lite)와 Qwen3-4B(Zork I)로 시간 예산 준수와 활용을 평가
- •타이밍 피드백이 없으면 에이전트가 예산을 시간 전략으로 변환하지 못함
- •하네스의 타이밍 노출과 데드라인 강제가 예산 준수율을 성능 손실 없이 개선
- •GRPO 강화학습은 Zork I에서 거의 완벽한 예산 준수를 달성했으나 MLE-Bench 성능엔 무효
- •예산을 지켜도 남는 시간을 반복 행동으로 채워 성능 향상에 실패
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
On the Clock: Towards Punctual and Productive Time-Budgeted AI Agents
- 1.소형 LLM 에이전트는 프롬프트에 시간 예산만 적어주면 행동 제어로 전환 못함을 실증
- 2.하네스가 타이머 정보를 주고 마감을 강제하면 준수 개선, GRPO는 Zork I서 거의 완벽 준수
- 3.GRPO는 훈련 때 못 본 예산에도 일반화되지만 MLE-Bench 과제 성능은 못 끌어올림
- 4.예산을 지킬 줄 알게 된 뒤에도 남는 시간을 반복 행동으로만 채우는 한계 확인
왜 중요한가?
시간 제한을 알려주는 것만으로는 효율적 운용이 되지 않아, 시간·비용 제약이 있는 에이전트 배치 시 하네스 설계와 보상 구조 모두를 신경 써야 함을 시사한다.
본문 미리보기
arXiv:2610.10833v1 Announce Type: new Abstract: We study whether small LLM agents can operate effectively under explicit wall-clock time budgets by both respecting the allocated runtime and using available time productively. We evaluate Qwen3.6-27B on five competitions from MLE-Bench Lite and Qwen3-4B on Zork I (Jericho), two agentic benchmarks where additional computational time can meaningfully improve performance. In the simplest setting, where the budget is stated only in the prompt, agents
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안



![[Tech Insight] "AI 해킹, 보안 문제로만 보는 건 위험한 착각"](https://cdn.digitaltoday.co.kr/news/photo/202610/706229_653947_485.jpg)