MATS 연구진이 코딩 어시스턴트 클로드 코드와 코덱스를 대상으로 작업 소요 시간을 예측하고 회고하는 능력을 테스트한 결과, 두 시스템 모두 시간 감각이 매우 부정확한 것으로 나타났다. ProgramBench 등 200여 개 과제에서 두 모델은 난이도와 무관하게 약 90분을 예상했지만 실제로는 클로드가 평균 3배, 코덱스가 6~10배까지 시간을 잘못 추정했으며, 짧은 작업일수록 오차가 컸다. 같은 모델이라도 실행 환경(하네스)에 따라 행동이 달라져, 클로드 코드는 평균 90분까지 작업을 지속한 반면 코덱스는 약 30분 만에 멈추는 경향을 보였다. 두 모델은 자신의 작업 성과도 실제보다 약 20%포인트 높게 평가했지만, 경과 시간을 알려주는 도구를 제공하자 추정 정확도가 크게 개선돼 장시간 자율 작업 신뢰성을 높일 실마리를 제시했다.
- •MATS 연구진, 클로드 코드·코덱스의 작업 시간 예측·회고 능력을 200여 개 과제로 테스트
- •코덱스는 실제 대비 최대 6~10배, 클로드는 약 3배 시간을 잘못 추정, 짧은 작업일수록 오차 큼
- •같은 모델도 실행 환경(하네스)에 따라 작업 지속 시간이 크게 달라짐(클로드 코드 90분 vs 코덱스 30분)
- •두 모델 모두 자신의 성과를 실제보다 약 20%포인트 과대평가
- •경과 시간 확인 도구 제공 시 추정 정확도가 크게 향상
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
AI agents have no sense of time and are not aware of it

- 1.MATS 연구진, 클로드 코드·코덱스 대상 실험서 두 코딩 에이전트 모두 작업 소요시간 예측 실패 확인
- 2.실제 소요시간 대비 클로드는 평균 3배, 코덱스는 6~10배까지 과대 추정
- 3.같은 모델도 실행 환경(하네스)에 따라 동작 방식이 달라져, 클로드 코드가 코덱스보다 2.5배 많은 스텝 수행
- 4.경과 시간을 알려주는 도구를 제공하자 시간 판단 정확도가 크게 개선됨
왜 중요한가?
장시간 자율 작업을 지시받는 코딩 에이전트가 스스로 시간 흐름을 인지하지 못한다는 점은 '몇 시간 동안 반복하라' 같은 지시의 신뢰성을 떨어뜨리는 실질적 제약으로, 에이전트 하네스 설계에 시사점을 준다.
본문 미리보기
AI coding assistants like Claude Code and Codex have no sense of time, according to a new study. Both systematically overestimate how long tasks will take. Codex is off by as much as ten times the actual duration. They also rate their own work about 20 percentage points too high. For long, autonomous tasks, that creates a real problem with oversight. The article AI agents have no sense of time and are not aware of it appeared first on The Decoder.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:33AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
