엔비디아 연구에 따르면 AI 에이전트의 장기 과제 수행 성능은 모델 자체보다 이를 감싸는 '하니스(harness)' 설계에 더 크게 좌우된다. 연구팀은 자체 개발한 하니스 AVO에 '감독자' 컴포넌트를 결합해 클로드 오퍼스 5의 ARC-AGI-3 벤치마크 점수를 하니스 없을 때 30%였던 것을 100%까지 끌어올렸다. OpenAI도 유사한 방식으로 자사 모델 점수를 세 배로 높였지만 100%에는 도달하지 못했다. 데이터브릭스가 지난 7월 발표한 "하니스가 비용에 더 큰 영향을 미친다"는 연구와 함께, 에이전트 성능의 핵심이 모델 선택보다 오픈 하니스 설계에 있음을 시사한다.
- •엔비디아 하니스 AVO 적용 시 클로드 오퍼스 5가 ARC-AGI-3 벤치마크에서 30%→100%로 상승
- •하니스는 메모리·컨텍스트·피드백을 관리하며 '감독 에이전트'가 메인 에이전트의 이탈을 교정
- •OpenAI도 하니스 설정 조정만으로 점수를 3배 높였으나 100%에는 못 미침
- •데이터브릭스 CEO는 동일 모델도 하니스에 따라 비용이 2배까지 차이 날 수 있다고 언급
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Nvidia just showed that the harness, not the AI model, is now the real hero

- 1.엔비디아, 커스텀 하니스와 감독자 구조로 Opus 5의 ARC-AGI-3 점수를 30%→100%로 향상
- 2.하니스 없이 Opus 5는 30%로 테스트 모델 중 최고치, AVO 하니스 적용 시 완벽한 점수 달성
- 3.OpenAI도 하니스 설정 조정만으로 ARC-AGI-3 점수를 10% 미만에서 3배로 끌어올렸지만 100%에는 못 미침
- 4.데이터브릭스 CEO 아리 고드시는 동일 모델도 하니스에 따라 비용이 최대 2배 차이 날 수 있다고 언급
왜 중요한가?
장기 과제 수행형 AI 에이전트 성능의 핵심 변수가 모델 자체보다 툴·메모리·감독 로직을 아우르는 '하니스' 설계에 있다는 것을 실증적으로 보여줘, 에이전트 개발 전략의 우선순위를 모델 선택에서 오케스트레이션 설계로 옮길 근거를 제공한다.
본문 미리보기
Nvidia research shows that AI agents can perform well, and not go off the deep end, through fine-tuning, even if the AI model isn't that great at the task.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:53AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
