엔비디아가 21일 범용 AI 에이전트 기술 'AVO'가 ARC-AGI-3 벤치마크에서 25개 환경 183개 레벨을 전부 완주하며 RHAE 100%를 기록했다고 발표했다. 핵심은 LLM 자체 성능이 아니라 지속적인 메모리와 감독 체계를 갖춘 '하네스' 구조로, GPU 커널 최적화에서도 cuDNN 대비 최대 3.5%, 플래시어텐션-4 대비 최대 10.5% 빠른 성능을 구현했다. AVO는 총 6624회의 행동만으로 기존 VISTA 시스템(7542회)보다 약 12% 적게 움직여 문제를 해결했으며, 클로드 오퍼스 5와 GPT-5.6 솔 등 서로 다른 모델과도 결합해 작동했다. 엔비디아는 코딩과 GPU 최적화를 넘어 다양한 장기 자율 작업 영역으로 AVO를 확장할 계획이다.
- •AVO는 ARC-AGI-3 벤치마크 25개 환경 183개 레벨을 전부 완주, RHAE 100% 달성
- •어텐션 커널 최적화에서 cuDNN 대비 최대 3.5%, 플래시어텐션-4 대비 최대 10.5% 빠른 성능 구현
- •기존 VISTA 시스템보다 약 12% 적은 6624회 행동으로 문제 해결
- •클로드 오퍼스 5, GPT-5.6 솔 등 모델에 종속되지 않는 범용 하네스 구조
- •엔비디아, 코딩·GPU 최적화 넘어 장기 자율 작업 전반으로 AVO 확장 계획
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
"LLM보다 하네스가 핵심"…엔비디아 AVO, 장기 자율 AI 에이전트 가능성 입증

- 1.엔비디아 AVO, ARC-AGI-3 벤치마크서 25개 환경 183개 레벨 전부 완주해 RHAE 100% 기록
- 2.GPU 커널 최적화서 7일간 500여개 방향 탐색해 40개 코드 구현, cuDNN 대비 최대 3.5% 빠른 성능
- 3.지속 메모리·감독 시스템으로 작업 정체 감지, 기존 VISTA 대비 약 12% 적은 행동으로 목표 달성
- 4.클로드 오퍼스 5와 GPT-5.6 솔 등 모델 교체해도 동일 작동하는 범용 하네스 구조 입증
왜 중요한가?
단일 모델 성능이 아니라 메모리·감독 기능을 갖춘 '하네스' 구조가 장기 자율 에이전트의 범용성을 좌우한다는 것을 실증해, GPU 최적화부터 미지의 게임 환경까지 이종 작업에 동일 시스템을 적용할 수 있음을 보여줬다.
본문 미리보기
엔비디아가 단순히 한 번 질문에 답하고 끝나는 AI를 넘어, 오랜 시간 스스로 계획을 세우고 실행하며 시행착오를 거쳐 문제를 해결하는 범용 AI 에이전트 기술의 뛰어난 성능을 입증했다. 이번 성과의 핵심은 단순한 모델 차원의 성능이 아니라, AI를 지속적으로 제어하고 관리하는 ‘하네스(Harness)’ 시스템 구조에 있었다.엔비디아는 21일(현지시간) 지난 3월 공개한 범용 AI 에이전트 기술 ‘에이전틱 베리에이션 오퍼레이터(AVO)’가 규칙이나 목표가 주어지지 않은 낯선 환경을 탐색해 문제를 해결하는 ‘ARC-AGI-3’ 공개 벤
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
