구글 클라우드가 워싱턴대·노스캐롤라이나대 채플힐 연구진과 함께 정적인 AI 벤치마크 평가 환경을 능동적으로 바꾸는 프로그래밍 가능 레이어 '엔브하네스(EnvHarness)'를 공개했다. 스테이지·컨트랙트·체인 3개 플러그인과 LLM 기반 자동 설계 도구 '엔브리거'로 기존 시뮬레이터를 손대지 않고도 에이전트의 약점 구간만 정밀 타격하는 맞춤형 훈련 환경을 만든다. ALF월드·웹아레나·SWE-벤치 베리파이드 등 5개 벤치마크에 GPT-4o 기반 에이전트를 적용한 결과, SWE-벤치 작업 해결률이 49.88%에서 52.58%로 오르고 평균 실행 단계는 55.01회에서 49.61회로 줄어 효율성이 9.8% 개선됐다. 특정 모델에 종속되지 않는 범용 구조로, 소스코드는 아파치 2.0 라이선스로 오픈소스 공개됐다.
- •엔브하네스, 스테이지·컨트랙트·체인 3개 플러그인으로 기존 벤치마크를 래퍼 방식으로 감싸 능동화
- •SWE-벤치 베리파이드에서 작업 해결률 49.88%→52.58%, 실행 단계 9.8% 감소
- •ALF월드에서는 분포 외(OOD) 평가 점수가 기존 대비 9.0점 상승
- •특정 AI 모델이 아닌 벤치마크 자체에 적용되어 GPT-4o·클로드 등 어떤 에이전트에도 범용적으로 적용 가능
- •소스코드는 아파치 2.0 라이선스로 오픈소스 공개되어 기존 평가 루프에 바로 적용 가능
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
구글, 벤치마크에 '하네스' 씌웠더니…"숨겨진 AI 실력 끌어낸다"
- 1.구글, 워싱턴대 등과 벤치마크 환경을 동적으로 바꾸는 '엔브하네스' 공개, 정적 평가 한계 극복
- 2.스테이지·컨트랙트·체인 3개 플러그인과 LLM 기반 '엔브리거'로 약점 구간 맞춤 재시험 구현
- 3.SWE-벤치 베리파이드서 GPT-4o 작업 해결률 49.88%→52.58% 상승, 실행 단계 9.8% 감소
- 4.ALF월드·웹아레나 등 5개 벤치마크서 성능 개선 확인, 아파치 2.0 오픈소스로 공개
왜 중요한가?
기존 시뮬레이터·검증 도구를 그대로 유지하면서 난이도만 동적으로 조정해 AI의 숨은 실력을 끌어내는 범용 훈련 레이어로, 특정 모델에 종속되지 않는 에이전트 평가·강화학습 파이프라인의 표준이 될 잠재력이 있다.
본문 미리보기
구글 연구진이 정적인 AI 벤치마크 평가 환경을 능동적으로 바꾸는 하네스를 공개했다. 기존의 고정된 환경 대신 AI의 약점을 겨냥한 '맞춤형 훈련 환경'을 제공하자, AI 모델의 잠재력이 끌어올려지며 실제 문제 해결 능력과 처리 효율성이 크게 올라가는 결과가 확인됐다.구글 클라우드 연구진이 세인트루이스 워싱턴대학교 및 노스캐롤라이나대학교 채플힐 캠퍼스 연구진과 함께 정적인 AI 에이전트 평가 환경을 정책 학습에 맞춰 능동적으로 변경하는 프로그래밍 가능 레이어인 '엔브하네스(EnvHarness)' 연구 결과를 최근 아카이브를 통해 발
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
