AI 분석기관 아티피셜 애널리시스(AA)가 실제 스프레드시트와 문서를 활용해 분석가 역할 수행 능력을 측정하는 새 벤치마크 'AA-애널리스트에이전트'를 공개했다. 의료 지출, 무역 통계, 재무 모델링 등 14개 분야 80개 문제로 구성되며, 동일 과제를 5회 반복 수행해 모두 성공해야 통과로 인정하는 'pass^5' 지표를 핵심으로 삼는다. 첫 평가에서 클로드 오퍼스 5가 pass^5 기준 54%로 1위를 차지했고 GPT-5.5(50%)와 페이블 5(49%)가 뒤를 이었으며, 상위 3개 모델의 격차는 3개 과제 차이에 불과했다. 실패 사례 1567건을 분석한 결과 잘못된 초기 가설을 끝까지 고수하는 '앵커링'이 전체 실패의 57%를 차지해, 반복적 신뢰성이 단순 정답률보다 실무 분석 역량을 더 정확히 보여준다는 점이 확인됐다.
- •AA, 실제 자료 기반 분석가 역량을 측정하는 'AA-애널리스트에이전트' 벤치마크 공개
- •동일 과제 5회 전부 성공을 요구하는 'pass^5' 지표를 핵심 평가 기준으로 채택
- •클로드 오퍼스 5가 pass^5 54%로 1위, GPT-5.5·페이블 5가 근소한 차이로 뒤따름
- •실패 원인의 57%가 초기 잘못된 가설을 고수하는 '앵커링' 현상
- •오픈웨이트 모델 중 키미 K3가 39%로 최고, 폐쇄형 최상위 모델보다 15%p 낮아
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
실무 분석 에이전트 벤치마크 ‘AA-애널리스트에이전트’ 공개…'클로드 오퍼스 5' 1위
본문 미리보기
AI 모델이 실제 기업과 연구 현장에서 분석가 역할을 얼마나 안정적으로 수행할 수 있는지를 평가하는 새로운 벤치마크가 공개됐다. 아티피셜 애널리시스(AA)는 11일(현지시간) 실제 스프레드시트와 문서를 활용해 정량 분석 능력뿐 아니라 자료 해석과 전문적 판단, 반복 수행의 신뢰성까지 측정하는 ‘AA-애널리스트에이전트(AA-AnalystAgent)’를 발표했다.단순히 계산 문제의 정답을 맞히는 능력을 평가하는 기존 벤치마크와 달리 실제 분석 업무에 가까운 환경을 구현한 것이 특징이다. 분석가는 주어진 자료에서 필요한 정보를 찾아내는
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:23AI 초안
