ServiceNow가 음성 에이전트 평가 벤치마크 EVA-Bench를 항공 고객서비스(CSM), 기업 IT서비스(ITSM), 헬스케어 HR서비스(HRSD) 3개 도메인으로 확장한 'EVA-Bench Data 2.0'을 MIT 라이선스로 공개했다. 121개 도구에 걸친 213개 시나리오로 이전 대비 약 4배 규모이며, GPT-5.4·Gemini 3.1 Pro·Claude Opus 4.6 세 프런티어 모델로 풀이 가능성을 검증했다. 단일·다중 의도 통화와 인증 우회를 시도하는 적대적 통화를 포함하고, 각 시나리오는 정답 경로가 하나만 존재하도록 SyGra 그래프 기반 합성 파이프라인으로 생성·다단계 검증했다. NPI·FMLA·보험 등 실제 미국 헬스케어 정책에 근거했으며, 영어를 넘어 프랑스어 등 다국어 확장도 예고했다.
- •단일 도메인에서 항공(CSM)·IT서비스(ITSM)·헬스케어 HR(HRSD) 3개 도메인으로 확장, 121개 도구·213개 시나리오(약 4배)
- •GPT-5.4·Gemini 3.1 Pro·Claude Opus 4.6 세 프런티어 모델로 모든 시나리오의 풀이 가능성 검증
- •단일·다중 의도 통화와 인증 우회·권한 초과를 시도하는 적대적 통화, 해결 불가 목표까지 포함
- •SyGra 그래프 기반 합성 파이프라인으로 사용자 목표·DB 초기상태·기대 최종상태를 공동 생성해 재현성 확보
- •NPI·FMLA·보험 등 실제 미국 햬스케어 정책 근거, MIT 라이선스 오픈소스 및 다국어 확장 예고
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
EVA-Bench Data 2.0: 3 Domains, 121 Tools, 213 Scenarios
- 1.EVA-Bench 데이터셋 2.0
- 2.3개 도메인, 121개 도구
- 3.213개 시나리오 포함
왜 중요한가?
포괄적인 벤치마크 데이터셋은 다양한 작업과 실제 시나리오에서 AI 모델의 성능을 평가하고 비교하는 데 필수적입니다.
언급 프로젝트
EVA-Bench Data 2.0의 공개는 국내 AI 연구 및 개발 커뮤니티에 모델 성능 평가를 위한 중요한 자원을 제공합니다. 3개 도메인, 121개 도구, 213개 시나리오를 포함하는 방대한 데이터는 한국 AI 기업과 연구기관들이 자사 AI 모델의 실제 적용 가능성과 경쟁력을 객관적으로 검증하고 향상시키는 데 큰 도움이 될 것입니다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 21:45AI 초안

