Artificial Analysis가 사용자 자체 데이터로 맞춤형 AI 벤치마크를 만들 수 있는 플랫폼 'Optima'를 출시했다. 사용자는 자체 평가 데이터셋, 에이전트 트레이스, 또는 원하는 사용 사례 설명을 입력해 벤치마크를 구성할 수 있으며, 모델을 품질뿐 아니라 작업당 비용과 소요 시간까지 비교할 수 있다. 채점 방식은 기준표 기반 평가(기준당 0.125달러)와 쌍대비교 평가(비교당 0.375달러) 두 가지를 지원한다. 범용 벤치마크가 특정 업무 환경을 제대로 반영하지 못하는 문제를 해결하려는 시도지만, 벤치마크 설계 자체의 신뢰성 문제는 여전히 남는다.
- •Optima는 사용자의 데이터·워크플로·사용 사례 설명을 바탕으로 맞춤 벤치마크를 생성한다.
- •모델을 품질, 작업당 비용, 작업당 소요 시간 세 축으로 비교한다.
- •기준표 평가는 기준당 0.125달러, 쌍대비교 평가는 비교당 0.375달러의 실비용만 청구된다.
- •SWE-bench 등에서 스캐폴드 차이만으로 최대 15%p 성능 편차가 나는 등 기존 벤치마크의 신뢰성 문제가 배경이다.
- •445편의 벤치마크 논문 분석에서 실제 업무를 반영한 사례는 약 10%에 불과했다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Optima tackles AI benchmarking's biggest flaw by letting users test models against their own data
- 1.Artificial Analysis가 자체 데이터로 커스텀 AI 벤치마크를 만드는 플랫폼 'Optima' 출시
- 2.품질뿐 아니라 작업당 비용·시간까지 비교, 실제 비즈니스 워크플로우 기준으로 모델 선택 가능
- 3.루브릭 평가는 모델당 기준당 0.125달러, 페어와이즈 비교는 건당 0.375달러로 과금, 마크업 없이 실제 토큰 비용만 청구
- 4.445개 벤치마크 논문 분석 결과 대부분이 방법론적 결함 보유, 실제 업무 과제를 온전히 반영한 비율은 약 10%에 불과
왜 중요한가?
SWE-bench 같은 표준 벤치마크는 스캐폴드 설정만 바꿔도 최대 15%포인트 점수 차이가 나는 등 신뢰도 문제가 커진 상황에서, 자사 데이터 기반 맞춤 평가로 전환하려는 시도라는 점에서 기업의 AI 모델 도입 의사결정 방식이 바뀌고 있음을 보여준다.
본문 미리보기
Artificial Analysis has launched Optima, a platform that lets users build custom AI benchmarks from their own data and workflows. Models can be compared not just on quality but also on cost and time per task. For agent-based applications, those metrics often tell you more than raw token pricing. The article Optima tackles AI benchmarking's biggest flaw by letting users test models against their own data appeared first on The Decoder.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:17AI 초안

