알리바바의 신모델 큐원3.8 맥스가 아티피셜 애널리시스 인텔리전스 인덱스에서 56점을 기록해 전작(46점) 대비 10점 올랐고, 이는 클로드 오퍼스 4.8과 동급이지만 25% 저렴한 키미 K3(57점)에는 여전히 못 미친다. 업무형 작업 벤치마크 GDPval-AA에서는 1739 Elo로 키미 K3(1685)를 앞섰으나 클로드 오퍼스 5(1852)에는 미치지 못했다. 다만 성능 향상의 대가로 작업당 필요 단계 수가 14회에서 64회로, 입력 토큰은 15배로 늘며 작업당 비용이 0.53달러에서 1.14달러로 뛰어 가격 대비 성능은 오히려 나빠졌다. 장문 문맥 이해력(AA-LCR)은 소폭 하락했고, 모른다고 인정하는 능력을 측정하는 AA-Omniscience 점수는 10점 떨어졌으며 환각률은 23%에서 40%로 급증했다.
- •인텔리전스 인덱스 56점으로 전작 대비 10점 상승, 클로드 오퍼스 4.8과 동급이나 키미 K3(57점)엔 못 미침
- •GDPval-AA 벤치마크에서 1739 Elo로 키미 K3 앞섰지만 클로드 오퍼스 5(1852)엔 못 미침
- •작업당 단계 수 14→64회, 입력 토큰 15배 증가로 작업당 비용이 0.53달러→1.14달러로 급등
- •환각률이 23%에서 40%로 급증, 모르는 걸 인정하지 않고 추측하는 경향 강화
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Qwen3.8 Max catches Claude Opus 4.8 but Kimi K3 still scores higher for 25 percent less

본문 미리보기
Alibaba's Qwen3.8 Max scores 56 on the Artificial Analysis Intelligence Index, a 10-point jump over Qwen3.7 Max (46). The article Qwen3.8 Max catches Claude Opus 4.8 but Kimi K3 still scores higher for 25 percent less appeared first on The Decoder.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:52AI 초안

