홍콩과기대 등 연구진이 LLM 평가 비용을 줄이기 위한 학습이 필요 없는 핵심 문제 선별 기법 'CoT-Core'를 제안했다. 기존 방법은 문항반응이론처럼 방대한 과거 로그가 필요한 '콜드 스타트' 문제나, 표면적 어휘 유사성에 치우쳐 과제의 실제 추론 구조를 놓치는 한계가 있었다. CoT-Core는 LLM이 제로샷 사고연쇄(Chain-of-Thought) 추론 경로를 풀어내도록 한 뒤 이를 잠재 공간에 투영해, 표면적 어휘가 달라도 논리적으로 동등한 문제들을 효과적으로 군집화한다. GSM8K, MMLU, MMLU-Pro, GPQA 등에서 실험한 결과 평가 비용을 크게 줄이면서도 높은 정확도의 점수 추정을 유지했으며, 이 기법의 효과가 과제 난이도에 따라 달라지는 경계 조건도 함께 규명했다.
- •학습 없이 핵심 평가 문제를 선별하는 'CoT-Core' 기법 제안
- •제로샷 사고연쇄(CoT) 추론 경로를 잠재 공간에 투영해 논리적 동등 문제를 군집화
- •GSM8K·MMLU·MMLU-Pro·GPQA 실험에서 평가 비용 절감과 높은 정확도 동시 확인
- •기법의 효과가 과제 복잡도에 따라 달라지는 경계 조건(boundary condition)도 규명
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
CoT-Core: Accelerating LLM Evaluation via CoT-Aware Coreset Selection
본문 미리보기
arXiv:2608.00014v1 Announce Type: new Abstract: Evaluating Large Language Models (LLMs) incurs prohibitive computational overhead during continuous development processes. While coreset selection accelerates evaluation, existing methods either suffer from a severe ``cold start'' bottleneck requiring massive historical logs (e.g., Item Response Theory) or exhibit a surface lexical bias that misses the underlying reasoning manifold of tasks. We propose CoT-Core, a novel training-free core question
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

