BrainBench는 자연어 지시, 신호처리, 정량적 근거, 과학적 해석을 아우르는 '종합적 EEG 이해' 능력을 평가하기 위한 통합 벤치마크다. 기초 분석, 수면 평가, 신경인지 평가, 생리 통합 등 4개 하위셋으로 구성되며 17개 데이터셋, 다수의 과제, 실데이터 인스턴스를 포함한다. 시스템은 지시와 EEG 기록(선택적으로 다른 생리신호 포함)을 받아 분석을 수행하고 과학적으로 근거 있는 리포트와 필요시 산출물을 만들어야 하며, 결과는 수치·범주·집합·시퀀스·의미·산출물 검증으로 평가된다. 대표 LLM들을 CodeAct 기반 자율 코드 실행과 BrainAgent 기반 구조화된 에이전트 분석 두 방식으로 10만 회 이상 실행해 평가한 결과, 모델·하위셋·난이도·실행 방식에 따라 성능이 크게 달라져 EEG 능력이 모델과 그 운용 방식에 좌우됨을 보였다.
- •BrainBench, 자연어 지시 기반 '종합적 EEG 이해' 능력을 평가하는 통합 벤치마크
- •기초분석·수면평가·신경인지평가·생리통합 4개 하위셋, 17개 데이터셋으로 구성
- •수치·범주·집합·시퀌스·의미·산출물 검증 등 다양한 방식으로 출력을 평가
- •CodeAct 자율 코드 실행과 BrainAgent 구조화 분석 두 패러다임으로 10만 회 이상 실행 평가
- •모델·하위셋·난이도·실행 방식에 따라 성능 편차가 커서 EEG 능력이 운용 방식에 좌우됨
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
BrainBench: Benchmarking Large Language Models for Comprehensive EEG Understanding
본문 미리보기
arXiv:2608.04156v1 Announce Type: new Abstract: Electroencephalography (EEG) analysis extends beyond assigning predefined labels to recordings; it requires workflows connecting natural-language instructions, signal processing, quantitative evidence, and scientific interpretation. We term this capability \emph{comprehensive EEG understanding}. Existing evaluations, however, primarily target isolated decoding tasks or system-specific demonstrations, leaving the competence of large language models
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

