이 연구는 인간 행동 데이터로 파인튜닝한 LLM이 일반적 인지 대리모델로 쓰이는 상황에서 어느 정도 규모가 필요한지, 모델이 과제 구조를 실제로 처리하는지 아니면 통계적 지름길을 이용하는지를 검증했다. 160개 실험, 1070만 건의 시행 단위 선택 데이터로 구성된 Psych-101을 이용해 1억 3500만~140억 파라미터, 4개 아키텍처군에 걸친 14개 모델을 학습시켰다. 분포 내 시뮬레이션에서는 규모가 거의 중요하지 않아 6~10억 파라미터 모델이 700억 파라미터 기준선과 동등한 성능을 냈지만, 분포 외 일반화에서는 규모에 따른 성능 격차가 뚜렷하게 벌어졌다. 자극과 피드백 내용을 가리는 진단에서 학습된 정보의 75.7%가 사라져 선택 이력만으로는 성능을 설명할 수 없음을 확인했으며, 시행 순서를 섞으면 독립 시행 과제에서는 불변이지만 이전 응답에 의존하는 과제에서는 민감하게 반응했다.
- •160개 실험 1070만 시행 데이터(Psych-101)로 1.35억~140억 파라미터 14개 모델 비교
- •분포 내 예측에서는 6~10억 파라미터로 700억 파라미터급 성능에 도달
- •분포 외 일반화에서는 모델 규모에 따라 성능 격차 뜻렬하게 확대
- •자극·피드백 마스킹 시 학습 정보의 75.7% 소실, 선택 이력만으로는 설명 불가
- •COLM'26 학회 논문으로 채택
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Small Foundation Models of Human Cognition and Behaviour
본문 미리보기
arXiv:2608.05224v1 Announce Type: new Abstract: Large language models fine-tuned on human behavioural data have emerged as general-purpose cognitive proxies, but the scale this requires, and whether these models process task structure or exploit statistical shortcuts, remain open questions. We train fourteen models from 135M to 14B parameters across four architecture families on Psych-101, a dataset of 10.7 million trial-level choices from 160 experiments. In-distribution, scale barely matters.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

