일부 LLM이 불확실성 아래에서 일관된 '위험 태도'를 보인다는 사실을 실증한 연구다. 맥락적 위험 인식과 범주적 결정을 분리하는 교차 도메인 프레임워크를 설계해, 대표 LLM 6종과 인간 참가자 100명을 공간 내비게이션·임상 트리아지·금융 자산 배분 과제에서 비교했고, 회귀 모델로 각 에이전트의 신념-결정 매핑과 위험 민감도·태도 편향을 정량화했다. 대부분의 LLM은 과제 내 일관성, 과제 간 상대적 위험 성향의 순위 안정성을 보였으며, 인간보다 좁은 위험 태도 분포로 수렴했다. 위험 태도가 LLM 행동의 안정적이고 미측정이던 차원임을 밝혀, 고위험 개방형 의사결정에 AI를 배치할 때의 평가·정렬 기준 수립에 근거를 제공한다.
- •맥락적 위험 신념과 범주적 결정을 분리하는 교차 도메인 평가 프레임워크 제안
- •LLM 6종과 인간 100명을 공간 내비게이션·임상 트리아지·금융 배분 과제에서 비교
- •대부분 LLM이 과제 내 일관성과 과제 간 위험 성향 순위 안정성을 보임
- •LLM들은 인간 베이스라인보다 좁은 위험 태도 분포로 수렴
- •위험 태도를 LLM 행동의 안정적 차원으로 규명해 정렬·평가의 새 기초 마련
Some Large Language Models Exhibit Consistent Risk Attitudes
- 1.LLM 6종·인간 100명을 공간 탐색·임상 트리아지·금융 배분 과제로 위험 태도 측정
- 2.대부분 LLM이 과제 내 일관된 위험 판단-결정 매핑과 과제 간 위험 성향 순위 안정성 보임
- 3.LLM들의 위험 태도는 인간 베이스라인보다 좁은 분포로 수렴
- 4.위험 믿음과 범주적 결정을 분리하는 크로스 도메인 측정 프레임워크 제안
왜 중요한가?
LLM이 자율 의사결정(투자·의료·항법)에 투입되는 시대에 '위험 태도'가 모델의 안정적이고 측정 가능한 행동 차원임을 처음 체계적으로 규명했다. 인간보다 좁은 위험 성향 분포로 수렴한다는 발견은 AI 위임 결정의 다양성·정렬 논의에 새 변수를 더한다.
본문 미리보기
arXiv:2607.16197v1 Announce Type: new Abstract: As artificial intelligence systems are deployed in open-ended, high-stakes settings, a critical dimension remains unmeasured: how perceived risk is translated into action. We test whether large language models (LLMs) exhibit systematic and consistent risk attitudes under uncertainty. We introduce a cross-domain framework that decouples contextual risk belief from categorical decision, and apply it to six representative LLMs and 100 human participa
전체 내용이 궁금하다면?
원문을 직접 읽어보세요