BehaviorBench는 시뮬레이션 사용자가 아닌 실제 행동 흔적으로 개인화된 의사결정 모델링을 평가하는 벤치마크다. 기존 사용자 이해 벤치마크가 모델 생성 행동에 의존해 인간 행동과 체계적으로 어긋날 수 있다는 한계를 겨냥한다. 공개 예측시장과 온체인 기록에서 지갑 단위 의사결정 이력을 복원해, 시장에서 사용자의 최종 입장·확신을 예측하는 '신념 예측'과 개별 거래의 방향·금액을 예측하는 '거래 예측' 두 과제 층으로 구성한다. 평가 지갑 2,000개에 신념 인스턴스 14만1,445개, 거래 인스턴스 148만5,972개를 담았다. 프론티어·오픈웨이트 모델을 무개인화·최근 이력·생성 프로필·검색된 지갑 증거의 네 인터페이스로 평가한 결과, 개인화는 거래 예측보다 신념 예측을 더 일관되게 개선했고, 과제 층과 지표에 따라 모델 순위가 바뀌었다.
- •시뮬레이션이 아닌 실제 행동 흔적으로 개인화 의사결정 모델링을 평가하는 벤치마크
- •공개 예측시장·온체인 기록에서 지갑 단위 의사결정 이력을 복원
- •'신념 예측'과 '거래 예측' 두 과제 층으로 구성—지갑 2,000개, 신념 14만·거래 148만 인스턴스
- •개인화는 거래 예측보다 신념 예측을 더 일관되게 개선
- •네 가지 이력 인터페이스가 서로 다른 실패 모드를 드러냄
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
BehaviorBench: Modeling Real-World User Decisions from Behavioral Traces
- 1.BehaviorBench, 실제 행동 트레이스에서 개인화 의사결정을 평가하는 벤치마크
- 2.공개 예측시장·온체인 기록에서 지갑 단위 결정 이력 재구성
- 3.2,000개 지갑·신념예측 14만·거래예측 149만 인스턴스 구성
- 4.개인화는 거래보다 신념 예측을 더 일관되게 개선, 히스토리 인터페이스별 실패양상 상이
왜 중요한가?
시뮬레이션 사용자가 실제 인간 행동과 체계적으로 어긋난다는 지적에 대응해, 예측시장·온체인 실거래 기록으로 개인화 의사결정 모델을 평가하는 대규모 벤치마크를 제공해 가짜 사용자 의존을 벗어날 길을 열었다.
언급 프로젝트
초개인화 서비스와 정교한 의사결정 지원 시스템이 핵심 경쟁력이 되는 국내 디지털 경제 환경에서, 사용자 행동 모델링의 정확도는 매우 중요합니다. 이 연구는 기존 시뮬레이션 기반 벤치마크의 한계를 넘어 실제 사용자 행동 데이터를 기반으로 하는 새로운 벤치마크를 제시하여, 한국의 이커머스, 핀테크, 콘텐츠 플랫폼 기업들이 AI를 통해 사용자 경험을 개선하고 맞춤형 서비스를 제공하는 데 실질적인 도움을 줄 것입니다.
본문 미리보기
arXiv:2606.02798v1 Announce Type: new Abstract: Many decision-support settings require systems that adapt to individual users, but evaluation data for this problem remain limited. Existing benchmarks for user understanding often rely on simulated users or model-generated behavior, even though recent work cautions that model-based simulations can diverge systematically from human behavior. We introduce \textsc{BehaviorBench}, a benchmark for evaluating personalized decision modeling from real-wo
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:12AI 초안

