LLM으로 설문 응답자를 시뮬레이션하는 '실리콘 샘플링'을 개인 수준 예측으로 검증하는 교차 설문 전이(cross-survey transfer) 평가 프레임워크를 제안한 연구다. 응답자의 일부 문항 답변을 주고 같은 설문의 전혀 다른 문항 답변을 예측하게 하는 방식으로, 대만 선거·민주화 연구(TEDS) 2024 데이터와 27B~120B 오픈웨이트 LLM 3종으로 실험했다. 제로샷 LLM이 미학습 문항에서 52% 정확도를 기록해 동일 모집단 데이터로 학습한 랜덤 포레스트와 6%p 차이까지 근접했고, 정파적 태도 67%에서 주권 문제 23%까지 구성 개념별 예측 가능성 위계가 안정적으로 나타났다. 분산 붕괴는 지도학습 모델에서도 나타났고 정렬 효과는 모델 계열별로 크게 달라, 실리콘 샘플링의 가능성과 한계를 동시에 명확히 했다.
- •분포 비교가 아닌 개인 수준 예측으로 실리콘 샘플링을 검증하는 교차 설문 전이 프레임워크 제안
- •제로샷 LLM이 미학습 문항에서 52% 정확도, 지도학습 랜덤 포레스트와 6%p 차이
- •정파적 태도 67% → 주권 문제 23%의 안정적인 구성 개념별 예측 가능성 위계 발견
- •분산 붕괴는 지도학습 모델에서도 나타나고 정렬 효과는 모델 계열별 차이가 커 기존 통념보다 복합적
- •TEDS 2024 데이터와 27B~120B 오픈웨이트 모델 3종으로 실험
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Silicon Sampling via Cross-Survey Transfer
- 1.LLM 설문 응답 시뮬레이션을 개인 수준 예측으로 검증하는 '교차 설문 전이' 프레임워크 제안
- 2.제로샷 LLM이 미공개 문항에서 52% 정확도, 동일 모집단 학습 랜덤포레스트와 6%p 이내 격차
- 3.대만 TEDS 2024 데이터에서 정당 태도 67%~주권 이슈 23%의 안정적 예측 가능성 위계 확인
- 4.분산 붕괴는 지도학습 모델에도 나타나고 정렬 효과는 모델 계열별로 크게 달라 통념보다 복잡
왜 중요한가?
여론조사 보완 수단으로 주목받는 실리콘 샘플링을 분포 비교가 아닌 개인 수준 예측으로 엄밀 검증한 시도로, 27B~120B 오픈 모델의 실제 한계와 가능성을 구체적 수치로 제시해 설문 대체·증강 서비스의 적용 범위 판단 기준을 제공한다.
본문 미리보기
arXiv:2607.03091v1 Announce Type: new Abstract: Silicon sampling-using large language models (LLMs) to simulate human survey respondents-has emerged as a promising approach for augmenting traditional survey research. However, most evaluations rely on distributional comparisons rather than individual-level prediction, which risks conflating pattern matching with coherent respondent-level prediction. We propose cross-survey transfer, a more rigorous evaluation framework in which an LLM is given a
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

