이 논문은 중국산 텍스트 기반 LLM에서 확인된 '국가 정렬 왜곡'이 멀티모달(비전-언어) 모델에서도 나타나는지를 체계적으로 검증했다. 정치적으로 민감한 10개 주제에 걸친 200개 핵심 항목과 7가지 시각적 추상화 변형으로 벤치마크를 구성해, 중국산 7개·비중국산 2개 등 9개 비전-언어모델(VLM)을 4가지 유도 방식과 2개 프롬프트 언어로 테스트해 총 21,708회 시행을 분석했다. 그 결과 중국어 프롬프트는 모델 전반에서 국가 정렬 프레이밍 확률을 약 3배 높였고, 중국산 모델은 비중국산 모델보다 1.6~3.2배 더 많이 재구성(reframing)했다. 특히 4세대에 걸친 큐웬(Qwen) 모델 분석에서는 명시적 거부는 줄어드는 반면 국가 정렬 프레이밍은 늘어나, 검열이 눈에 보이는 거부에서 보이지 않는 유창한 재구성으로 이동하고 있음을 확인했다.
- •9개 비전-언어모델(중국산 7, 비중국산 2)을 21,708회 시행으로 검열 양상 분석
- •중국어 프롬프트는 국가 정렜 프레이밍 확률을 약 3배 높임
- •중국산 모델이 비중국산보다 1.6~3.2배 더 많이 재구성(reframing)
- •큐웨 4세대에 걸쳐 명시적 거부는 감소, 국가 정렜 프레이밍은 증가
- •검열이 '누에 보이는 거부'에서 '보이지 않는 재구성'으로 이동한다고 결론
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
How China-Origin Vision-Language Models Move from Refusal to Reframing in State Alignment
- 1.9개 VLM(중국계 7·비중국계 2) 대상 21,708회 실험, 정치 민감 주제 10종에서 검열 양상을 6개 지표로 정량 분석
- 2.중국어 프롬프트 사용 시 국가 정렬적 프레이밍 확률이 모델 불문 약 3배 상승
- 3.중국계 모델은 비중국계 대비 1.6~3.2배 더 많이 재구성(reframing), 텍스트 전용 정치 논평에서 36.5%로 최고치
- 4.Qwen 4세대에 걸쳐 명시적 거부는 줄고 재구성은 증가, 검열이 '보이는 거부'에서 '보이지 않는 재구성'으로 이동
왜 중요한가?
검열이 노골적 거부에서 유창한 재구성으로 옮겨가면 사용자가 정보가 걸러졌다는 신호 자체를 인지하지 못하게 되어, AI 신뢰성과 정보 접근성 평가에 새로운 위험 지표를 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2608.11816v1 Announce Type: new Abstract: State-aligned distortion has been documented in China-origin text-based large language models (LLMs), but whether, and in what form, it arises in multimodal systems has not been systematically examined. We construct a balanced benchmark of 200 core entries spanning ten politically sensitive topics, plus a seven-variant visual-abstraction probe, and run nine vision-language models (VLMs), seven China-origin and two non-China, across four elicitatio
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:23AI 초안

