제한된 신호 채널에서 정보를 아는 적대자가 함께 청자를 지켜볼 때, 진실을 가장 잘 보호하는 신호는 결국 진실을 가장 잘 묘사하는 신호와 일치한다는 이론적 결과를 제시했다. 108개 확증 항목에서 적대자-강건 최적해는 기존 「salience(돌출성) 극점」과 정확히 일치했고, 20만 개 항목 풀에서는 단 2,748개에서만 차이가 났다. 설득 예산(β)을 가진 적대자를 도입한 강제 선택 과제에서 β가 커질수록 최적 신호가 사후확률 극대화에서 마진 극대화로 이동했으며, 7개 언어모델 실험에서 108개 항목 중 30~77개의 선택이 바뀌었다. 다만 이 이동이 적대자 인식 최적해로 향한 것인지 단순 salience로 향한 것인지는 두 선택지가 구조적으로 동일해 구분할 수 없다는 한계가 드러났다.
- •108개 확증 항목에서 적대자-강건 최적 신호가 기존 salience 극점과 정확히 일치함을 확인
- •설득 예산(β)이 커질수록 최적 신호가 사후확률 극대화에서 마진 극대화로 전환되는 구조를 규명
- •7개 언어모델 대상 실험에서 적대자 설정에 따라 108개 항목 중 30~77개에서 선택이 바뀜
- •두 목표(적대자 인식 vs salience)가 구조적으로 구분 불가능해 이동 방향 자체를 측정할 수 없는 한계 발견
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Robust Is Salient: An Informed Adversary Moves the Optimal Signal onto the Salience Pole
- 1.제한된 신호 채널에 정보를 아는 적대자가 있을 때 최적 신호가 'salience(돋보임)' 극점으로 이동함을 입증
- 2.20만 개 항목 중 2748개에서만 적대자 대응 최적해와 기존 salience 기준이 달라짐
- 3.설득 예산이 커질수록 전체의 18.2%에서 최적 신호가 사후확률 최대화에서 마진 최대화로 전환
- 4.7개 언어모델에 적대적 프레이밍 2종 적용 시 108개 항목 중 30~77개에서 선택이 바뀜
왜 중요한가?
언어모델이 적대적 설득 상황에서 어떤 신호를 고르는지 예측하는 데, 두 전략이 구분 불가능한 '구조적 한계' 지점이 있음을 짚어 평가 설계 시 유의점을 제시한다.
본문 미리보기
arXiv:2610.00233v1 Announce Type: new Abstract: When an informed adversary shares the audience of a constrained signalling channel, the signal that best protects the truth is the signal that best describes it. On 108 confirmatory items, the adversary-robust optimum aligns exactly with the salience pole from prior work. Across a 200,000-item pool, the two differ on only 2,748 items --- lying exactly where the prior salience-to-Bayes coordinate is undefined. Where defined, robustness is achieved
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

