이 연구는 명령 조정된 LLM이 출력 수준에서는 공정성을 보이면서도 내부 표현에는 편향된 연관성을 유지한다는 역설을 조사한다. 모기지 심사에서 인종 관련 이름만 다른 매칭된 신청서를 사용해 출력 수준 편향은 없으나 인구통계학적 표현이 모델 레이어 전반에 걸쳐 증폭됨을 밝혔다. 활성화 조종 실험으로 이 잠재 편향이 결정 관련성을 가지며 비대칭적임을, 즉 한 방향으로는 결정을 뒤집지만 반대 방향으로는 효과가 미미함을 입증했다. 출력 감사만으로는 부족하며 AI 거버넌스를 위해 출력 평가와 표현 분석을 결합하는 이중 레이어 테스트 프레임워크가 필요함을 보여준다.
- •행동 공정성을 보이는 LLM도 내부 표현에는 인구통계학적 편향을 유지하고 증폭할 수 있다.
- •왜곡 조종 실험으로 잠재 편향이 결정에 주요한 영향을 미치며 작동 방향에 따라 비대칙으로 나타남을 입증했다.
- •적대적 프롬프트 엔지니어링 및 파라미터 효율적 파인튜닝에 대해서도 잠재 편향이 취약성을 드러냈다.
- •출력 중심 감사만으로는 불충분하며 AI 거버넌스를 위한 이중 레이어 테스트 프레임워크가 필요하다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Fair outputs, Biased Internals: Causal Potency and Asymmetry of Latent Bias in LLMs for High-Stakes Decisions
- 1.LLM이 출력에서 공정성을 보여도 내부 표현에는 인구통계학적 편향이 잠재할 수 있음을 증명
- 2.모기지 심사 시뮬레이션에서 활성화 조종으로 잠재 편향 재주입 시 결정이 거의 완전히 역전됨
- 3.잠재 편향은 비대칭적으로 한 인구 방향으로만 결정에 영향을 미침
- 4.출력 평가만으로 불충분하며 표현 분석 결합한 이중 레이어 테스트 프레임워크 필요
왜 중요한가?
행동 감사만으로는 AI의 내부 편향을 탐지할 수 없어, 대출 등 고위험 결정에서 AI 공정성 검증 방식을 근본적으로 재검토해야 함을 시사하는 중요한 연구다.
본문 미리보기
arXiv:2605.15217v1 Announce Type: new Abstract: Instruction-tuned language models exhibit behavioural fairness in high-stakes decisions while retaining biased associations in their internal representations. However, whether these suppressed representations can affect model outputs - and whether such causal potency is symmetric across demographic groups - remains unknown. We investigate the use of open-weight models for mortgage underwriting using matched applications that differ only in raciall
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

