현재 LLM 안전 정렬 훈련은 영어 중심으로 이뤄져, 비영어권에서는 안전 필터가 실패하며 고정관념을 강화하는 결과물이 나올 수 있다. 연구진은 인도의 언어적 다양성을 반영한 다국어 벤치마크 INCLUDE를 개발해 영어·힌디어·벵골어·마라티어·타밀어·힝글리시 6개 언어, 2,604개 프롬프트로 인도 중심 사회문화적 편향을 측정했다. 오픈·클로즈드 소스 LLM 10종을 평가해 14,988개 편향 점수를 분석한 결과, 벵골어가 오픈소스 모델에서 가장 높은 편향을 보였고, 영어는 오픈소스 모델에서는 최저, 클로즈드소스 모델에서는 오히려 최고 편향을 기록하는 역전 현상이 나타났다. 이는 영어 중심 안전 정렬이 비영어권 사용자를 실제로 보호하지 못할 수 있음을 시사한다.
- •인도 6개 언어·2,604개 프롬프트로 사회문화적 편향을 측정하는 INCLUDE 벤치마크 개발
- •LLM 10종 평가로 14,988개 편향 점수 분석
- •오픈소스 모델에서 벵골어 편향이 가장 높게 나타남
- •영어는 오픈소스에서 최저, 클로즈드소스에서 최고 편향을 보이는 역전 현상 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Safety Alignment Illusion: The Cross-Lingual Safety Gap in LLMs
- 1.LLM 안전정렬이 영어 중심이라 비영어권에서 안전 필터가 무력화되는 교차언어 공백 존재
- 2.인도 문화 편향 측정 벤치마크 INCLUDE 공개, 영어·힌디·벵골어 등 6개 언어 2,604개 프롬프트
- 3.오픈·폐쇄형 LLM 10종, 총 14,988개 편향 점수 분석 결과 벵골어에서 편향 최고치 기록
- 4.영어는 오픈소스 모델에서 편향 최저지만 폐쇄형 모델에서는 오히려 편향 최고로 역전
왜 중요한가?
안전 정렬이 영어 벤치마크에만 의존해온 관행의 한계를 실증 데이터로 드러내, 다국어 음성비서·대화시스템의 편향 방치 위험을 구체적 수치로 경고한다.
언급 프로젝트
본문 미리보기
arXiv:2608.18131v1 Announce Type: new Abstract: Current safety alignment training for Large Language Models (LLMs) are heavily English-centric. When such safety filters fail for non-English languages, the consequences are immediate and user-facing: voice assistants and spoken dialogue systems may produce stereotype-reinforcing outputs, bypassing the standard English-focused safety alignments and propagating harmful bias to non-English speaking communities. For spoken language technologies deplo
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
