AI 기업 비드래프트가 범용 AI 모델의 안전성 취약점을 진단하는 'AX-RAY' 리더보드와 평가 데이터셋을 허깅페이스에 공개했다. 그동안 이론적 위험으로만 논의돼온 '인과누설'(숨은 정보나 의도치 않은 인과적 단서에 영향받아 AI가 판단·행동하는 현상)을 실제 범용 LLM에서 탐지한 것이 핵심으로, 엔비디아 모델 1종을 포함해 총 2종의 모델에서 관련 신호를 확인했다. AX-RAY는 117개 안전성 진단항목을 국가별 법률·규제 체계와 연결해 평가하며, 아랍권의 경우 종교·사회적 규범까지 반영한 율법 체계와의 매핑도 고려해 설계됐다. AI 평가의 중심이 지능 수준에서 안전성과 통제 가능성으로 이동하는 흐름을 보여주는 사례로, 김민식 대표는 이를 국가별 법률·규범까지 연결하는 글로벌 AI 안전성 진단 체계로 발전시키겠다고 밝혔다.
- •비드래프트, 범용 LLM 안전성 취약점 진단 'AX-RAY' 리더보드·평가 데이터셋 허깅페이스 공개
- •이론적 위험이던 '인과누설'을 실제 LLM에서 최초 탐지, 엔비디아 모델 등 2종에서 신호 확인
- •117개 안전성 진단항목을 국가별 법률·규제, 아랍권 종교규범까지 연결해 평가
- •AI 평가 중심이 '지능'에서 '안전성·통제 가능성'으로 이동하는 흐름 반영
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
비드래프트, 범용 LLM서 ‘인과누설’ 탐지…AI 안전성 진단 ‘AX-RAY’ 공개

- 1.비드래프트, 범용 LLM의 '인과누설' 탐지하는 AX-RAY 리더보드·평가션 허깅페이스 공개
- 2.엔비디아 모델 1종 포함 총 2종 모델에서 실제 인과누설 신호 최초 확인
- 3.117개 안전성 진단항목을 국가별 법률·규제, 아랍권은 종교·사회규범까지 매핑
- 4.비드래프트, 자체 파운데이션모델 AETHER·진화형 다윈 개발, GPQA 90.9% 등 성과 보유
왜 중요한가?
그동안 이론적 위험으로만 논의되던 '인과누설'을 실제 상용 LLM에서 최초로 탐지·정량화했다는 점에서, AI 평가 기준이 '지능'에서 '안전성·통제가능성'으로 이동하는 흐름을 구체적 도구로 뒷받침한다.
한국 AI 전문 기업 비드래프트가 범용 LLM에서 '인과누설'을 탐지하고 AX-RAY를 공개한 것은 AI 안전성 분야의 중요한 국내 성과입니다. 이는 대규모 AI 모델의 잠재적 취약성을 진단하여 국내 AI 개발 및 배포 과정에서 책임감 있는 AI 구현을 촉진하는 데 핵심적인 역할을 할 것입니다.
본문 미리보기
AI 전문 비드래프트(대표 김민식)는범용 AI 모델의 잠재적 안전성 취약성을 진단하는 ‘AX-RAY’ 리더보드와 평가 데이터셋을 허깅페이스(Hugging Face)에 공개했다고 17일 밝혔다.지금까지 이론적 위험으로 주로 논의돼 온 ‘인과누설(Causal Leakage)’을 실제 범용 LLM에서 탐지했다는 점이 핵심이다. 비드래프트는 AX-RAY 평가에서 엔비디아의 모델 1종을 포함한 총 2종의 모델에서 인과누설 신호를 확인했다.인과누설은 AI가 정상적인 추론 경로가 아닌 숨은 정보나 의도하지 않은 인과적 단서에 영향을 받아 판단·
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:23AI 초안

