앤트로픽이 '페이블 5' 모델의 생물학 분야 안전 분류기를 개선해 정상적인 요청을 위험한 작업으로 오판해 답변을 제한하던 오탐 사례를 자체 테스트에서 85% 줄였다고 7일(현지시간) 밝혔다. 페이블 5는 생물학 분야에서 전문가 수준을 넘는 능력을 갖췄지만 신약 개발 등 유익한 연구와 생물무기 개발 같은 악용 가능성을 동시에 지녀, 출시 당시 관련 요청 대부분을 낮은 성능 모델로 전환(폴백)하는 방식으로 차단해왔다. 앤트로픽은 안전 분류기의 규칙 체계를 전면 수정하고 전문가 피드백을 반영해 학습 데이터를 재구축·재훈련했으며, 바이러스학·독성학 등 고위험 이중용도 영역은 여전히 '오퍼스 5'로 폴백하는 신뢰 기반 접근 체계를 유지한다.
- •앤트로픽이 페이블 5의 생물학 안전 분류기 개선으로 정상 요청 오탐(폴백) 사례를 85% 감소시켰다고 발표
- •페이블 5는 생물학 분야에서 전문가급 능력을 갖췄으나 이중용도 악용 우려로 출시 당시 관련 요청 대부분을 차단
- •안전 분류기의 규칙 체계를 전면 수정하고 내외부 전문가 피드백으로 학습 데이터를 재구축·재훈련
- •바이러스학·독성학 등 고위험 이중용도 연구는 여전히 오퍼스 5로 폴백하는 신뢰 기반 접근 유지
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
앤트로픽, 안전 분류기 고도화…'페이블 5' 오탐 답변 거부 85% 줄였다

본문 미리보기
앤트로픽이 ‘페이블 5’의 생물학 분야 안전장치를 대폭 개선했다. 이를 통해 정상적인 생물학 관련 요청을 위험한 작업으로 잘못 판단해 고성능 모델의 답변을 제한하던 오탐(false positive) 문제를 줄여, 연구·의료·교육 분야에서 모델을 활용할 수 있는 범위를 넓혔다.앤트로픽은 7일(현지시간) 최신 AI 모델 페이블 5의 생물학 분야 안전장치를 대폭 개선하면서, 생물학 관련 질문을 정상적인 요청임에도 위험한 것으로 잘못 판단해 답변을 제한하는 사례가 85% 감소했다고 밝혔다. 생물학 관련 요청을 판단하는 ‘안전 분류기(cla
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:57AI 초안
