AI 안전 평가기관 가이드라이트(Guidelight)가 오픈AI, 앤트로픽, 구글, 메타, xAI의 공개된 정보를 토대로 '폭주 모델' 통제 대응 계획을 평가한 결과 오픈AI가 5점 만점에 3점으로 가장 높았고 앤트로픽과 메타가 최저 점수를 받았다. 오픈AI는 허깅페이스 해킹 사고 이후 워크로드를 일시 중단한 사례가 있어 높은 점수를 받았지만, 향후 대응을 위한 공식 계획은 확인되지 않았다. 앤트로픽은 통제 이탈 시 모델 배포 제한 가능성을 8월 위험보고서에 명시하지 않았고, 메타는 통제 대응 계획 존재 여부조차 확인되지 않았다. 캘리포니아 SB 53과 뉴욕 RAISE법 등 규제가 투명성 공개를 강제하기 시작했다는 점도 이번 평가의 배경으로 꼽힌다.
- •가이드라이트 평가서 오픈AI 5점 만점에 3점으로 최고점, 앤트로픽·메타 최저점
- •오픈AI는 허깅페이스 해킹 사고 후 워크로드 중단 이력으로 높은 평가 받음
- •앤트로픽은 8월 위험보고서에 모델 배포 제한 가능성을 명시하지 않아 감점
- •메타는 통제 대응 계획 존재 여부조차 공개적으로 확인되지 않음
- •캘리포니아 SB 53, 뉴욕 RAISE법 등 규제가 투명성 공개 의무화 추세 견인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Frontier AI labs still won’t say how they’d contain a rogue model

- 1.Guidelight 평가에서 오픈AI 최고점(5점 만점 중 3점), 앤트로픽·메타 최저점 기록
- 2.'통제 이탈 감지 시 권한 회수·운영 중단 시점을 사전 규정한 계획'을 컨테인먼트 플랜으로 정의
- 3.오픈AI는 허깅페이스 해킹 사고 이후 실제 워크로드 일시중단·모델 격리 조치 이력 보유
- 4.캘리포니아 SB 53, 뉴욕 RAISE Act 등 규제가 프런티어 기업에 안전 프레임워크 공개를 요구 시작
왜 중요한가?
에이전틱 AI가 기업 내부 시스템에서 더 큰 권한을 행사하는 가운데, 안전을 강조해온 앤트로픽조차 폭주 모델 억제 계획을 공개하지 않았다는 점이 드러나 업계 전반의 안전 대응 공백을 부각시킨다.
본문 미리보기
A new study finds leading AI labs have few publicly documented plans for containing rogue models, raising questions about preparedness as AI systems increasingly demonstrate unexpected and potentially dangerous behavior.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:53AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
