AI 안전 비영리단체 SaferAI 보고서에 따르면 중국 Z.ai의 오픈웨이트 모델 GLM-5.2가 사이버·바이오 능력에서 OpenAI GPT-5.5, Anthropic Claude Opus 4.7에 불과 몇 달 뒤진 수준까지 따라잡았지만, 공격적 사이버·생물학 과제를 단 한 건도 거부하지 않았다. Claude Opus 4.7이 CyberGym 평가를 완료할 수 없을 만큼 일관되게 거부한 것과 대조적이다. 오픈웨이트 모델은 가중치 배포 후 세이프가드를 제거·수정할 수 있어 API 차원의 통제가 무력화되며, Z.ai는 안전 프레임워크나 사전 배포 위험 평가도 공개하지 않았다. 오픈 모델 능력이 프론티어에 근접하면서 논쟁의 초점이 '경쟁 가능 여부'에서 '공개 이후 위험 관리'로 옮겨가고 있음을 보여준다.
- •GLM-5.2는 공격적 사이버·생물학 과제를 전혀 거부하지 않은 반면 Claude Opus 4.7은 CyberGym 평가가 불가능할 정도로 일관되게 거부
- •오픈웨이트는 가중치 다운로드 후 세이프가드 제거·파인튜닝이 가능해 API 차원 통제가 무력화됨
- •Z.ai는 안전 프레임워크, 사전 배포 테스트 약속, 위험 평가를 공개하지 않음
- •사전학습 데이터 필터링이 대안으로 거론되나 코딩 능력과 해킹 능력을 분리하기 어려워 사이버 분야에서는 비현실적
- •Hugging Face는 GLM-5.2로 자사 해킹 방어에 활용했다며 오픈웨이트의 방어적 가치를 강조
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Open-weight AI models are catching up to the frontier. The safety gap remains.
- 1.SaferAI: 중국 Z.ai 오픈웨이트 GLM-5.2가 GPT-5.5·Opus 4.7의 사이버·바이오 능력에 수개월 차로 근접
- 2.GLM-5.2는 공격적 사이버·생물학 과제를 전혀 거부하지 않았고, Opus 4.7은 CyberGym 평가 불가할 만큼 일관 거부
- 3.가중치 공개 모델은 다운로드 후 세이프가드 제거·파인튜닝 가능해 API 안전장치가 무력화
- 4.Z.ai는 안전 프레임워크·배포 전 테스트·리스크 평가 미공개, 데이터 필터링 등 대안 거론
왜 중요한가?
오픈웨이트 모델의 능력이 프런티어에 근접하면서 논쟁이 '경쟁 가능한가'에서 '공개 후 위험을 어떻게 관리하나'로 이동했음을 보여준다. 코딩 능력과 해킹 능력이 분리되지 않아 데이터 필터링으로도 사이버 위험을 막기 어렵다는 지적은 오픈소스 AI 규제 논의의 핵심 쟁점이 될 수 있다.
본문 미리보기
A new SaferAI report finds Z.ai's open-weight GLM-5.2 approaches frontier AI capabilities while lacking key safety mitigations, renewing concerns that powerful open models could outpace governance and safeguards.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:11AI 초안
