앤트로픽의 '오푸스 5'가 AI 에이전트 최대 보안 취약점인 프롬프트 인젝션을 사실상 해결했을 수 있다는 분석이 나왔다. 시스템 카드에 따르면 브라우저 에이전트 대상 129개 테스트 시나리오에서 Auto Mode 결합 시 공격 성공률 0%를 기록했고, 보안업체 그레이 스완의 일반 테스트에서도 15회 시도 기준 성공률이 오푸스 4.8의 5.5%에서 2.0%로 떨어져 미소스 5(2.6%)·페이블 5(2.8%)를 제치고 1위였다. 다만 0%는 유입 데이터의 숨은 지시 탐지와 위험 행동 차단이라는 두 방어층을 겹친 Auto Mode에서만 성립하며, 모델 단독으로는 3.7%로 소네트 5(0.93%)보다 오히려 높다. 오픈AI가 "완전 해결은 불가능할 수 있다"고 인정했던 문제에서 모델+보호 소프트웨어 조합의 가능성을 보여준 결과다.
- •오푸스 5+Auto Mode, 브라우저 에이전트 129개 시나리오에서 프롬프트 인젝션 성공률 0%
- •그레이 스완 테스트에서 15회 시도 기준 5.5%→2.0%로 개선, 벤치마크 1위
- •0%는 숨은 지시 탐지+위험 행동 차단 2중 방어층 결합 시에만 성립
- •모델 단독으로는 3.7%로 소네트 5(0.93%)보다 높음
- •오픈AI는 앞서 프롬프트 인젝션 완전 해결 불가 가능성을 인정한 바 있음
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Opus 5 may have solved browser-based prompt injection, the biggest security flaw haunting AI agents

- 1.Opus 5+Auto Mode, 브라우저 에이전트 프롬프트 인젝션 129개 시나리오서 공격 성공률 0%
- 2.Gray Swan 일반 IPI 벤치마크서 15회 시도 후 성공률 2.0%로 Opus 4.8(5.5%) 대비 개선
- 3.Auto Mode는 숨은 지시 스캔+위험 행동 차단 2중 방어, 모델 단독으론 3.7%로 Sonnet 5보다 높아
왜 중요한가?
OpenAI가 '완전 해결 불가능할 수 있다'고 인정했던 AI 에이전트 최대 보안 취약점에 대해 모델+방어 소프트웨어 조합으로 0%를 달성했다는 점에서, 브라우저 에이전트 상용화의 핵심 걸림돌이 제거될 수 있음을 시사한다.
본문 미리보기
Opus 5 combined with Auto Mode hits a zero percent prompt injection success rate for browser agents across 129 test scenarios. Without those extra protection layers, the rate is 3.7 percent. If these numbers hold up in practice, Anthropic may have cracked one of the biggest security problems facing AI agents that operate in browsers. The article Opus 5 may have solved browser-based prompt injection, the biggest security flaw haunting AI agents appeared first on The Decoder.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:13AI 초안

