OpenAI의 신형 모델 GPT-6 아스트라가 전작 GPT-5.6 솔보다 환각을 크게 줄이고 직접적 프롬프트 인젝션 공격은 99.99% 차단한다고 시스템 카드를 통해 밝혔다. 다만 여러 차례 대화를 이어가며 공략하는 지속적 공격에는 방어율이 약 67%로 떨어져 세 번 중 한 번꼴로 뚫릴 수 있다. 특히 문서 안에 숨겨진 간접 프롬프트 인젝션에 대한 실패율은 27%에서 8.5%로 개선됐지만, 보안업체 그레이스완의 IPI 아레나 테스트에서 앤트로픽의 클로드 오퍼스 5(4.8%)보다는 여전히 취약한 것으로 나타났다. AI 에이전트가 문서를 읽고 도구를 조작하는 사례가 늘고 있어, 이 정도 실패율도 기업 보안팀에는 우려스러운 수준이라는 지적이 나온다.
- •GPT-6 아스트라, 전작 대비 환각 감소·직접 프롬프트 인젠션 99.99% 차단
- •지속적·다회차 공격 시 방어율 약 67%로 하락, 세 번 중 한 번은 문제 응답 유도 가능
- •문서 내 숨겨진 간접 프롬프트 인젠션 실패율 27%→8.5%로 개선되었으나 클로드 오퍼스 5(4.8%)보다 취약
- •AI 에이전트의 문서 처리·도구 조작 확대로 간접 인젠션 위험이 실제 보안 위협으로 부상
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
OpenAI's GPT-6 Astra hallucinates less but remains vulnerable to hidden prompt injections

- 1.GPT-6 Astra, 전작 GPT-5.6 Sol 대비 환각 크게 감소, 직접 프롬프트 인젝션 99.99% 차단
- 2.다회차 공격 시 약 3분의 1 확률로 문제 응답 발생, 전작 방어율은 50% 미만
- 3.숨겨진 간접 프롬프트 인젝션 실패율 27%→8.5%로 개선, 단 Claude Opus 5(4.8%)보다는 취약
- 4.테스트는 프로덕션 안전 분류기 없이 베어 모델로 진행됐다고 OpenAI 시스템 카드에 명시
왜 중요한가?
환각·프롬프트 인젝션 방어에서 개선이 뚜렷하지만 간접 인젝션 실패율이 여전히 두 자릿수에 가까워, 문서를 읽고 자율 실행하는 AI 에이전트의 엔터프라이즈 도입에는 보안 리스크가 남아있음을 보여준다.
본문 미리보기
OpenAI's GPT-6 Astra hallucinates less than its predecessor and blocks 99.99 percent of direct prompt injections. But when attacks are hidden inside documents the AI reads, the model still gets cracked in 8.5 percent of scenarios. Claude Opus 5 does better at 4.8 percent. For autonomous AI agents handling real data, those numbers still seem high. The article OpenAI's GPT-6 Astra hallucinates less but remains vulnerable to hidden prompt injections appeared first on The Decoder.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:33AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
