OpenAI가 자사 모델의 사이버 방어력을 단련시키는 LLM 해커 'GPT-Red'를 공개했다. 훈련은 여러 모델과의 셀프플레이 루프에서 이뤄졌으며, 웹 브라우징·이메일·코드 편집 등 실제 배포 시나리오를 모사한 '도장(dojo)'에서 GPT-Red는 공격을, 상대 모델은 방어를 반복하며 함께 강해졌다. 주 표적은 프롬프트 인젝션으로, 다른 모델의 사고사슬에 가짜 항목을 삽입해 검증된 정보로 믿게 만드는 신종 'fake chain of thought' 공격도 발견했다. 2025년 인간 레드팀 실험을 재현하자 인간보다 효과적인 공격을 더 많이 찾았고, GPT-Red의 최강 공격이 GPT-5에는 90% 이상 통했지만 이를 상대로 훈련한 신형 GPT-5.6에는 23% 미만만 통했다. 다회 대화형 공격과 이미지 활용에는 아직 약하며, OpenAI는 GPT-Red를 공개하지 않을 방침이다. 에이전트 확산으로 커진 공격 표면을 인간 레드팀만으로 감당하기 어렵다는 업계 과제에 대한 대응이다.
- •실제 배포 시나리오를 모사한 훈련 환경에서 공격-방어 셀프플레이 루프로 해커 모델 GPT-Red 육성
- •타 모델 사고사슬에 가짜 항목을 심는 신종 'fake chain of thought' 프롬프트 인젝션 발견
- •GPT-Red 최강 공격 성공률: GPT-5 대상 90% 이상 → 대항 훈련한 GPT-5.6에서는 23% 미만
- •2025년 인간 레드팀 실험 재현에서 인간보다 효과적 공격을 더 많이 발견, 자판기 에이전트 Vendy 해킹도 성공
- •다회 대화형 공격·이미지 기반 공격에는 아직 미숙, 모델은 비공개 방침
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Meet GPT-Red: an LLM super-hacker OpenAI built to make its models safer

- 1.OpenAI가 자사 모델 방어력 강화용 LLM 레드팀 모델 GPT-Red를 공개, GPT-5.6 훈련에 활용
- 2.자기대전(self-play) 루프로 훈련, 가짜 체인오브소트 주입 등 신종 프롬프트 인젤션 공격 발견
- 3.GPT-Red 최강 공격이 GPT-5엔 90% 이상 통했으나 GPT-5.6에서는 23% 미만으로 감소
- 4.2025년 인간 레드티머 실험 재현에서 인간보다 효과적 공격 발견, 다만 다중턴 대화형 공격엔 취약
왜 중요한가?
에이전트 확산으로 프롬프트 인젝션 공격 표면이 급증하는 상황에서, 인간 레드팀만으로는 감당 못 하는 안전 평가를 자동화한 사례다. 공격 모델과 방어 모델의 self-play가 실제 플래그십 모델(GPT-5.6)의 공격 성공률을 90%→23%로 낮췄다는 정량 결과는 AI 안전 훈련 방법론의 방향을 보여준다.
본문 미리보기
OpenAI has built an LLM super-hacker called GPT-Red that it uses as a sparring partner to help its other models boost their defenses against cyberattacks. Last week the company released the latest version of its flagship LLM, GPT-5.6. OpenAI says that training it against GPT-Red made the model its most robust release yet. GPT-Red automates…
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 03:39AI 초안

