GPT-Red는 프론티어 LLM에 대한 새로운 프롬프트 인젝션 공격을 발견하도록 훈련된 자동 레드팀 에이전트로, 오픈AI가 자사의 프로덕션 시스템 견고성을 평가·개선하기 위해 개발했으며 이를 활용해 현재까지 가장 견고한 모델인 GPT-5.6을 적대적으로 훈련시켰다. 모델이 동시에 훈련되는 다양한 방어자 에이전트 집단을 공격하도록 하는 확장 가능한 셀프플레이 알고리즘을 설계했고, 오픈AI가 수행한 최대 규모 RL 사후훈련 실행과 동급의 컴퓨팅 자원을 사용해 지금까지 문서화된 단일 최대 규모 LLM 안전 훈련으로 기록됐다. GPT-Red는 GPT-5.5까지의 과거 모델들을 안정적으로 뚫었고 인간 레드팀보다 더 많은 성공적 공격을 찾아냈으며, 훈련에 사용되지 않은 환경·방어 모델·하니스에도 일반화됐다. 오픈AI는 향후 각 신규 GPT 모델의 견고성이 높아질수록 더 강력한 레드팀 에이전트를 위한 학습 신호가 개선되는 자가개선 플라이휠을 기대한다고 밝혔다.
- •오픈AI가 자사 모델의 프롬프트 인젝션 취약점을 찾도록 훈련한 자동 레드팀 에이전트 GPT-Red 공개
- •동시 훈련되는 다수 방어자 에이전트를 공격하는 셀프플레이 알고리즘으로 GPT-5.6 적대적 훈련에 활용
- •오픈AI 최대 RL 사후훈련급 컴퓨팅 사용, 문서화된 단일 최대 규모 LLM 안전 훈련 기록
- •GPT-5.5까지의 과거 모델을 안정적으로 공략, 인간 레드팀보다 많은 성공 공격 발견 및 held-out 환경 일반화
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
GPT-Red: Automated Red Teaming via Self-Play at Scale
본문 미리보기
arXiv:2607.26115v1 Announce Type: new Abstract: We introduce \textbf{GPT-Red}, an automated red-teaming agent that is trained to discover novel prompt injection attacks against frontier LLMs. The goal of this model is to evaluate and improve the robustness of our production systems. To this end, we use it to adversarially train GPT-5.6, our most robust model to prompt injections to date. To create GPT-Red, we design a scalable self-play algorithm where the model is tasked with attacking a diver
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:30AI 초안



