RLHF에서 보상 모델(RM)이 위험 행동을 충분히 처벌하지 못할 때 단일 실패점이 되는 문제를 다룬다. 기존 레드티밍은 정책 수준의 약점만 공략해 LLM과 RM이 동시에 실패하는 시스템적 약점을 놓친다고 지적하며, ARES 프레임워크를 제안한다. 'Safety Mentor'가 주제·페르소나·전술·목표를 동적으로 결합해 의미 있게 일관된 적대 프롬프트와 악성·안전 응답 쌍을 생성하고, 두 약점을 동시에 노출시킨다. 발견된 취약점으로 RM을 미세조정한 뒤 이를 활용해 본 모델을 최적화하는 2단계 복구 절차를 통해 다양한 안전 벤치마크에서 안전성과 성능을 모두 향상시킨다.
- •RM이 단일 실패점으로 작용하는 RLHF의 구조적 위험 지적
- •Safety Mentor로 LLM·RM 동시 공격 가능한 적대 프롬프트·응답 쌍 자동 생성
- •RM 미세조정 후 해당 RM으로 본 모델을 최적화하는 2단계 수립 구조
- •안전성 향상과 모델 능력 보존의 밸치 동시 달성
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
ARES: Adaptive Red-Teaming and End-to-End Repair of Policy-Reward System
본문 미리보기
arXiv:2604.18789v1 Announce Type: new Abstract: Reinforcement Learning from Human Feedback (RLHF) is central to aligning Large Language Models (LLMs), yet it introduces a critical vulnerability: an imperfect Reward Model (RM) can become a single point of failure when it fails to penalize unsafe behaviors. While existing red-teaming approaches primarily target policy-level weaknesses, they overlook what we term systemic weaknesses cases where both the core LLM and the RM fail in tandem. We pre
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

