Oyster-II는 민감한 질문을 무조건 거부하는 대신 안전한 범위에서 건설적으로 응답하는 '건설적 안전 정렬'을 강화학습으로 구현한 프레임워크다. 전작 Oyster-I의 SFT 기반 방식이 분포 밖 시나리오에서 안전 일반화가 부족하고, 안전 지향 추론이 무해한 질문에까지 과잉 적용돼 유용성을 해치는 '안전 CoT 과일반화' 문제가 있음을 지적했다. 이를 Zero-RL 패러다임과 다단계 강화학습 전략으로 해결해, 광범위한 벤치마크에서 Qwen3-14B와 Oyster-I를 안전성 차원에서 전면 상회하고 Qwen3-Max, Qwen3.5-397B급 대형 모델과 대등한 성능을 보였다. 거부 일변도 정렬의 한계를 넘어 안전성과 유용성을 동시에 잡으려는 흐름을 보여주는 결과다.
- •일괄 거부 대신 사용자 의도에 건설적으로 응답하는 '건설적 안전 정렬' 패러다임의 RL 버전
- •SFT 기반 Oyster-I의 한계: OOD 안전 일반화 부족과 안전 CoT 과일반화(무해 질문에도 과잉 안전 추론) 규명
- •Zero-RL 패러다임 + 다단계 강화학습 전략 채택
- •안전성 벤치마크에서 Qwen3-14B·Oyster-I 전면 상회, Qwen3-Max·Qwen3.5-397B급과 대등
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models
- 1.Oyster-II 발표: 일괄 거부 대신 건설적 응답을 지향하는 RL 기반 안전 정렬 프레임워크
- 2.전작 Oyster-I(SFT 기반)의 OOD 안전 일반화 부족과 안전 CoT 과일반화 문제를 지적
- 3.Zero-RL 패러다임과 다단계 강화학습으로 안전성과 도움성(helpfulness)을 동시 개선
- 4.안전 벤치마크에서 Qwen3-14B와 Oyster-I를 능가, Qwen3-Max·Qwen3.5-397B급 성능 달성
왜 중요한가?
거부 위주 정렬이 정당한 질문까지 차단하는 고질적 문제에 대해, SFT가 아닌 RL로 '건설적 안전'을 학습시켜 14B급 모델이 초대형 모델 수준의 안전 성능을 내도록 했다는 점이 핵심이다. 안전성-유용성 트레이드오프를 완화하는 실용적 정렬 기법으로 주목할 만하다.
본문 미리보기
arXiv:2607.02914v1 Announce Type: new Abstract: Large language models (LLMs) have demonstrated remarkable capabilities across diverse applications, yet ensuring their simultaneous safety, helpfulness, and trustworthiness remains a persistent challenge. Conventional refusal-oriented alignment strategies mitigate harmful content generation but systematically fail to serve legitimate user needs, often withholding information that could safely and constructively address the underlying intent of sen
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

