대규모 추론 모델(LRM)의 안전 위험이 추론 구조 자체에서 비롯된다고 분석하고, 추론 구조를 변경하여 안전 정렬을 달성할 수 있다고 주장한다. 저자들은 RL이나 보상 설계 없이 1K 규모의 SFT만으로 추론 구조를 명시적으로 변형하는 AltTrain을 제안한다. 다양한 LRM 백본과 모델 크기에서 강한 안전 정렬과 함께 추론·QA·요약·다국어 환경 전반의 견고한 일반화를 보였다. 즉, 가벼운 SFT만으로 안전성과 범용 성능을 동시에 확보할 수 있음을 입증했다.
- •LRM의 안전 위험이 추론 구조 자체에서 유래한다는 통찰 제시
- •추론 구조를 변형하는 경량 사후 학습 기법 AltTrain 제안
- •RL·보상 설계 없이 1K 규모 SFT만으로 구현
- •추론·QA·요약·다국어 설정에서 견고한 일반화 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Reasoning Structure Matters for Safety Alignment of Reasoning Models
- 1.대형 추론 모델의 안전 문제가 추론 구조 자체에 있음을 규명
- 2.AltTrain은 추론 구조를 직접 변경하는 간단한 SFT 기반 정렬 방법
- 3.1K 예제만으로 복잡한 RL이나 보상 설계 없이 강한 안전성 확보
- 4.다양한 LRM 백본·크기에서 추론·QA·요약·다국어로 일반화
왜 중요한가?
복잡한 RL이나 보상 설계 없이 간단한 미세조정만으로 추론 모델의 안전성을 강화하는 실용적 경로 제시
언급 프로젝트
본문 미리보기
arXiv:2604.18946v1 Announce Type: new Abstract: Large reasoning models (LRMs) achieve strong performance on complex reasoning tasks but often generate harmful responses to malicious user queries. This paper investigates the underlying cause of these safety risks and shows that the issue lies in the reasoning structure itself. Based on this insight, we claim that effective safety alignment can be achieved by altering the reasoning structure. We propose AltTrain, a simple yet effective post train
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

