이 연구는 공유 파라미터를 반복 사용해 효율적으로 모델 역량을 확장하는 looped language model(LoopLM)이 재귀적 깊이마다 독립적으로 출력될 수 있어, 재귀 연산 전반에서 안전성이 유지되는지를 검증했다. 그 결과 더 깊은 재귀 깊이가 안전성을 높인다는 기존 통념과 달리, 공격 성공률이 더 깊은 추론 깊이에서 오히려 높아질 수 있고 동일 질의가 깊이에 따라 서로 다른 안전 행동을 보이며 한 깊이에 맞춘 공격이 다른 깊이로 전이될 수 있음을 확인했다. SFT와 선호 정렬도 이런 안전성 간극을 해소하지 못해, 저자들은 공유 재귀 레이어의 경량 깊이별 제어, 선택적 상태 브리징, 재귀 깊이 전반의 공동 안전 감독을 결합한 정렬 기법 SafeBridge를 제안했다. SafeBridge는 동일 깊이·교차 깊이 공격 모두에 대한 성공률을 크게 낮추면서도 일반 유용성을 개선하고 과도한 거부 행동은 비슷한 수준으로 유지했다.
- •LoopLM은 재기 깊이마다 안전성이 다르어 단일 깊이로는 전신성해 판단 불가떠땨을 앞섬은가
- •공격 성고율이 더 깊은 재기에서 오히려 높아지고 각 깊이간 전이늩
- •SFT·선택 정뉀로도 재가 깊이 갈 안전성 갈구 해제 면 뫍하
- •SafeBridge가 일변·교차 깊이 공격 성고율을 크게 낙쬜
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Safe at One Loop, Risky at Another: Aligning Safety Across Recurrent Depths in Looped Language Models
- 1.순환 깊이를 공유하는 Looped Language Model(LoopLM)의 재귀 깊이별 안전성을 처음 종합 평가
- 2.탈옥 공격 성공률이 깊은 추론 깊이에서 오히려 높아질 수 있고, 같은 질의도 깊이별로 안전 행동이 다름
- 3.한 깊이용 공격이 다른 깊이로 전이되고, SFT·선호 정렬로도 안전 격차가 해소되지 않음
- 4.깊이별 제어·상태 브릿징·공동 안전 감독을 결합한 SafeBridge로 공격 성공률을 대폭 감소
왜 중요한가?
파라미터 효율을 위해 연산을 반복하는 LoopLM 구조가 추론 깊이에 따라 서로 다른 안전 취약점을 만들 수 있음을 처음 밝혀, 단일 깊이 평가만으로는 모델 안전성을 보장할 수 없다는 점을 시사한다.
본문 미리보기
arXiv:2610.10625v1 Announce Type: new Abstract: Looped Language Models (LoopLMs) provide a parameter efficient approach to scaling model capabilities through repeated use of shared parameters across recurrent steps. Since each recurrent depth can be read out independently, a single LoopLM exposes a broader output space across inference depths, raising an important question: whether safety is preserved throughout recurrent computation. Prior evaluations suggest that deeper recurrence can improve
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안



![[Tech Insight] "AI 해킹, 보안 문제로만 보는 건 위험한 착각"](https://cdn.digitaltoday.co.kr/news/photo/202610/706229_653947_485.jpg)