AI 시스템이 고도화될수록 외부 통제에만 의존하는 안전 전략은 구조적으로 한계가 있음을 제어 이론으로 증명합니다. 외부 강제력이 임계점을 넘어서면 외부 통제 기반 전략은 클래스 전체로서 실패하며, 유효한 안전 전략은 반드시 내재적(intrinsic)이어야 합니다. 내재적 전략이 충족해야 할 네 가지 구조 요건(외부 강제 미의존, 초기 안전 호환 목표, 자기 수정 후 목표 안정성, 능력 증가 시에도 안전 보존)을 도출했습니다.
- •외부 통제만으로는 고능력 AI의 장기 안전 보장 불가능함을 제어 이론으로 도출
- •외부 강제 기반 전략 전체가 구조적으로 실패하는 조건을 형식적으로 수립
- •유효한 안전 전략은 내재적(intrinsic)이어야 하며 4가지 구조 요건을 충족해야 함
- •완전한 전략을 제안하지 않고 가능한 전략의 범위를 형식적으로 한정
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Sustaining AI safety: Control-theoretic external impossibility, intrinsic necessity, and structural requirements
- 1.외부 통제에 의존하는 AI 안전 전략은 시스템 효과 초과 시 구조적으로 실패함을 제어이론으로 증명
- 2.외부 강제 방식 전체 클래스에 대한 불가능성 결과 도출
- 3.생존 가능한 안전 전략은 반드시 내재적(intrinsic)이어야 한다는 조건부 필요성 확립
- 4.안전 전략의 4가지 구조적 요건: 외부 강제 불의존·목표 호환성·자기수정 안정성·능력 성장 대응
왜 중요한가?
AI 안전 연구의 핵심 논쟁인 외부 통제 가능성에 대해 제어이론 기반의 엄밀한 수학적 한계를 제시해, 향후 안전 전략 설계의 방향을 근본적으로 재정의한다.
본문 미리보기
arXiv:2605.12963v1 Announce Type: new Abstract: As AI systems become increasingly capable, safety strategies must be evaluated not only by how much they reduce present risk, but by whether they could sustain safety once external control can no longer reliably constrain system behavior. This paper addresses that problem by using control theory to clarify, at a structural level, whether externally enforced safety-sustaining strategies can succeed and, if not, what any alternative strategy would h
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

