신용평가 파이프라인을 스스로 개선하는 LLM 에이전트가 모델 가중치는 고정한 채 실행 하네스(지침 텍스트, 도구 호출 로직)만 바꾸도록 제한해야 감사 가능성을 지킬 수 있다는 주장을 담은 연구다. 배포 전 해시체인 기록을 남기는 승인 게이트를 갖춘 이중 루프 엔진을 시뮬레이션으로 평가했으며, 7,449건의 후보 변경 중 144건만 승인되었고 held-out 데이터에서 오류가 악화된 경우는 없었다. 반면 게이트를 '최근 추적에서 오류가 덜 보이면 통과'라는 느슨한 기준으로 바꾸자 같은 루프가 309건의 유해한 변경을 승인했고 90회 실행 중 49회에서 미탐지율이 10%를 넘었다. 구조적 변화는 기본 요소 교체로만 복구 가능했고, EU AI법의 고위험 신용평가 조항과도 연결지으며 미국의 모델 리스크 가이드라인이 에이전트형 AI를 범위에서 제외하고 있다는 점도 지적한다.
- •모델 가중치는 고정, 실행 하네스만 수정하도록 제한해야 자기개선이 감사 가능해진다는 주장
- •해시체인 승인 게이트 적용 시 7,449건 중 144건만 승인, 오류 악화 사례 없음
- •게이트를 느슨하게 바꾸면 309건의 유해 변경이 승인되고 미탐지율 10% 초과가 49/90회 발생
- •구조적 변화는 기본 요소 교체로만 복구 가능, 최고 심도에서는 게이트가 정상 교체도 절반 차단
- •EU AI법 고위험 신용평가 조항과 연결, 미국 모델 리스크 가이드라인의 에이전트 AI 공백 지적
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
The Harness as the Only Mutable Surface: Compliance-Bounded Self-Evolution of LLM Agents in Credit Pipelines, with a Measured Admission Gate
- 1.신용평가를 스스로 개선하는 LLM 에이전트는 감독자가 검토할 변경 기록 자체를 파괴한다는 문제 지적
- 2.가중치는 고정, 하네스만 바꾸는 자기진화를 해시체인 승인 게이트로 기록·검증하는 듀얼루프 엔진 제안
- 3.게이트 적용 시 후보 7449건 중 144건만 승인, 무게이트는 309건의 유해 변경을 승인
- 4.구조적 변화는 고정 허용폭 때문에 절반의 시드서 올바른 교체도 막혀, EU AI Act 고위험 규정과 연결
왜 중요한가?
신용평가 같은 고위험 규제 영역에서 에이전트가 스스로 로직을 바꿔도 감사 가능성을 유지할 장치를 제시해, 2026년 미국 모델리스크 가이드라인이 다루지 못한 공백을 메우는 시사점을 준다.
본문 미리보기
arXiv:2610.10629v1 Announce Type: new Abstract: Self-improving LLM agents can adapt a credit pipeline to a changed rule, but an agent that rewrites itself destroys the artefact a supervisor reviews: a named change, a recorded test, an approval. We argue that self-evolution is reviewable only if it is confined to the runtime harness (instruction text, tool-call logic and primitive composition) while model weights stay fixed, so that every adaptation is a diff with a cause and a test attached. We
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안



![[Tech Insight] "AI 해킹, 보안 문제로만 보는 건 위험한 착각"](https://cdn.digitaltoday.co.kr/news/photo/202610/706229_653947_485.jpg)