이 연구는 LLM이 안전하지 않은 학습 패턴에서 배운 취약한 코드를 재생산하는 문제를, 추론 시점 보강이 아닌 모델 자체를 수정하는 모델 편집(model editing)으로 완화할 수 있는지 체계적으로 검증한 첫 연구다. 3가지 최신 편집 기법을 여러 LLM 계열에 적용해 대표적 추론시점 기법 CoSec과 비교한 결과, 모델 편집은 이미 학습된 취약점 유형에 대해 CoSec보다 큰 보안 향상(기본 모델 대비 15~25%포인트)을 보였지만 처음 보는 취약점에는 잘 전이되지 않고 기능적 정확성을 해칠 수 있었다. 이를 보완하기 위해 기능 튜닝과 편집 인지 정규화를 결합한 후처리 기법 SafeEdit을 제안했으며, 8개 대상 LLM에서 UltraEdit 대비 Pass@1을 온도별로 11.73~15.50%포인트 개선하면서도 보안성은 대체로 유지했고 CoSec 대비 보안비율도 7.54~12.04% 향상시켰다.
- •모델 편집을 코드 보안 강화 기법으로 처음 체계적으로 검증
- •편집 기법은 기존 취약점에 CoSec보다 15~25%p 더 큰 보안 개선
- •처음 보는 취약점에는 전이 안 되고 기능 정확성 저하 위험 발견
- •후처리 기법 SafeEdit이 Pass@1을 최대 15.50%p 개선하며 보안성 유지
- •SafeEdit과 CoSec 결합 시 보안성·정확성 동시 개선 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Understanding and Improving Model Editing for Secure Code Generation
본문 미리보기
arXiv:2608.06848v1 Announce Type: new Abstract: Large language models (LLMs) are widely used for code generation, yet they can reproduce vulnerable implementations learned from insecure training patterns. Prior work has mainly explored inference-time hardening, which reduces insecure generations without modifying the target model but relies on auxiliary components and adds runtime overhead. We conduct the first systematic study of model editing as a model-level hardening mechanism for secure co
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:58AI 초안



