WeSCE는 명시적 보안 요구사항 없이 기능적 목표만 주어진 '약한 보안 제약' 조건에서 코드 편집이 보안을 얼마나 저해하는지 정량화하는 벤치마크다. 실제 코드에서 파생된 400개의 실행 가능한 프로그램으로 기능 추가·제거, 버그 수정, 리팩토링을 다룬다. 이질적인 취약점 신호를 통합 공식으로 집계하는 연속적 위험 표상을 제안하고, 코드 변환 과정에서 전체 위험·최악 심각도·취약점 분포 변화를 포착하는 드리프트 척도를 정의해 평균적 상황부터 최악의 경우까지 다중 스케일로 보안을 조망한다. LLM이 기능 요구만 반영하고 보안은 명시적으로 요구받지 않을 때 코드 편집이 보안을 어떻게 훼손하는지 체계적으로 측정할 수 있는 도구를 제공한다.
- •약한 보안 제약(기능 목표만 명시) 하의 코드 편집 보안 드리프트 측정 벤치마크
- •실제 코드 기반 400개 실행 가능 프로그램으로 구성
- •기능 추가·제거, 버그 수정, 리팩토링 4가지 작업 유형 다루
- •이질적 취약점 신호를 통합하는 연속적 위험 표상 제안
- •전체 위험·최악 심각도·취약점 분포 변화를 반영하는 다중 스케일 드리프트 첩도
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
WeSCE: A Benchmark for Measuring Security Drift in LLM-Driven Code Editing
- 1.WeSCE 벤치마크 공개, 보안 요구 없는 '기능 중심' 코드 편집 400개로 보안 드리프트 정량화
- 2.실제 코드 기반 400개 실행 가능 프로그램, 기능추가·삭제·버그수정·리팩터링 시나리오 포괄
- 3.이질적 취약점 신호 통합한 연속적 위험 표현과 다중 스케일 드리프트 지표 제안
왜 중요한가?
코딩 에이전트가 기능 요구만 보고 보안을 고려하지 않을 때 생기는 위험을 정량 측정할 표준 벤치마크가 없었다는 점에서, 에이전틱 코딩 도구의 보안 평가에 실질적 기준을 제공한다.
언급 프로젝트
본문 미리보기
arXiv:2608.15092v1 Announce Type: new Abstract: In this work, we introduce WeSCE, a benchmark for quantifying security drift in code editing under weak-security constraints, where tasks specify only functional objectives without explicit security requirements. WeSCE consists of 400 executable programs derived from real-world code, covering feature addition, feature removal, bug fixing, and refactoring. To quantify security drift, we propose a continuous risk representation that aggregates heter
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:02AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
