CyberForge는 실제 C/C++ 프로젝트에 취약점을 주입해 재현 가능한 빌드·실행 환경을 갖춘 저장소 단위 보안 학습 데이터를 합성하는 프레임워크로, 방어 측 LLM 에이전트 훈련을 위한 데이터 부족 문제를 해결한다. 주입된 빌드가 프로젝트의 단위 테스트를 통과하고 생성된 취약성 증명(PoV)이 주입된 빌드에서만 작동하고 정상 빌드에서는 작동하지 않는지 동적으로 검증해, 공개된 CVE 데이터에 의존하는 기존 데이터 증강 기법과 달리 확장이 가능하다. 이렇게 구축된 데이터셋은 80개 프로젝트, 63개 취약점 유형에 걸쳐 검증된 취약점 1,034개를 담고 있으며 편집 위치의 국소성도 실제 CVE 패치와 유사했다. 이 데이터로 파인튜닝하면 세 가지 모델 규모와 두 교사 모델의 6개 구성 전부에서 SEC-bench 패치 복구 성능이 3.3~14.7점 향상됐고, 31B 학생 모델은 GPT-5.4-mini 교사 모델과 거의 동등한 성능(72.7% vs 74.0%)에 도달했으며 다른 프로그래밍 언어를 포함한 PatchEval에서도 이 개선이 일반화됐다.
- •실제 C/C++ 프로젝트에 취약점을 주입해 재현 가능한 보안 학습 데이터 합성
- •단위 테스트 통과와 PoV 동작 여부로 각 인스턴스를 동적 검증
- •80개 프로젝트·63개 유형에 걸친 검증된 취약점 1,034개 데이터셋 구축
- •파인튜닝 시 SEC-bench 패치 복구 성능 3.3~14.7점 향상, 31B 모델이 교사 모델에 근접
- •다른 프로그래밍 언어를 포함한 PatchEval에서도 개선 효과 일반화 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
CyberForge: Verified Vulnerability Injection at Repository Level for Cybersecurity Agent Training
본문 미리보기
arXiv:2608.06471v1 Announce Type: new Abstract: Despite recent advances, frontier large language model (LLM) agents remain limited in discovering and patching complex vulnerabilities in real-world software. Generally available agents can already aid attackers, who only need to find one exploitable weakness, while defenders must continuously identify and patch all vulnerabilities across fast-growing codebases. Stronger defensive agents would help close this gap, yet the scarcity of security trai
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:57AI 초안



