이 논문은 LLM이 C/C++ 코드를 맥락으로 읽을 때, 완성된 코드를 사후에 검사하는 기존 방어와 달리 모델 내부의 은닉 활성화 자체에 이미 취약점 여부에 대한 신호가 담겨 있는지를 검증한다. 연구진은 세 모델 계열의 4개 LLM(Granite-4.1-8B, Qwen3.5-9B, Qwen3.6-27B, Gemma-4-12B)에서 마지막 프리필 토큰 활성화를 추출해 MLP 프로브를 학습시키고, Devign·Big-Vul·Draper VDISC·PrimeVul 등 4개 함수 단위 벤치마크로 평가했다. 프로브는 기본 모델 크기의 0.2% 미만인 1,340만~1,600만 파라미터만으로 평균 F1 41.7%를 달성했으며, Devign에서는 최고 성능 프로브(Qwen3.5-9B, F1 68.8%)가 발표된 파인튜닝 분류기 최신 성능(67.9%)과 맞먹었지만, 더 어렵고 불균형한 벤치마크에서는 여전히 뒤처졌다. 이는 코딩 LLM의 내부 표현 자체가 임의 코드의 취약점 상태에 관한 정보를 담고 있음을 보여주는 초기 증거로, 경량화된 모델 내재형 취약점 탐지 연구의 동기를 제공한다.
- •LLM의 은닉 활성화만으로 C/C++ 코드의 취약점 여부를 판별하는 경량 MLP 프로브를 학습·평가했다.
- •프로브는 기본 모델의 0.2% 미만 크기(1,340만~1,600만 파라미터)로 평균 F1 41.7%를 달성했다.
- •Devign 벤치마크에서 최고 프로브(F1 68.8%)가 기존 파인튜닝 분류기 최신 성능(67.9%)과 맞머졌다.
- •더 어렵고 불균형한 벤치마크(Big-Vul, Draper VDISC, PrimeVul)에서는 여전히 기존 최신 성능에 뒤처졌다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Probing the Prefill: Detecting Code Vulnerabilities via Latent Activations
- 1.LLM 은닉 활성화가 코드 취약점 신호를 담고 있는지 4개 모델서 MLP 프로브로 검증
- 2.기반 모델 0.2% 미만 파라미터로 평균 F1 41.7%, Devign서 SOTA(67.9%) 넘는 68.8%
- 3.Big-Vul 등 어렵고 불균형한 벤치마크선 SOTA에 못 미쳐, 초기 증거 단계임을 시사
왜 중요한가?
별도 분류기 없이 코딩 LLM 자체의 은닉 표현만으로 취약점 여부를 저비용 탐지할 수 있다는 가능성을 보여줘, LLM 기반 코드 생성 파이프라인에 내장형 보안 체크를 추가하는 경량화 방향을 제시한다.
본문 미리보기
arXiv:2608.16970v1 Announce Type: new Abstract: LLM-based code generation is now embedded in mission-critical pipelines, but defenses against vulnerable output remain post-hoc -- static analyzers, fine-tuned classifiers, or an LLM judge that screen completed code, ignoring the generating model's own internal state. We test a narrower, directly measurable question: when an LLM reads a piece of C/C++ code as context, do its hidden activations already carry a signal about that code's vulnerability
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:02AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
