연구진이 소스코드에 하드코딩된 비밀 정보를 문자열 정보만으로 탐지하는 StringGroup 기법과 이를 이용한 도구 Secretron을 제안했다. 기존 정규식 기반 탐지는 정밀도와 재현율이 낮고, 문맥 인식 방식은 난독화 취약성, 언어 간 일반화 어려움, 방대하고 노이즈 많은 문맥이라는 세 가지 과제에 부딪혔다. StringGroup은 비밀 주변의 문자열 리터럴만으로 분석 범위를 좁혀 원래 문맥의 33.2%만 사용하고도 의미 정보의 80% 이상을 보존해 신호 대 잡음비를 크게 높였다. 이를 트랜스포머 모델과 결합한 Secretron은 SecretBench 데이터셋에서 F1 98.74%를 기록해 최신 LLM 기반 기준선을 능가했으며, 실제 환경 배치에서 26개 애플리케이션에서 그동안 알려지지 않은 비밀 키 48개를 발견했다. 문자열이라는 단순한 신호만으로도 강력하고 실용적인 비밀 탐지가 가능함을 보여준다.
- •비밀 주변 문자열 리터럴만 분석하는 StringGroup 기법으로 문맥을 33.2%만 사용해 신호 대 잡음비를 높였다
- •이를 트랜스포머와 결합한 Secretron이 SecretBench에서 F1 98.74%로 LLM 기반 기준선을 능가했다
- •난독화·다국어 상황에서도 강한 견고성을 보였다
- •실제 배포 환경에서 26개 애플리케이션에서 미공개 비밀 키 48개를 실제로 탐지했다
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Checked-In Secret Detection: Strings Are All You Need
본문 미리보기
arXiv:2608.04523v1 Announce Type: new Abstract: Hardcoded secrets in source code pose critical security vulnerabilities which can be easily exploited by malicious adversaries. Existing regex-based detection approaches suffer from fundamental limitations, as secrets often lack identifiable patterns, resulting in poor precision and recall. Recent studies have explored context-aware detection methods, as surrounding code can reveal the purpose of candidate strings. However, these methods confront
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:57AI 초안



