AI 에이전트는 소스코드가 있을 때 사이버보안 분석 역량이 빠르게 향상되고 있지만, 멀웨어·펌웨어·독점 애플리케이션 등 보안상 가장 중요한 소프트웨어 다수는 바이너리 형태로만 존재해 리버스 엔지니어링(RE)이 필요하다. 이 논문은 벤치마크가 LLM 학습 데이터에 노출되지 않으면서도 실제 소프트웨어 규모와 분석 방해 기법을 갖춰야 한다는 상충 요구를 동시에 만족하는 최초의 오염 없는 RE 벤치마크 'SRE-Bench'를 제시한다. RE 전문가들이 5000시간 이상 들여 처음부터 구축했으며, 평균 1만6900줄 규모의 실제 프로그램 19개와 자체 개발한 44개의 분석 방해 기법으로 262개의 바이너리 인스턴스와 1572개의 결정론적 채점 과제를 만들었다. GPT-5.6-sol, Claude-Opus-5 등 5개 최신 LLM을 평가한 결과 최고 성능 모델인 GPT-5.6-sol도 인스턴스당 61.4% 점수, 완전 해결률은 31.5%에 그쳐 RE는 여전히 미해결 과제임이 드러났다.
- •소스코드 분석 역량이 바이너리 리버스 엔지니어링으로는 아직 전이되지 않음을 확인
- •5000시간 이상 투입해 구축한 최초의 오염 없는 RE 벤치마크 'SRE-Bench' 공개
- •실제 규모 프로그램 19개, 바이너리 인스턴스 262개, 결정론적 채점 과제 1572개로 구성
- •최고 성능 GPT-5.6-sol도 인스턴스당 61.4% 점수, 완전 해결률 31.5%에 그침
- •에이전트는 인간과 달리 컴파일러 최적화·정적 링킹에 상대적으로 둥감하게 반응
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark
본문 미리보기
arXiv:2608.11469v1 Announce Type: new Abstract: AI agents are rapidly improving in cybersecurity capabilities when the source code is available for analysis, yet much of the software most consequential to cybersecurity, including malware, firmware, and proprietary applications, is available only as binaries. Analyzing such software requires reverse engineering(RE): recovering program semantics before the analysis can be meaningfully performed. However, evaluating agentic RE poses a fundamental
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:23AI 초안



