자율 침투테스트 에이전트는 표적의 응답을 근거로 다음 행동과 최종 보고서를 결정하지만, 기만적인 응답이 주어지면 공격 경로와 검증 과정 모두가 왜곡될 수 있다. 이 논문은 에이전트가 상충하는 증거를 어떻게 해석하고 방향을 바꾸며 언제 멈추는지를 관찰 가능하게 만드는 평가 프레임워크 ATOBench를 제안한다. 실행 중 등록된 응답 변형을 주입해 변형 에피소드와 동일 환경의 원본 에피소드를 짝지어 비교하고, 익스플로잇 증명·자원 소유권·재사용 가능 산출물 등 3가지 고정된 관찰 계약으로 이후 행동·증거 회수·중단·보고서 근거를 추적한다. 5개 모델 경로에 대해 450개 에피소드를 평가한 결과, 활동량 증가가 오히려 깨진 검증 체인을 가릴 수 있으며, 성공적인 회복은 사용 가능한 증거를 찾아 보고까지 보존하는 능력에 달려 있음을 보였다.
- •표적의 기만적 응답이 침투테스트 에이전트의 공격 경로와 검증 과정을 왜곡할 수 있음을 지적
- •응답 변형 주입 후 원본과 짝지어 비교하는 평가 프레임워크 ATOBench 제안
- •익스플로잉 증명·자원 소유권·재사용 산출물 3개 관찰 계약으로 행동·증거·보고 추적
- •5개 모델 경로 450개 에피소드 평가 결과 활동량 증가가 깨진 검증 체인을 가릴 수 있음을 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
ATOBench: Tracing How Autonomous Penetration-Testing Agents Verify Vulnerabilities When Target Evidence Lies
- 1.자율 침투테스트 에이전트의 기만응답 해석·검증과정을 관찰 가능하게 하는 평가틀 ATOBench 제시
- 2.런타임 응답변형 주입해 원본과 비교, 최초 영향지점부터 행동·증거회수·중단결정·보고근거 추적
- 3.5개 모델 450개 에피소드 평가, 활동량 증가가 깨진 검증체인을 가릴 수 있음을 확인
왜 중요한가?
기존 침투테스트 에이전트 평가는 최종 보고서만 보고 판단해 에이전트가 모순된 증거를 어떻게 다루는지 알 수 없었는데, 이 검증과정 자체를 관찰 가능하게 만들어 신뢰할 수 없는 관측정보에 대한 에이전트의 강건성을 측정하는 새 기준을 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2608.12996v1 Announce Type: new Abstract: Autonomous penetration-testing agents rely on target responses. These responses guide both subsequent actions and the final report. A deceptive response can therefore redirect both the attack trajectory and the agent's verification process. However, final reports reveal little about how an agent interprets conflicting evidence, changes course, decides to stop, or turns observations into a vulnerability claim. We introduce ATOBench, an evaluation f
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:23AI 초안

