TRACE는 인간 운영자·AI 의사결정 모듈·자동 제어기가 결합된 사이버-물리 시스템에서 드리프트(drift)와 오류가 여러 계층에 걸쳐 어떻게 전파되는지 진단하기 위한 다계층 벤치마크다. 가정용 작업 지시 벤치마크 ALFRED에서 파생된 궤적에 통제된 드리프트를 주입해 1,918개의 궤적을 구축했으며, 상태·관측·결정·규칙·제어의 5개 계층별로 드리프트 유형·시작 시점·책임 주체·인과 기제를 라벨링했다. 온셋 정보 누출을 제거한 정직한 평가에서도 영향받은 계층 예측은 매크로 F1 약 0.70, 책임 주체는 약 0.85로 무작위·다수결 기준선을 크게 상회했으며, 무거운 어텐션 모델도 단순 모델 대비 이점이 없었다. 인간-AI 협업 시스템의 실패 지점을 정밀 진단할 수 있는 도구를 제시한다.
- •5개 실행 계층에 걸친 드리프트 전파를 진단하는 벤치마크
- •ALFRED 기반 1,918개 드리프트 궤적 구축, 원인·시점·책임자 라벨링
- •온셋 누출 제거한 정직한 평가에서도 영향 계층 F1 약 0.70
- •무거운 어텐션 모델이 단순 모델 대비 이점 없음을 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
TRACE: A Multi-Layer Benchmark for Human AI Controller Coordination Under Drift and Failure
본문 미리보기
arXiv:2608.06657v1 Announce Type: new Abstract: Modern cyber-physical and AI-assisted systems couple human operators, AI decision modules, and automated controllers in a single control loop, so trustworthiness depends on the whole loop, not any one model. Yet no standard benchmark captures time-aligned, multi-layer traces of how drift and failures propagate across these layers, so we cannot diagnose where coordination breaks down, why, or how to recover. This paper targets one facet of that gap
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

