LLM 에이전트의 「제안했다」와 「실제로 검증된 효과를 냈다」는 서로 다른 주장임을 구분하기 위해, 승인·실행·재확인·승격 단계를 명시적으로 표현하는 Praxa 에이전트 하네스를 제시했다. 자체 감사에서 1,027개 단위 테스트를 모두 통과했으나 독립 재현 자료는 미공개였고, Terminal-Bench 파일럿에서는 신뢰성 레이어 추가군이 토큰을 50% 더 쓰면서도 기준군과 동일한 17/36의 성공률을 보여 우월성을 입증하지 못했다. 코디네이션 비교에서는 두 방식이 180회 중 180회로 동일한 정확도를 보였지만 후보 방식이 토큰을 37% 덜 썼다. 저자들은 Praxa의 기여가 권한-효과 전환을 명시적으로 만든 아키텍처에 있을 뿐, 적대적 보안성이나 실사용자 이득, 일반적 우수성을 입증하는 것은 아니라고 명확히 선을 긋는다.
- •제안·권한·실행·검증된 효과·승격을 구분해 명시하는 Praxa 에이전트 하네스를 제안
- •자체 감사에서 1,027개 단위 테스트 전부 통과했으나 독립 재현 가능한 원시 데이터는 미공개
- •Terminal-Bench 파일럿에서는 신뢰성 레이어 추가가 토큰을 50% 더 쓰면서도 성능 우위를 보이지 못함
- •저자들 스스로 적대적 보안성, 실사용자 이득, 일반적 우수성은 입증되지 않았다고 명시
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
From Proposal to Verified Effect: Praxa, an Evidence-Bound Harness for Governed AI Agent Execution
- 1.Praxa, LLM 에이전트의 '제안→승인→실행→외부효과 확인→검토' 단계를 명시적으로 구분하는 하니스 공개
- 2.저자 운영 단위테스트 1027/1027, Workerd 테스트 89/89 통과·363개 소스 파일 계측
- 3.Terminal-Bench 파일럿(12과제)에서 기본·신뢰성 계층 모두 17/36 통과—신뢰성 계층은 토큰을 37~51% 더 써도 우위 없음
- 4.별도 비교에서 소스 저작 후보가 동일 정확도로 토큰 37.11%·비용 33.84% 절감했으나 품질·프로덕션 우위는 미입증
왜 중요한가?
에이전트의 '실행했다는 주장'과 '실제 외부 효과'를 구분해 검증 가능하게 만든 설계이지만, 저자 스스로도 보안성·프로덕션 안전성·범용 우위는 아직 증명되지 않았다고 명시해 과장 없는 평가가 필요함을 보여준다.
언급 프로젝트
본문 미리보기
arXiv:2610.00015v1 Announce Type: new Abstract: Large-language-model agents can propose and execute actions, but proposal, authority, dispatch, verified external effect, and serving promotion are different claims. We present Praxa, an agent harness that represents these states explicitly through deterministic admission, brokered execution, external read-back, reconciliation, and reviewed promotion. We report four evidence lanes. First, an author-run repository-local audit at a pinned revision p
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

