이 논문은 코딩 에이전트가 엔지니어 감독 하에 일하거나 임상 모델이 방사선의를 보조하는 상황에서, 인간-AI 협업 워크플로가 인간 단독이나 에이전트 단독보다 나은지 판단하려면 두 대안 모두를 리플레이해야 하지만 이는 전문가 시간이나 연산 비용이 크다는 문제를 다룬다. 각 과제에 인간 단독·에이전트 단독 두 가지 리플레이 확률을 부여하고, 기존 지식으로 예측하기 어려운 비교일수록 확률을 높이고 리플레이 비용이 클수록 낮추는 규칙인 TEAM-Design을 제안한다. 이 규칙이 예산 제약 하 설계 문제를 해결하며 무작위 리플레이 추출로도 워크플로가 두 대안을 모두 이긴다고 잘못 선언할 확률을 통제함을 증명했다. 6개 임상 사례와 1개 코딩 벤치마크를 재분석해 난이도 격차가 클 때 가장 효과적임을 확인했다.
- •인간-AI 워크플로의 배치 결정을 위한 예산 제약형 리플레이 설계 규칙 TEAM-Design 제안
- •예측이 어려운 비교일수록 리플레이 확률을 높이고 비용이 클수록 낮추는 방식으로 확률 배분
- •무작위 리플레이 추출로도 잘못된 워크플로 채택 판단 확률을 통제함을 이론적으로 증명
- •6개 임상 사례·1개 코딩 벤치마크 재분석에서 난이도 격차가 클 때 가장 효과적임을 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Beyond "AI Helps Humans": Decision-Targeted Evaluation Design for Human-Agent Teams in the Agentic Era
- 1.인간-AI 협업 워크플로우 배포 여부 판단을 위한 'TEAM-Design' 방법론 제안
- 2.제한된 재현(replay) 예산 하에서 인간전용/에이전트전용 재현을 어디에 배정할지 결정하는 규칙
- 3.임상 6개 사례와 코딩 벤치마크 1개에 적용, 실제 흉부 X-ray 판독 데이터로도 검증
- 4.두 대안 비교의 난이도 차이가 클 때 가장 효과적, 난이도가 비슷하면 분산기반 배분보다 못할 수도 있음
왜 중요한가?
코딩 에이전트나 의료 진단 보조처럼 인간-AI 협업 배치의 실익을 검증할 때, 제한된 검증 자원을 어디에 써야 하는지에 대한 통계적 근거를 제공한다.
언급 프로젝트
본문 미리보기
arXiv:2609.05527v1 Announce Type: new Abstract: Wherever a coding agent works under engineer supervision, or a clinical model assists a radiologist, the deployment question is whether to keep the human-AI workflow or replace it with the human alone or the agent alone. The human-AI workflow is worth keeping only if it beats both of those alternatives. Yet once it is deployed, neither alternative outcome is observed: recovering one means replaying the task under that alternative, and every replay
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

![[10월8일] “수학 문제 4000개에 AI 투입해 성과”…오픈AI가 보여준 과학연구의 변화](https://cdn.aitimes.com/news/photo/202610/216072_220045_048.png)

