GPTNT는 협동 비디오 게임 'Keep Talking and Nobody Explodes'로 멀티모달 에이전트 간 실시간 협업을 측정하는 벤치마크다. 한 에이전트는 폭탄을 보고 조작할 수 있지만 해체 매뉴얼이 없고, 다른 에이전트는 매뉴얼만 있어 카운트다운 속에서 실시간 소통 없이는 성공할 수 없는 구조다. 턴 기반 프록시와 달리 비동기 행동과 실시간 커뮤니케이션을 요구하며, 매뉴얼이나 파트너를 선택적으로 제거해 암기 의존과 즉석 추론을 분리할 수 있다. 테스트한 클로즈드·오픈소스 최신 모델 중 실시간으로 폭탄을 해체한 모델은 하나도 없었는데, 인간 플레이어는 통과하는 기준이다. 통제 실험으로 상태 추적, 시간 압박 하 효율적 행동, 모호성 처리, 오류 복구의 약점을 규명했다. 시간 압박·정보 비대칭·불완전한 소통이 동시에 작용하는 협업 능력이 현행 평가의 사각지대임을 보여준다.
- •폭탄 조작자와 매뉴얼 보유자가 분리된 정보 비대칭 구조로 실시간 협업 강제
- •테스트한 모든 최신 모델이 실시간 폭탄 해체 0건 — 인간은 통과하는 기준
- •상태 추적·시간 압박 하 행동·모호성 처리·오류 복구가 핵심 약점으로 식별
- •실제 게임 기반 절차적 생성과 모딩 커뮤니티 덕분에 벤치마크가 계속 진화 가능
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
GPTNT: Benchmarking Real-Time Collaboration Between Multimodal Agents on Keep Talking And Nobody Explodes
- 1.GPTNT, 협력 게임 'Keep Talking and Nobody Explodes' 기반 멀티모달 에이전트 실시간 협업 벤치마크 제안
- 2.한 에이전트는 폭탄만 보고 설명서가 없고, 다른 에이전트는 설명서만 있어 실시간 소통 필수
- 3.턴 기반이 아닌 비동기 행동·실시간 통신 요구, 시간 압박·정보 비대칭·불완전 통신 조건 결합
- 4.테스트한 모든 폐·오픈소스 모델이 실시간 폭탄 해체 0건, 상태 추적·오류 복구 약점 확인
왜 중요한가?
시간 압박·정보 비대칭·불완전 통신이 동시에 작용하는 실시간 협업을 기존 턴 기반 벤치마크는 측정하지 못했다. 사람은 통과하는 과제를 최신 모델이 단 한 개도 풀지 못해, 상태 추적·시간 압박 하 행동·모호성 처리·오류 복구라는 미측정 약점을 드러낸다.
언급 프로젝트
본문 미리보기
arXiv:2606.28514v1 Announce Type: new Abstract: Multimodal models are increasingly deployed to solve tasks collaboratively with humans or other artificial agents. Existing benchmarks show that these models possess many of the required component capabilities, but the conditions that coincide in collaboration, including time pressure, information asymmetry, and imperfect communication, are usually studied in isolation. We introduce GPTNT, a benchmark built on the cooperative video game Keep Talki
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:40AI 초안

