연구 제출량이 수동 검토 역량을 넘어서면서 LLM 기반 논문-코드 불일치 탐지에 대한 관심이 커지고 있다. 하지만 기존 단일 에이전트 LLM 방식은 제한된 맥락 용량과 일방향적 탐지 방식으로 재현율(recall)이 낮다는 한계가 있었다. 연구진은 논문-코드 불일치 탐지를 위한 최초의 이중 탐지 다중 에이전트 시스템 'Dude'를 제안한다. 논문 언어와 코드 언어 간 세분화 수준의 비대칭성이 다중 에이전트 설계에서 과잉 해석과 과잉 보고 문제를 일으켜 오탐을 늘린다는 점을 발견하고, 이를 막기 위해 세분화 수준을 맞추는 협상 방식과 2단계 중요도 필터링 메커니즘을 도입했다. 실제 논문-코드 불일치 데이터셋 실험에서 Dude는 기존 방식 대비 재현율과 정밀도를 최대 22.8%, F1 점수를 최대 18.7% 향상시켰다.
- •연구 제출량 급증으로 수동 검토가 어려워지며 LLM 기반 논문-코드 불일치 탐지 수요 증가
- •기존 단일 에이전트 방식은 제한된 맥락과 일방향 탐지로 재현율이 낮은 한계
- •최초의 이중 탐지 다중 에이전트 시스템 Dude 제안
- •논문-코드 간 세분화 비대칭이 유발하는 과잉 해석·과잉 보고를 세분화 정렬 협상과 2단계 필터링으로 해결
- •실제 데이터셋 실험에서 재현율·정밀도 최대 22.8%, F1 점수 최대 18.7% 향상
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Dude: A Dual-Detection Multi-Agent System for Paper-Code Discrepancy Detection
- 1.Dude는 논문과 코드 간 불일치를 탐지하는 최초의 이중 탐지 멀티에이전트 시스템
- 2.논문 언어와 코드 언어의 세분성 차이로 인한 과잉해석·과잉보고 문제를 발견
- 3.세분성 정합 협상과 2단계 중요도 필터링으로 거짓 불일치 신고를 억제
- 4.실제 데이터셋에서 재현율 최대 22.8%p, F1 최대 18.7%p 개선
왜 중요한가?
연구 논문 제출량이 수작업 검토 역량을 넘어서는 상황에서, 논문-코드 정합성 검증을 자동화해 학술 검증 프로세스의 신뢰성을 높일 실용적 도구를 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2609.03416v1 Announce Type: new Abstract: LLM-empowered paper-code discrepancy detection has received growing concern since the scaling of research submissions exceeds the manual review capability. However, the limited context capacity and one-sided discrepancy detection of existing single-agent LLM paradigms lead to an inferior recall performance in detecting discrepancies. In this paper, we propose Dude, the first Dual-Detection Multi-Agent System for paper-code discrepancy detection. W
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
