PHREEQC-MCQ-200은 수용액 지구화학 시뮬레이터 PHREEQC를 다루는 도구 증강 LLM 에이전트를 진단하는 벤치마크로, 검증된 21개 시나리오에서 파생한 객관식 문항 200개로 구성된다. 에이전트는 시뮬레이터 입력을 구성하고 실행한 뒤 구조화된 출력을 해석해 답해야 한다. 여러 프런티어·중위급 모델에서 시뮬레이터 접근이 전체 정확도를 크게 높였지만, 도구 없이 맞히던 문항을 도구 사용 후 틀리는 회귀도 드러나 평균 정확도만으로는 숨겨지는 문제를 확인했다. 목차형 출력 인터페이스는 강한 모델에는 토큰 비용을 줄이면서 정확도를 유지했으나 중위급 모델에는 오히려 성능을 떨어뜨려, 과학 에이전트 평가에 문항 단위 유지율과 출력 접근 민감도 보고가 필요함을 보였다.
- •검증된 21개 PHREEQC 시나리오에서 파생한 200문항으로 도구 증강 과학 에이전트를 종단간 진단
- •시뮬레이터 접근이 전체 정확도를 크게 높이지만, 도구 사용 후 오히려 틀리는 회귀 문항도 존재
- •목차형(TOC) 출력 인터페이스는 강한 모델에서 토큰 비용 절감, 중위급 모델에서는 성능 저하
- •정확도 외에 문항 유지율, 출력 접근 민감도, 계산 체인 실패 지점 보고를 평가 기준으로 제안
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
PHREEQC-MCQ-200: A Diagnostic Benchmark for Tool-Augmented Scientific Simulator Agents
- 1.수용액 지구화학 시뮬레이션에서 도구 증강 에이전트를 평가하는 벤치마크 PHREEQC-MCQ-200 공개
- 2.검증된 21개 PHREEQC 시나리오 기반 200개 객관식 문항으로 구성
- 3.시뮬레이터 접근이 정확도를 높이지만 도구 없이 맞힌 문항을 잃는 비단조적 회귀도 발생
- 4.목차형 출력 인터페이스는 강한 모델엔 효율적이나 중급 모델 성능은 저하
왜 중요한가?
과학 도구 사용을 단순 도구 호출이 아닌 종단 간 진단 문제로 재정의하고, 평균 정확도가 감추는 문항별 유지율·출력 접근 민감도·실패 지점까지 보고해야 함을 실증한다.
언급 프로젝트
본문 미리보기
arXiv:2607.00436v1 Announce Type: new Abstract: Large language model agents are increasingly connected to scientific software, yet it remains unclear when tool access makes scientific computation more reliable rather than merely more complex. We introduce PHREEQC-MCQ-200, a benchmark for evaluating tool-augmented agents on deterministic aqueous-geochemistry simulations. The benchmark contains 200 multiple-choice questions derived from 21 validated PHREEQC scenarios, requiring agents to construc
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

