과학 코딩 에이전트가 자신이 수정한 프로그램을 평가할 때 텍스트 설명 대신 실행 가능한 검사 도구를 제공하면 복구 성공률이 올라간다는 것을 보였다. 동일한 검사·시작 프로그램·모델·예산을 공유한 채 비교한 결과 전체 복구 성공률은 텍스트 26/30, 도구 29/30이었다. 대체 시작 프로그램을 쓴 개발 노출 과제에서는 도구 그룹이 7/10으로 텍스트 그룹 3/10을 크게 상회했고, PDE 비교에서는 도구 그룹이 텍스트와 동등한 정확도를 내면서 모델 출력량을 31.2% 줄였다. 결과는 과제에 따라 달라지지만, 실행 가능한 검사가 텍스트 설명보다 일관되게 비용을 줄이면서 복구 성공률을 유지하거나 높일 수 있음을 보여준다.
- •실행 가능한 검사(R2T)를 제공한 그룹이 SciCode 복구 과제에서 텍스트 설명 그룹보다 복구 성공률이 동등하거나 우세
- •대체 시작 프로그램을 쓴 개발 노출 과제에서는 도구 그룹이 7/10으로 텍스트 그룹 3/10을 크게 상회
- •PDE 비교에서 도구 그룹은 텍스트 그룹과 동등한 정확도를 내면서 모델 출력량은 31.2% 절감
- •결과는 과제 유형에 따라 달라지지만 실행 가능한 검사가 비용 효율성 측면에서 일관된 이점을 보임
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Rules to Tools: Executable Checks for LLM Agents in Scientific Computing
- 1.Rules to Tools(R2T), 과학 코딩 에이전트에 실행형 검증 체크를 제공해 코드 복구율 향상
- 2.SciCode에서 텍스트 지침 26/30 대비 실행형 체크 적용 시 29/30으로 상승
- 3.8개 과제 코호트에서도 13/16→15/16, PDE 비교에서는 모델 출력량 31.2% 감소
- 4.두 번째 24개 과제 코호트에서는 13/24로 동률—효과가 과제 의존적임을 시사
왜 중요한가?
과학 컴퓨팅 에이전트에 자연어 지침 대신 실행 가능한 체크를 주면 복구 성능과 비용을 함께 개선할 수 있지만, 효과가 과제별로 달라 일괄 적용에는 신중해야 함을 보여준다.
언급 프로젝트
본문 미리보기
arXiv:2610.00313v1 Announce Type: new Abstract: Scientific coding agents receive equations, boundary conditions, and output requirements in writing, then must assess the programs they revise. Rules to Tools (R2T) supplies prepared executable checks of public scientific requirements. Matched SciCode repair groups share written checks, starting programs, model, and budgets; the tool group receives a callable implementation. Across two task-ID cohorts, complete repair is 26/30 with text and 29/30
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

