직업별로 상세하게 작성된 시스템 프롬프트가 토큰 사용량과 비용만 늘릴 뿐 정확도는 일관되게 높이지 못한다는 것을 대규모 실험으로 보였다. 503개의 직업 특화 프로필을 9개 과학 벤치마크, 4,531개 질문으로 평가한 결과 프로필과 베이스라인의 평균 정확도 차이는 -0.6%p로 통계적으로 뚜렷한 개선이 없었던 반면, 출력 토큰은 1.5~2.3배, 비용은 2.2~4.5배 늘었다. 60개의 도구 사용 생물정보학 문제에서는 프로필 사용 시 해결률이 오히려 10.0%p 낮았는데, 이는 토큰·시간 제한 초과가 더 빈번했기 때문이다. 다만 SuperGPQA에서는 긴 프롬프트가 API 오류 상황에서 첫 시도 정답률을 54.0%에서 71.6%로 끌어올리는 의외의 효과를 보였는데, 이는 도메인 전문성이 아니라 프롬프트 길이·형식 자체에서 온 것으로 분석됐다.
- •503개 직업 특화 시스템 프롬프트를 테스트했으나 9개 과학 벤치마크 전체에서 통계적으로 뚜렷한 정확도 개선 없음
- •프로필 사용 시 출력 토큰 1.5~2.3배, API 비용 2.2~4.5배 증가하는 비용 부담만 확인
- •도구 사용 생물정보학 문제에서는 프로필 적용 시 해결률이 오히려 10.0%p 낮아짐(토큰·시간 제한 초과 때문)
- •긴 프롬프트가 API 오류 상황에서 첫 시도 정답률을 높이는 효과는 발견했으나 도메인 전문성과는 무관
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Scientific Agents: Evaluating Profession-Specific System Prompts on Scientific Tasks
- 1.503개 직업별 시스템 프롬프트(AGENTS.md)를 Gemini 3.8 Flash로 9개 과학 벤치마크에서 평가
- 2.직업별 프롬프트는 기본 프롬프트 대비 정확도 평균 -0.6%p로 유의미한 개선 없음
- 3.토큰 1.5~2.3배, 비용 2.2~4.5배 증가하면서 BioMysteryBench 해결률은 46.7%로 기본(56.7%)보다 낮음
- 4.다만 SuperGPQA에서는 API 오류 시 긴 프롬프트가 첫 응답 정답률 71.6%로 기본(54.0%)보다 안정적
왜 중요한가?
전문가용 롱 시스템 프롬프트가 과학 작업 정확도를 높인다는 통념과 달리 비용만 늘릴 뿐 성능은 개선하지 않는 경우가 많다는 실증 데이터로, 에이전트 프롬프트 설계의 비용 대비 효과를 재고하게 한다.
본문 미리보기
arXiv:2610.00084v1 Announce Type: new Abstract: Detailed profession-specific system prompts raise token use and estimated cost per response without a consistent accuracy gain. We evaluate Scientific Agents, an open-source corpus of 503 profession-specific AGENTS.md profiles, with Gemini 3.8 Flash via OpenRouter in the Pi agent harness. We compare matched profiles with four controls: a minimal baseline ("You are a helpful assistant"), the profile's opening role sentence, a generic scientific rig
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

