대형언어모델의 성능을 끌어내려면 정교하게 작성된 프롬프트가 필요한 경우가 많아, 이는 비전문가 사용자에게 진입장벽으로 작용한다. 연구진은 사용자의 프롬프트를 하위 LLM 성능 향상이라는 명시적 목표에 맞춰 다시 써주는 'Task-Aware Prompt Rewriter(TAPR)'를 제안했다. 재구성된 프롬프트와 그 결과물 모두에 대한 LLM 심판 평가를 보상으로 삼아 그룹 상대 정책 최적화(GRPO) 강화학습으로 학습시켰으며, 질의응답·요약·산술추론 등 다양한 과제에서 기본 모델 대비 일관된 프롬프트 재작성 성능 향상을 보였다. 특히 Phi-4-mini-instruct를 TAPR 기반 모델로 파인튜닝하면 더 명확하고 지시적인 언어의 프롬프트가 생성돼 Natural Questions와 GSM8K 같은 표준 벤치마크에서 정확도가 높아졌다.
- •비전문가의 프롬프트 작성 부담을 줄이는 Task-Aware Prompt Rewriter(TAPR) 제안
- •재구성된 프롬프트와 과제 결과 모두에 대한 LLM 심판 보상으로 GRPO 강화학습 적용
- •질의응답·요약·산술추론 등 다양한 과제에서 기본 모델 대비 일관된 향상
- •Phi-4-mini-instruct 파인튜닝시 더 명확한 프롬프트 생성, Natural Questions·GSM8K 정확도 상승
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
TAPR: Enhancing LLM Performance with a Task-Aware Prompt Rewriter
본문 미리보기
arXiv:2607.28657v1 Announce Type: new Abstract: Large Language Models (LLMs) often require carefully crafted prompts to unlock their full potential, which can be a barrier for non-expert users. This work addresses the challenge by introducing a Task-Aware Prompt Rewriter (TAPR), a model that reformulates user prompts into task-optimized prompts with the explicit goal of improving downstream LLM performance. We train TAPR using reinforcement learning with Group Relative Policy Optimization (GRPO
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:10AI 초안

