시스템 프롬프트 최적화를 위한 베이지안 최적화 프레임워크 ReElicit을 소개한다. 이 방법은 LLM이 태스크 설명과 기존 평가 프롬프트를 바탕으로 해석 가능한 특징 공간을 동적으로 구성하고, 가우시안 프로세스 서로게이트와 획득 함수를 통해 다음 탐색 벡터를 선택한다. 평가 예산 30회 조건에서 10가지 시스템 프롬프트 최적화 태스크에 걸쳐 집계 피드백만 사용하는 기준선 중 최고 성능을 달성했다. 이 연구는 LLM이 프롬프트 생성기를 넘어 자연어 아티팩트 최적화를 위한 적응형 의미 표현 구축자로 기능할 수 있음을 보여준다.
- •집계 지표만을 피드백으로 사용하는 제약 조건에서 시스템 프롬프트를 최적화하는 ReElicit 제안
- •LLM이 프롬프트-점수 이력을 기반으로 해석 가능한 특징 공간을 동적으로 재구성
- •가우시안 프로세스 서로게이트와 획득 함수로 다음 탐색 특징 벡터를 선택해 효율적 탐색
- •10가지 태스크 30회 평가 예산에서 집계 전용 기준선 중 최고 성능 달성
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Embedding by Elicitation: Dynamic Representations for Bayesian Optimization of System Prompts
- 1.ReElicit: 집계 피드백만으로 시스템 프론프트를 최적화하는 베이지안 최적화 프레임워크
- 2.LLM이 하타 간결하주고 해석 가능한 특성 공간을 도출, GP 대리모델이 이를 활용해 최적 프론프트 선택
- 3.10개 프론프트 최적화 태스크에서 30회 평가 예산으로 최고 성능 달성
왜 중요한가?
개별 레이블 없이 집계 지표만으로 시스템 프롬프트를 체계적으로 최적화할 수 있어 프로덕션 AI 운영에 바로 적용 가능한 실용적 방법론을 제공한다.
언급 프로젝트
본문 미리보기
arXiv:2605.19093v1 Announce Type: new Abstract: System prompts are a central control mechanism in modern AI systems, shaping behavior across conversations, tasks, and user populations. Yet they are difficult to tune when feedback is available only as aggregate metrics rather than per-example labels, failures, or critiques. We study this aggregate feedback setting as sample-constrained black-box optimization over discrete, variable-length text. We introduce ReElicit, a Bayesian optimization fram
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

