PERSA는 특정 교수의 피드백 스타일에 LLM을 맞추기 위한 RLHF 파이프라인으로, 지도 파인튜닝, 쌍별 선호도 보상 모델링, PPO를 결합한다. 파라미터 효율적 파인튜닝으로 상위 트랜스포머 블록만 업데이트하여 전역 파라미터 드리프트를 최소화한다. APPS 벤치마크에서 Llama-3 기준 스타일 정렬 점수(SAC)가 34.8%에서 96.2%로 향상되었으며 정확도 100%를 동시에 달성했다. 세 가지 코드 피드백 벤치마크에서 최고 성능을 기록하여 개인화 교육 AI 피드백의 실용적 경로를 제시한다.
- •PERSA는 지도 파인튜닝, 보상 모델링, PPO를 결합한 RLHF 파이프라인으로 LLM의 피드백 스타일을 특정 교수에 맞춘다.
- •파라미터 효율적 파인튜닝을 통해 상위 트랜스포머 블록만 업데이트하여 전역 파라미터 드리프트를 최소화한다.
- •APPS 벤치마크에서 Llama-3 기준 스타일 정렬 점수가 34.8%에서 96.2%로 대폭 향상되었으며 정확도도 100%를 달성했다.
- •APPS, PyFiXV, CodeReviewQA 세 벤치마크에서 최고 성능을 기록하며 개인화 교육 피드백 AI의 실용성을 입증했다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
PERSA: Reinforcement Learning for Professor-Style Personalized Feedback with LLMs
본문 미리보기
arXiv:2605.01123v1 Announce Type: new Abstract: Large language models (LLMs) can provide automated feedback in educational settings, but aligning an LLMs style with a specific instructors tone while maintaining diagnostic correctness remains challenging. We ask how can we update an LLM for automated feedback generation to align with a target instructors style without sacrificing core knowledge? We study how Reinforcement Learning from Human Feedback (RLHF) can adapt a transformer-based LLM to g
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:12AI 초안

