STEP-KTODER는 코드 생성에서 함수 단위 실행 피드백으로 선호 최적화를 수행하는 프레임워크다. 수학 추론과 달리 코드 생성에는 표준화된 '스텝' 개념이 없다는 문제를 해결하기 위해, 다중 함수로 분해된 프로그램의 모듈 수준 함수를 스텝으로 정의하고 자동 생성된 단위 테스트로 이진 정답 라벨을 부여한다. HumanEval(+), MBPP(+), BigCodeBench, LiveCodeBench에서 평가한 결과 결과 기반 KTO 및 DPO보다 성능이 향상됐다. 추가 분석에서는 LLM을 채점자로 쓴 라벨링이 함수 실패를 체계적으로 과대 예측해 긍정 라벨을 오염시키고 최적화 성능을 떨어뜨려, 실행 기반 라벨의 필요성을 확인했다.
- •다중 함수 프로그램의 모듈 수준 함수를 '스텝'으로 정의
- •자동 생성 단위 테스트로 함수별 이진 정답 라벨 부여
- •HumanEval(+), MBPP(+), BigCodeBench 등에서 기존 KTO·DPO 대비 성능 향상
- •LLM 채점 라벨링은 함수 실패를 과대 예측해 성능 저하 유발
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Function-Level Execution Feedback for Code Preference Optimization
- 1.코드 생성 프로세스 감독을 위해 함수 단위를 '스텝'으로 정의, 자동생성 유닛테스트로 정오 라벨 부여하는 STEP-KTODER 제안
- 2.함수수준 프로세스 감독+전체 프로그램 결과 피드백 결합, 4개 코드벤치마크서 KTO·DPO 대비 성능향상
- 3.LLM 심판 라벨링은 함수 실패를 체계적으로 과대예측해 긍정라벨 오염시키고 성능 저하시킴, 실행기반 라벨 필요성 입증
왜 중요한가?
코드 생성 훈련에서 모호했던 '스텝' 개념을 함수 단위+실제 실행 테스트로 명확히 정의해, 수학 추론에만 적용되던 프로세스 감독 기법을 코드 도메인으로 확장하는 구체적 방법을 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2608.23632v1 Announce Type: new Abstract: Process supervision has improved mathematical reasoning, where intermediate steps are naturally expressed as chains of thought. In code generation, however, process supervision remains underexplored because there is no standard notion of a step. Supervision can target lines, reasoning traces, or program states, making it unclear what to label and optimize. We propose STEP-KTODER, a framework for code preference optimization that defines steps as m
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:39AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
