허깅페이스 연구자가 바이럴을 일으킨 수채화 그림 AI 프로젝트를 TRL과 OpenEnv로 완전히 공개된 파이프라인으로 재현했다. Qwen3.5-35B-A3B 모델을 GRPO로 학습시켜 p5.brush 라이브러리로 수채화를 그리는 자바스크립트 코드를 생성하도록 했으며, 보상은 코드 정상 동작 여부, 길이, Qwen3-VL 기반 쌍대비교 심사, HPSv3 미적 선호 모델을 가중합해 구성했다. 심사 모델 가중치를 달리한 세 차례 학습(judge-led, hps-led, hps-only) 모두 학습이 진행될수록 나쁜 그림 비율이 크게 줄었고, 심사 모델 비중이 클수록 결과물이 더 다양하고 예술적으로 흥미로웠다. 178개의 직접 평가한 참조 그림 풀이 보상 함수의 핵심이며, 학습 데이터·환경·모델을 모두 공개해 다른 주제(동물, 애니메이션)로도 재현 가능함을 보였다.
- •Qwen3.5-35B-A3B를 GRPO로 미세조정, p5.brush로 수채화를 그리는 JS 코드 생성 학습
- •보상 함수: 코드 정상성·길이·Qwen3-VL 쌀대비교 심사·HPSv3 미적 선호도 가중합
- •심사 모델 비중을 달리한 3개 런(judge-led·hps-led·hps-only) 비교, 심사 비중 클수록 다양성 향상
- •178개 수작업 평가 참조 그림 풀이 보상의 핵심, 데이터·환경·모델 전체 오픈소스 공개
- •LoRA target_modules를 all-linear로 바꾸는 등 MoE 모델 학습 트러블슈팅 과정도 상세 공유
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Training a coding model to paint watercolours with TRL and OpenEnv
- 1.Surya Narreddi의 바이럴 수채화 AI 영상 프로젝트를 TRL·OpenEnv로 재현, 전 과정 공개
- 2.GRPO로 Qwen3.5-35B-A3B 학습, p5.brush 10개 메서드만 허용해 붓질을 JS 코드로 생성
- 3.보상은 페어와이즈 심사(Qwen3-VL-30B-A3B)와 미학 선호 모델 HPSv3 조합, 3가지 비중 비교
- 4.judge 비중 높을수록 그림이 더 다양·예술적, 178장 수작업 평가셋이 보상의 실질적 병목
왜 중요한가?
정답이 없는 '취향'을 RL 보상으로 다루는 실전 사례로, 소규모 사람 평가 데이터셋이 모델의 미적 결과물을 좌우한다는 점에서 RLHF식 미학 튜닝의 한계와 가능성을 동시에 보여준다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:39AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
