연구진은 LLM을 직접 프롬프팅하거나 최종 사용 시나리오로 조건화하면 다양성이 떨어지고 지배적인 패턴으로 수렴하는 문제를 해결하기 위해 생성 흐름 네트워크(GFlowNets)를 활용한 합성 대화 데이터 생성법을 제안했다. 혼동 에피소드 동역학이나 스캐폴딩 지시 균형 같은 핵심 상호작용 특징에 대한 가우시안 혼합 밀도로 잠재 대화 구조를 생성하도록 GFlowNet을 학습시켜, 학습 데이터 내 전문가 전략의 실제 분포 비율에 맞춰 샘플링할 수 있게 했다. 구조적으로 다른 튜터링과 정서적 지지 대화 두 영역에서, 이 방식은 강화학습 및 LLM 종단간 기준선보다 충실도·모드 커버리지·진정성의 균형이 더 우수했으며 학습 데이터를 그대로 베끼지 않았다. 세 가지 하류 결과 예측 과제에서 GFlowNet 생성 대화로 학습한 분류기가 경쟁 합성 기법보다 더 강한 학습 신호를 제공했다.
- •LLM 직접 프놨핑은 지배적 모떼낱늄 크론일은 샘햍 니현 만닫는 문제 지적
- •GFlowNets로 핵심 상호작용 특징의 가우시안 혜합 밀도 기반 잠재 대화 구조 생성
- •휠턴링·정서적 지지 대화 두 영역에서 RL·LLM 종단간 기준선뿐다 더 우수한 충실도·다양성·진정성 김켜
- •학습 데이타를 실제도 밌컴 모사·구촍 도어 전류 전륨 버처 부찫에도 비률대로 샘햍가
- •세 가지 하류 예샱 과제에서 더 강려한 학습 신호 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Beyond Mode Collapse: Generating Diverse Synthetic Expert Conversations via Generative Flow Networks
- 1.GFlowNets 기반 합성 전문가 대화 생성법 제안, 직접 프롬프팅의 모드 붕괴 문제 해결
- 2.혼동 에피소드·스캐폴딩 지시 균형 등 핵심 상호작용 특성의 가우시안 혼합 밀도로 잠재구조 생성
- 3.튜터링·정서지원 대화 2개 도메인서 RL·LLM 베이스라인 대비 충실도·커버리지 균형 우수
- 4.3개 다운스트림 결과예측 과제서 합성 대화로 학습한 분류기가 더 강한 학습 신호 제공
왜 중요한가?
직접 프롬프팅이 지배적 패턴에 수렴해 다양성이 떨어지는 문제를, 학습 데이터를 복제하지 않으면서도 전문가 전략 분포를 보존하는 합성 데이터 생성으로 해결한다.
언급 프로젝트
본문 미리보기
arXiv:2609.38359v1 Announce Type: new Abstract: High quality synthetic data is central to post training LLMs for adaptive AI applications that represent the diverse expert strategies and decisions in conversations. Prompting LLMs directly or conditioning them on end use scenarios yields low diversity data that collapses onto dominant modes. We propose a method to generate diverse high quality synthetic data using Generative Flow Networks (GFlowNets). We show that training GFlowNets to generate
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

