연구진은 디스크리트 디퓨전 언어모델의 지도 미세조정에서 토큰 마스킹 방식이 성능을 좌우한다는 점에 착안해 GoldiMask를 제안했다. 균일 무작위 마스킹과 달리, GoldiMask는 서브모듈러 목적함수를 근사 최적화해 어떤 토큰을 맥락으로 공개하고 어떤 토큰을 예측 대상으로 남길지 선택하며, 남은 예측 대상에는 맥락으로부터의 이득과 학습 잠재력에 따라 가중치를 부여한다. 세 가지 백본과 세 가지 학습 데이터셋에서 GoldiMask는 대부분의 설정에서 평균 정확도가 가장 높았으며, 추론과 코드 생성 모두에서 성능 향상을 보였다. 또한 GSM8K와 MATH-500에서 신뢰도 임계값 기반 병렬 디코딩 시 디코딩 반복 횟수를 줄이면서도 높은 신뢰도 구간에서는 비슷한 정확도를 유지했다.
- •토큰 마스킹 패턴이 더퓨전 언어모뎌의 맥락과 예샱 대상을 동시에 결정한다는 점에서 출발
- •GoldiMask, 서미추럸러 똠가효도 구출론 금뚡출 최적화로 공개 토큰을 선택
- •세 개 백본·세 데이타셋에서 대부분 설정에서 평교 정확도 최고치 도돈
- •추론·코드 생성 과제 모두에서 성과 향상 확인
- •GSM8K·MATH-500에서 병리 도코납 반복 횟수 감소, 높은 신뇠름 구간 정확도 유지
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Fine-Tuning Diffusion Language Models with Context Selection and Target Weighting
- 1.GoldiMask, 서브모듈러 목적함수로 확산 언어모델 SFT의 마스킹 토큰을 선택적으로 결정
- 2.공개할 컨텍스트와 예측 대상 토큰의 상호작용을 함께 고려해 가중치 부여
- 3.3개 백본·3개 데이터셋 대부분서 최고 평균 정확도, 추론·코드생성 모두 개선
- 4.GSM8K·MATH-500서 신뢰도 임계 병렬 디코딩 시 반복 횟수 감소, 정확도는 유지
왜 중요한가?
균등 무작위 마스킹이 컨텍스트와 학습 대상의 상호작용을 반영하지 못했던 한계를 선택적 마스킹으로 보완해, 확산 언어모델의 파인튜닝 효율과 디코딩 속도를 동시에 개선한다.
언급 프로젝트
본문 미리보기
arXiv:2609.38385v1 Announce Type: new Abstract: Supervised fine-tuning of discrete diffusion language models masks some response tokens and trains the model to recover their original values from the visible context. The masking pattern therefore determines both the context available to the model and the tokens it learns to predict. Uniform random masking does not explicitly account for the interaction between these choices. We introduce GoldiMask, which selects tokens to reveal as context by ap
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

