OLLM(Options LLM)은 표준 LLM의 단일 다음 토큰 예측을 학습된 옵션 집합으로 대체하는 일반적 방법이다. 이산 잠재 변수로 색인된 다수의 그럴듯한 토큰 옵션을 명시적으로 모델링해 다양성을 온도나 샘플링 휴리스틱 없이 구조적으로 표현한다. 1.7B 백본의 1.56% 파라미터만 학습한 결과, OmniMath에서 최적 잠재 선택 시 약 70% 정답률에 도달해 LoRA SOTA(51%)를 크게 상회했다. 잠재 공간에서 학습된 작은 정책이 보상 최적화의 표본 효율을 높이고 언어 전환·퇴행 추론 같은 정렬 오류를 줄였다.
- •다음 토큰 예측을 학습 가능한 옵션 집합으로 대체하는 경량 플러그인 구조
- •사전학습 LLM에 인코더·디코더 두 층만 추가해 최소 파라미터로 전환 가능
- •1.7B 모델에서 LoRA 베이스라인(51%) 대비 약 70%로 수학 추론 정답률 향상
- •저차원 옵션 공간이 RL의 표본 효율과 정렬 안정성을 동시에 개선
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
OLLM: Options-based Large Language Models
- 1.OLLM은 이산 잠재변수로 인덱싱된 다음 토큰 옵션 집합을 명시 모델링
- 2.1.7B 백본의 1.56%만 학습해 OmniMath에서 70%, LoRA 베이스라인 51%를 크게 초과
- 3.잠재공간 정책 학습으로 샘플 효율적 RL과 언어 전환 등 오정렬 감소
- 4.KL 손실 없이도 모델 구조 자체로서 정렬이 발생함을 입증
왜 중요한가?
수학 추론 LLM의 제어성·효율성을 동시 개선하는 새 구조로 LLM 강화학습의 샘플 효율 병목을 완화하며 잠재공간 정책 학습의 가능성을 제시
본문 미리보기
arXiv:2604.19087v1 Announce Type: new Abstract: We introduce Options LLM (OLLM), a simple, general method that replaces the single next-token prediction of standard LLMs with a \textit{set of learned options} for the next token, indexed by a discrete latent variable. Instead of relying on temperature or sampling heuristics to induce diversity, OLLM models variation explicitly: a small latent space parametrizes multiple plausible next-token options which can be selected or searched by a downstre
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

