최근 바이트 단위 대형언어모델(LLM)은 바이트를 동적 크기 패치로 묶어 토크나이저 없는 모델링의 경쟁력을 높였지만, 기존 바이트-패치 구조는 모든 패치에 동일한 밀집 순전파 연산을 적용해 패치별 의미·세밀도 차이에 모델 용량을 맞추지 못하는 한계가 있었다. 연구진은 동적 바이트 패치를 위한 전문가 혼합(MoE) 구조 'EntropyMoE'를 제안해, 전역 패치 트랜스포머의 밀집 순전파 모듈을 Top-K 전문가 계층으로 대체했다. 각 동적 패치가 전문가 라우팅의 기본 단위가 되고, 라우터는 패치 엔트로피로부터 직접 전문가를 선택해 동적 패치 구성의 근간이 되는 세밀도 신호를 그대로 희소 연산 조직에 활용한다. 실험 결과 EntropyMoE는 다운스트림 정확도를 유지하면서도 비교 대상 밀집·희소 기준 모델 중 최저의 홀드아웃 바이트당 비트를 달성했다.
- •기존 바이트-패치 LLM은 모든 패치에 동일한 연산을 적용해 의미 차이에 적응하지 못했다.
- •EntropyMoE는 밀집 순전파 모듈을 Top-K 전문가 계층으로 대체한 MoE 구조다.
- •라우터는 패치 엔트로피를 직접 이용해 전문가를 선택하는 방식을 쓴다.
- •실험에서 비교 대상 중 최저의 홀드아웃 바이트당 비트를 달성했다.
- •다운스트림 정확도는 유지하면서 토크나이저 없는 MoE 모델링의 가능성을 보여줌다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
EntropyMoE: Entropy-Aware Sparse Expert Routing for Tokenizer-Free LLMs
본문 미리보기
arXiv:2608.06398v1 Announce Type: new Abstract: Recent byte-level large language models (LLMs) have made tokenizer-free modeling increasingly competitive by grouping bytes into dynamically sized patches. However, existing byte-patch architectures still apply the same dense feed-forward computation to every patch. This uniform computation cannot adapt model capacity to variations in patch semantics and granularity. We address this limitation with EntropyMoE, a Mixture-of-Experts (MoE) architectu
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

