UNIST 김태환 교수팀이 여러 신경망 층이 전문가 모듈을 함께 공유하는 새로운 전문가 혼합 구조 'GMoE(Global Mixture of Experts)'를 개발했다. 기존 방식은 층마다 별도 전문가 집단을 둬 매개변수가 중복됐지만, GMoE는 전 층 공용 전문가와 층별 전용 전문가를 조합해 매개변수 수를 줄인다. 중간 크기 모델에서 매개변수를 5억4900만개에서 2억400만개로 약 63% 줄이면서도 정답률 39.51%로 기존 모델(39.55%)과 유사한 성능을 유지했으며, 서로 다른 전문가 선택 경로도 3배 이상 늘어나 특정 조합 쏠림 현상이 완화됐다. 이 연구는 국제학회 ACL 2026에서 발표됐으며 관련 코드도 공개됐다.
- •UNIST 연구팀이 신경망 층 간 전문가를 공유하는 'GMoE' 구조를 개발했다.
- •전 층 공용 전문가와 층별 전용 전문가를 조합해 매개변수 중복을 줄였다.
- •중간 크기 모델에서 매개변수를 63% 줄이면서도 기존과 비슷한 정답률(39.51%)을 유지했다.
- •전문가 선택 경로가 8만1561개로 기존보다 3배 이상 다양해져 쓰림이 완화됐다.
- •연구 성과는 국제학회 ACL 2026에서 발표됐고 코드가 공개됐다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
UNIST 김태환 교수팀, 여러 신경망 층이 전문가 모듈 공유하는 언어모델 ‘GMoE’ 공개
본문 미리보기
챗GPT 같은 대형언어모델(LLM)은 여러 작은 인공지능 모듈인 ‘전문가’를 두고 그 중 일부만 토큰에 따라 골라 쓰는 ‘전문가 혼합’ 방식이 주로 활용된다.이러한 방식은 각 신경망 층마다 전문가를 따로 둬 비슷한 기능과 매개변수가 중복되는 문제가 있었는데, 국내 연구진은 여러 층이 같은 전문가를 공유하도록 해 언어 이해 능력은 유지하면서 매개변수를 줄이는 기술을 개발했다.UNIST 인공지능대학원 김태환 교수팀은 LLM의 여러 신경망 층이 ‘전문가’ 신경 모듈을 함께 공유해 활용하는 새로운 전문가 혼합 구조 ‘GMoE(Global
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:01AI 초안
