Wiola는 GPT, LLaMA, Mistral, Falcon 등 기존 모델 계열과 구조적 계보를 공유하지 않는다고 주장하는 소형 언어 모델(SLM) 아키텍처다. 3차원 나선 다양체에 절대·상대·계층 위치 신호를 결합하는 나선 회전 위치 인코딩(SRPE), 이전 두 레이어의 압축 요약에 접근하는 게이트 교차 레이어 어텐션(GCLA), 중간 레이어에서 의미상 중복된 인접 토큰을 병합해 어텐션 복잡도를 줄이는 적응형 토큰 병합(ATM), 병렬 이중 스트림 피드포워드(DSFF), 표현 붕괴를 막는 차원별 오프셋의 WiolaRMSNorm 등 5개 신규 컴포넌트를 도입했다. 120M~1.5B의 4개 크기로 공개되며 HuggingFace Transformers와 호환된다. 다만 수학적 유도와 구조 비교 위주의 7쪽 논문으로, 실제 벤치마크 성능 검증은 제시되지 않아 주장의 실증은 지켜볼 필요가 있다.
- •기존 모델 계열과 구조적 계보를 공유하지 않는다고 주장하는 완전 신규 SLM 아키텍처
- •3D 나선 다양체 기반 SRPE 위치 인코딩과 이전 레이어 압축 요약에 접근하는 GCLA 도입
- •적응형 토큰 병합(ATM)으로 중간 레이어 어텐션 복잡도 절감 주장
- •120M·360M·700M·1.5B 4개 크기 공개, HuggingFace Transformers 호환, 아키텍처 단위 테스트 22개 통과
- •벤치마크 성능 결과 미제시 — 수학적 유도와 구조 비교 중심의 예비적 제안
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
The Wiola Architecture for Efficient Small Language Models
- 1.GPT·LLaMA·Mistral·Falcon과 구조 계보를 공유하지 않는 독자 SLM 아키텍처 Wiola 공개
- 2.나선형 회전 위치인코딩 SRPE, 게이트 교차층 어텐션 GCLA 등 5개 신규 컴포넌트 도입
- 3.중간층에서 의미 중복 인접 토큰을 동적 병합(ATM)해 어텐션 복잡도 절감
- 4.120M~1.5B 4개 크기로 공개, HuggingFace Transformers 호환·22개 단위테스트 통과
왜 중요한가?
사실상 모든 SLM이 GPT/LLaMA 변형인 상황에서 처음부터 재설계한 아키텍처를 4개 크기로 공개 배포했다는 점이 특징이다. 다만 초록에는 벤치마크 성능 수치가 없어 실제 효용은 후속 검증이 필요하다.
언급 프로젝트
본문 미리보기
arXiv:2607.01394v1 Announce Type: new Abstract: We present Wiola, a fully original Small Language Model (SLM) architecture built from first principles, sharing no structural lineage with any existing model family including GPT, LLaMA, Mistral, or Falcon. Wiola introduces five independently novel components: (i) Spiral Rotary Positional Encoding (SRPE), which embeds token positions on a three-dimensional helical manifold combining absolute, relative, and hierarchical positional signals; (ii) Gat
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

