Ai2가 트랜스포머(Olmo 3)와 하이브리드 모델(Olmo Hybrid)을 토큰 단위로 비교해 하이브리드 아키텍처가 어떤 토큰을 더 잘 예측하는지 분석했다. 데이터·토크나이저·학습 레시피를 동일하게 맞춘 7B 모델 쌍에서 손실 격차(loss gap)를 측정한 결과, 하이브리드는 명사·동사·형용사 등 의미를 담는 내용어에서 약 0.04의 우위를 보인 반면 기능어에서는 0.02 수준에 그쳤다. 반대로 입력에 이미 등장한 구절을 그대로 반복하는 토큰과 닫는 괄호 예측에서는 우위가 사라져, 정확한 회상은 어텐션의 강점임이 확인됐다. 특정 토큰 유형만 걸러 손실을 평가하면 1B 사전학습 초기부터 아키텍처 간 차이를 드러낼 수 있어, 평균 손실 하나로 아키텍처를 비교하는 관행의 한계를 보여준다.
- •데이터·토크나이저·레시피를 맞춘 Olmo 3(트랜스포머) vs Olmo Hybrid 비교로 순수 아키텍처 효과 분리
- •하이브리드는 내용어(loss gap 약 0.04)와 문맥 추적이 필요한 토큰에서 강세, 기능어는 약 0.02
- •반복 n-gram과 닫는 괄호 예측에서는 하이브리드 우위가 사라져 정확한 회상은 어텐션의 영역임을 확인
- •순수 RNN은 반복 토큰에서 트랜스포머·하이브리드에 모두 뒤처짐(1B 모델 3종 비교)
- •필터링된 토큰 손실이 사전학습 초기 아키텍처 비교 평가 지표로 유용함을 제안
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Which tokens does a hybrid model predict better?

- 1.Ai2가 동일 데이터·토크나이저로 학습한 7B Olmo 3와 Olmo Hybrid를 토큰 단위 비교
- 2.하이브리드는 명사·동사·형용사 등 의미 단어와 상태 추적 토큰에서 우세
- 3.앞서 나온 텍스트를 그대로 복사하거나 닫는 괄호 예측은 트랜스포머가 우위
- 4.전체 평균 loss는 둘을 구분 못해, 토큰 유형별 필터 loss가 아키텍처 차이 드러냄
왜 중요한가?
트랜스포머의 어텐션과 순환(RNN) 계층의 강점을 토큰 단위로 분리해, 하이브리드 아키텍처가 어디서 이득을 보는지 정량적으로 규명한다. 단일 벤치마크 점수로는 가려지던 차이를 필터링된 토큰 loss로 드러내, 하이브리드 모델 설계의 평가·개선 방법론을 제시한다.
언급 프로젝트
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 01:53AI 초안

