표준 피드포워드 트랜스포머에는 언어화 가능하고 인과적으로 강력한 표현이 형성되는 중간 깊이 대역, 즉 전역 작업공간의 기능적 유사체가 존재한다는 최근 연구가 있다. 이 논문은 별개 층 스택 대신 순환으로 깊이를 구현할 때도 동일한 작업공간 기능이 나타나는지를 검증한다. 연구진은 가상 언롤링 어댑터로 야코비안 렌즈를 반복 아키텍처로 확장하고, 렌즈 피팅·판독·11개 인과 실험군으로 구성된 전체 작업공간 도구를 Ouro-2.6B(48층을 4회 루프)와 Huginn-0125(4층 코어를 16회 순환)에 적용해 Qwen3.6-27B(64개 독립층)를 기준선으로 비교했다. 각 아키텍처의 반복 부분에서 작업공간이 형성되지만 순환 방식에 따라 접근 방식이 달라졌다. Ouro는 매 루프마다 작업공간 내용을 재구성하며 선형 전달로는 루프 경계를 넘어 내용을 옮길 수 없어 쓰기와 절제가 남은 모든 루프에 걸쳐야 한다. Huginn은 16회 순환 전체에 걸쳐 내용을 전달하지만 읽기·쓰기·절제는 약 2회 순환의 슬라이딩 윈도우 내에서만 작동했다.
- •순환(루프) 방식으로 깊이를 구현한 트랜스포머에서도 전역 작업공간 기능이 형성되는지 검증
- •가상 언롤링 어댑터로 야코비안 렌즈를 반복 아키텍처(Ouro-2.6B, Huginn-0125)로 확장
- •두 모델 모두 반복 부분에서 작업공간이 형성되지만 접근 방식은 서로 다름을 발견
- •Ouro는 매 루프마다 내용을 재구성해 쓰기·절제가 남은 모든 루프에 걸쳐야 함
- •Huginn은 16회 순환 전체에 내용을 전달하지만 읽기·쓰기는 약 2회 순환 윈도우 내로 제한
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Looped Transformers under the Jacobian Lens: Does the Global Workspace Survive Recurrence?
- 1.순환(loop) 구조 트랜스포머에서도 '글로벌 워크스페이스' 형성 여부를 야코비안 렌즈로 검증
- 2.Ouro-2.6B(48층×4회 순환)와 Huginn-0125(4층×16회 순환)를 Qwen3.6-27B와 비교
- 3.Ouro는 매 루프마다 내용을 재구성해 선형 전이가 루프 경계를 넘지 못함
- 4.Huginn은 16회 반복 전체에 내용 유지하나 접근은 약 2회 반복의 슬라이딩 윈도에 한정
왜 중요한가?
가중치를 재사용하는 순환형 아키텍처가 표준 트랜스포머와 다른 방식으로 정보를 접근·전달함을 밝혀, 반복 기반 경량 모델 설계와 해석가능성 연구에 구체적 제약을 제공한다.
본문 미리보기
arXiv:2609.01924v1 Announce Type: new Abstract: Recent work identifies a mid-depth band of verbalisable, causally potent representations in a standard feedforward transformer --- a functional analogue of a global workspace. Whether the same workspace functionality emerges when depth is implemented through recurrence rather than a stack of distinct layers remains unknown. Looped and depth-recurrent transformers provide a direct test of this question because they reuse the same weights across dep
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
