LLM 아키텍처 전문가 서배스천 라슈카가 오픈AI GPT-6 아스트라를 실사용한 인상과, 이 모델이 '순환 깊이(recurrent depth)' 또는 '루프 트랜스포머'를 사용한다는 The Information의 보도를 검증했다. 루프 트랜스포머는 동일한 가중치의 트랜스포머 블록 스택을 여러 번 재사용해 파라미터를 늘리지 않고도 실효 깊이를 늘리는 기법으로, Nanbeige나 ByteDance의 Ouro, Mixture-of-Recursions 등 여러 변형이 존재하며 최근 SMELT 논문은 동일 컴퓨팅 예산에서 루프 방식이 검증 손실을 6.8~18% 줄인다고 보고했다. 아스트라가 실제로 이 기법을 쓰는지는 공식 확인되지 않았지만 저자는 가능성이 높다고 본다. 루프 구조가 사고사슬(chain of thought)을 의도적으로 숨긴다는 우려에 대해서는, 오픈AI 수석과학자 제이쿱 파초키가 아스트라의 연산 그래프 깊이가 GPT-4의 2배 이내라고 해명한 점을 들어 근거가 약하다고 평가했다. 오히려 더 짧아진 추론 흔적은 모델이 더 유능해져 내부 연산에 더 의존하고 외부 사고 토큰을 덜 쓰기 때문이라는 것이 저자의 해석이며, 아스트라는 특히 컴퓨터 사용(computer use) 능력에서 두드러진 도약을 보였다고 평가했다.
- •GPT-6 아스트라가 '루프 트랜스포머(순환 깊이)' 기법을 쓴다는 The Information 보도의 진위를 검증
- •루프 트랜스포머는 같은 가중치의 블록을 여러 번 재사용해 파라미터 증가 없이 실효 깊이를 늘리는 기법
- •SMELT 논문, 동일 카맴퓨팅 예산에서 루프 방식이 학습 비용 6.8~18% 절감 효과 보고
- •오픈AI 수석과학자, 아스트라 연산 그래프 깊이가 GPT-4의 2배 이내라며 사고사슬 은폐 의혹 반박
- •아스트라는 특히 컴퓨터 사용(computer use) 능력에서 두드러진 도약을 보임
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
GPT-6 Astra, Looped Transformers, and Hidden Reasoning

- 1.GPT-6 아스트라, ARC-AGI-3서 99.9% 기록하며 컴퓨터 사용·3D 렌더링에 특히 강세
- 2.'루프 트랜스포머(순환 깊이)' 구조 채택 추정, 블록 반복 통과로 파라미터 없이 유효 깊이 확장
- 3.오픈AI 수석과학자 '계산 그래프 깊이는 GPT-4의 2배 이내'라며 은닉 추론 우려 반박
- 4.SMELT 연구는 루프 트랜스포머가 동일 컴퓨팅 예산서 6.8~18% 학습비용 절감 가능성 제시
왜 중요한가?
성능 향상이 반드시 추론 과정 은폐로 이어지는 것은 아니라는 반박이 나오면서도, 루프 트랜스포머 구조가 동일 비용으로 더 나은 모델을 만드는 실질적 기술 트렌드로 자리잡고 있음을 보여준다.
언급 프로젝트
본문 미리보기
A Look at Recurrent Depth, Hidden Chains of Thought, and Recent Research on Looping Transformer Blocks
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:02AI 초안

![[10월8일] “수학 문제 4000개에 AI 투입해 성과”…오픈AI가 보여준 과학연구의 변화](https://cdn.aitimes.com/news/photo/202610/216072_220045_048.png)

