사전학습된 비디오 VAE 인코더 잠재값으로 하위 행동 정책을 구동하는 월드 액션 모델(WAM)에서, NVFP4 양자화가 정책이 기대하는 잠재 계약을 깨뜨리는 문제를 다룬 연구다. Wan2.1에서 공동 양자화 인식 학습(QAT)은 재구성 품질(FP32 VBench-7 0.7409 대비 0.7403)은 거의 유지했지만 LIBERO 성공률은 95.5%에서 10.5%로 붕괴했다. 분석 결과 활성화 양자화-역양자화 연산이 디코더 야코비안을 바꿔 인코더로 돌아가는 그래디언트를 왜곡, 잠재 드리프트를 유발하는 것으로 나타났다. 이를 토대로 양자화된 인코더를 먼저 정렬한 뒤 고정하고 디코더만 적응시키는 2단계 프레임워크 LatentQuant를 제안, LIBERO 95.75%·RoboTwin 68.8% 성공률과 NVIDIA B300에서 BF16 대비 최대 1.26배의 속도 향상을 달성했다.
- •NVFP4 양자화가 월드 액션 모델의 '정책 대면 잠재 계약'을 깨뜨리는 메커니즘 규명
- •단순 공동 QAT는 재구성 품질은 유지하나 LIBERO 성공률이 95.5%→10.5%로 붕괴
- •인코더 선정렬 후 고정, 디코더만 적응시키는 2단계 LatentQuant 프레임워크 제안
- •LIBERO 95.75%, RoboTwin 68.8% 성공률과 B300에서 BF16 대비 최대 1.26배 속도 향상 달성
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
LatentQuant: Preserving the Policy-Facing Latent Contract under NVFP4 VAE Quantization
- 1.월드 액션 모델(WAM) 비디오 VAE를 NVFP4로 양자화하면 정책의 '잠재 계약'이 깨지는 문제를 해결하는 LatentQuant 제안
- 2.Wan2.1서 단순 QAT는 재구성 품질은 거의 유지하나 LIBERO 성공률은 95.5%에서 10.5%로 붕괴
- 3.활성화 양자화-역양자화가 디코더 야코비안을 바꿔 인코더 그래디언트를 왜곡, 잠재 표현이 지속 드리프트함을 규명
- 4.2단계 QAT로 LIBERO 95.75%, RoboTwin 68.8% 성공률, B300서 BF16 대비 최대 1.26배 가속
왜 중요한가?
월드 액션 모델을 저비트 양자화로 가속할 때 재구성 품질 지표만으로는 정책 성능 붕괴를 전혀 예측할 수 없다는 점을 밝혀, VAE 양자화를 적용하려는 로보틱스 엔지니어에게 구체적 함정과 해법을 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2610.03959v1 Announce Type: new Abstract: Recent world action models (WAMs) reuse pretrained video VAEs whose encoder latents directly condition downstream action policies. Quantization must therefore preserve not only reconstruction fidelity but also the policy-facing latent contract expected by the frozen policy. Direct NVFP4 leaves W4A4 quantization error uncompensated, whereas joint quantization-aware training (QAT) can recover reconstruction by moving this representation. On Wan2.1,
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

