FBLayout은 모바일 GPU에서 트랜스포머 온디바이스 파인튜닝을 가속하는 레이아웃 인지형 프레임워크다. 기존 모바일 학습 프레임워크는 순전파와 역전파에 같은 레이아웃을 써서 역전파 시 메모리 접근이 파편화되거나, 명시적 레이아웃 변환에 큰 오버헤드를 치렀다. FBLayout은 순·역전파의 다차원 리덕션을 아우르는 통합 R-Tile 레이아웃, 물리적 데이터 이동을 없애는 타일 기반 인덱스 변환, 효율적 레이아웃을 전역으로 전파하는 활성값 기반 레이아웃 선택 세 가지를 도입했다. ARM Mali와 Qualcomm Adreno GPU를 포함한 여러 스마트폰에서 트랜스포머 7종을 평가한 결과 MNN, TFLite, TVM 대비 2.2~5.7배 빨랐고 캐시 효율과 메모리 사용량도 개선돼, 프라이버시를 지키는 기기 내 대형 모델 미세조정 가능성을 높였다.
- •모바일 GPU 학습의 병목은 메모리 제약과 어텐션 계산 중 빈번한 레이아웃 변환이다.
- •순·역전파 리덕션을 통합하는 R-Tile 레이아웃을 제안했다.
- •타일 기반 인덱스 변환으로 실제 데이터 이동을 제거했다.
- •활성값 기반 레이아웃 선택으로 효율적 레이아웃을 모델 전체로 전파한다.
- •ARM Mali·Qualcomm Adreno 등에서 트랜스포머 7종 평가 결과 MNN·TFLite·TVM 대비 2.2~5.7배 가속됐다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
FBLayout: Optimizing Memory Layout for Efficient LLM Finetuning on Mobile GPUs
본문 미리보기
arXiv:2607.21624v1 Announce Type: new Abstract: Transformer-based models have enabled unprecedented capabilities across language, vision, and multimodal tasks. On-device fine-tuning of transformer models offers a privacy-preserving path to personalized AI, yet remains inefficient on mobile GPUs due to severe memory constraints and frequent layout transformations in attention mechanism during training. Existing mobile training frameworks either use unified layouts for forward and backward passes
전체 내용이 궁금하다면?
원문을 직접 읽어보세요