딥러닝 모델의 대규모 성능은 고수준 수학 연산을 물리적 하드웨어에 얼마나 효율적으로 매핑하는지에 크게 좌우되지만, 기존 텐서 프레임워크는 전체 그래프 가시성이 부족해 어텐션 같은 복잡한 연산을 불투명한 수작업 커널 라이브러리에 의존하게 만든다. 연구진은 계산 구조로부터 직접 세분화된 커널을 합성해 하드웨어 매핑을 완전히 제어하는 자동화된 종단간 JIT 컴파일러 '노바(Nova)'의 다음 버전을 공개했다. 순전파·역전파를 하나의 값-의미론 다이얼렉트로 통합해 전체 그래프 최적화를 가능케 했으며, 사전 컴파일된 라이브러리 호출 대신 인과적 어텐션 서브그래프, 원소별 연산, 메모리 바운드 정규화를 단일 융합 커널로 결합해 전역 메모리 왕복을 대폭 줄인다. Ada 6000 GPU에서 GPT-2 전체 구조를 학습한 평가에서 노바는 초당 44만1천 토큰의 처리량을 기록해, 자체 즉시실행 방식(40만6천)과 비교 대상(40만5천)을 능가하면서도 수치적 동등성을 엄격히 유지했다.
- •노바(Nova), 계산 구조에서 직접 세분화된 커널을 합성해 하드웨어 매핑을 완전 제어하는 종단간 JIT 컴파일러
- •순전파·역전파를 단일 값-의미론 다이얼렉트로 통합해 전체 그래프 최적화 지원
- •인과적 어텐션·원소별 연산·정규화를 단일 융합 커널로 결합해 전역 메모리 왕복 대폭 감소
- •Ada 6000 GPU에서 GPT-2 전체 학습 시 초당 44만1천 토큰 처리, 자체 즉시실행(40만6천)·비교 대상(40만5천) 능가
- •컴파일러 네이티브 융합으로 수치적 동등성을 유지하면서 최신 하드웨어에서 효율적인 LLM 전체 컴파일 실현
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Nova: An End-to-End MLIR Compiler for Deep Learning
본문 미리보기
arXiv:2608.00029v1 Announce Type: new Abstract: The performance of deep learning models at scale relies heavily on how effectively high-level mathematical operations are mapped to underlying physical hardware. While high-level tensor frameworks provide flexible abstractions for model design, their eager execution models inherently lack the whole-graph visibility and granular control over hardware and memory required to maximize physical hardware utilization natively. To bridge this gap, we desi
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

