Hawk는 LLM이 NPU 커널 생성에서 하드웨어 사전 지식 부족으로 실패하는 문제를 해결하는 학습 불필요(training-free) 프레임워크다. 유사 커널 코드를 단순 이식하면 컴파일은 통과해도 하드웨어 제약 위반으로 런타임 크래시가 나는 상황에 대응해, 오류 맥락과 실행 가능한 의미를 결합하는 런타임 지식 합성, 구문·하드웨어 정렬 의미 공간에 질의를 투영하는 2D 검색, 실행 피드백으로 오류를 가지치기하고 중복을 통합하는 효과 기반 지식 증류의 3개 모듈로 구성된다. 실제 NPU 워크로드 평가에서 생성 정확도를 49.4%에서 80.0%로 끌어올리고 최고 기존 기법 대비 최대 2.2배 실행 속도 향상을 달성했다. NPU 커널 개발이 업계 병목인 상황에서 LLM 자동화의 실용 가능성을 보여준다.
- •LLM은 하드웨어 사전 지식 부재로 NPU 커널 생성에 실패 — 컴파일 통과해도 런타임 크래시 빈발
- •오류 맥락과 실행 의미를 결합하는 3부 실행형 지식 표현 기반 런타임 지식 합성
- •구문 공간과 하드웨어 정렬 의미 공간에 질의를 동시 투영하는 2D 검색 패러다임
- •실행 피드백 기반 LLM 의미 중재로 오류 가지치기·중복 통합하는 지속 지식 증류
- •실제 NPU 워크로드에서 생성 정확도 49.4%→80.0%, 최대 2.2배 실행 속도 향상
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Hawk: Harnessing Hardware-Aware Knowledge for High-Performance NPU Kernel Generation
- 1.학습 불필요 프레임워크 Hawk으로 NPU 커널 생성 정확도 49.4%→80.0% 향상
- 2.하드웨어 사전지식 부족으로 LLM이 NPU에서 실패하는 문제를 계해섬 해결
- 3.런타임 지식 합성·병목 인식 검색·2D 검색·효과 기반 지식 증류 3대 모듈 구성
- 4.최신 기법 대비 최대 2.2배 실행 속도 향상 달성
왜 중요한가?
NPU 커널 개발은 암묵적 하드웨어 제약과 메모리 계층 탓에 LLM이 컴파일은 통과해도 런타임 크래시를 일으키는 난제였는데, Hawk는 학습 없이 실행 피드백 기반 지식을 증류해 정확도를 30%p 이상 끌어올렸다.
언급 프로젝트
본문 미리보기
arXiv:2607.01590v1 Announce Type: new Abstract: Developing high-performance kernels for Neural Processing Units (NPUs) is a critical industry bottleneck, requiring developers to manually navigate implicit hardware constraints and strict memory hierarchies. While large language models offer immense automation potential, they fail catastrophically on NPUs due to a fundamental lack of hardware-specific priors. Naively transplanting code snippets from similar NPU kernels may pass the compiler, but
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

