허깅페이스가 브라우저에서의 AI 추론 속도를 높이기 위해 '@huggingface/kernels'라는 새 라이브러리와 207개의 최적화된 WebGPU 커널 모음을 공개했다. 각 커널은 매니페스트, 정확성 테스트, 벤치마크 케이스, WGSL 셰이더 템플릿을 함께 갖춘 독립 저장소로 허깅페이스 허브에 버전 관리되어 게시된다. 애플 M4 GPU에서 ONNX Runtime Web과 비교한 결과, 809개의 비교 가능한 테스트 케이스에서 기하평균 2.57배, 중앙값 1.90배 빠른 성능을 보였으며 일부 연산은 최대 1만 배 이상 빨랐다. 함께 공개한 'Fleet'은 사용자 동의를 받아 실제 기기에서 정확성과 성능 데이터를 수집하는 브라우저 기반 벤치마킹 도구로, 다양한 GPU·브라우저 환경에서의 커널 개선에 활용된다. 이는 브라우저 내 로컬 AI 추론 스택을 고도화하려는 허깅페이스 WebAI 팀의 첫 단계 작업이다.
- •허깅페이스가 207개의 최적화된 WebGPU 커널과 이를 로딩·실행하는 라이브러리 @huggingface/kernels를 공개했다.
- •각 커널은 매니페스트, 정확성·벤치마크 테스트, WGSL 셰이더까지 함께 버전 관리되는 독립 저장소로 제공된다.
- •애플 M4 GPU 테스트에서 ONNX Runtime Web 대비 기하평균 2.57배, 중앙값 1.90배 빠른 성능을 기록했다.
- •브라우저 기반 벤치마킹 도구 'Fleet'으로 실사용자 기기에서 정확성·성능 데이터를 크라우드소싱한다.
- •브라우저 내 로컬 AI 추론을 고도화하려는 허깅페이스 WebAI 팀의 기반 작업 첫 단계다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Introducing @huggingface/kernels: 200+ WebGPU Kernels for Local AI
- 1.Hugging Face, 브라우저 로컬 AI 추론용 WebGPU 커널 207개와 로더 라이브러리 '@huggingface/kernels' 공개
- 2.각 커널은 매니페스트·정확성 테스트·벤치마크·WGSL 셰이더까지 포함한 독립 저장소로 버전 관리
- 3.Apple M4 GPU 테스트에서 ORT WebGPU 대비 기하평균 2.57배, 중앙값 1.90배 속도 향상(809개 비교 케이스 중 629승)
- 4.브라우저 기반 크라우드소싱 벤치마킹 도구 'Fleet'도 함께 출시, 다양한 실기기 성능·정확성 데이터 수집
왜 중요한가?
웹 브라우저에서의 로컬 AI 추론 성능을 좌우하는 최하위 계층(GPU 커널)을 표준화·오픈소스화함으로써, WebGPU 기반 온디바이스 AI 생태계의 성능 병목을 실질적으로 해소할 잠재력이 있다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:39AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
