Hugging Face가 명령어 한 줄로 HF Jobs 인프라에 OpenAI 호환 vLLM 서버를 띄우는 방법을 공개했다. `hf jobs run`에 vllm/vllm-openai 이미지와 GPU flavor를 지정하면 프라이빗 엔드포인트가 생성되며, HF 토큰을 베어러 토큰으로 사용해 curl이나 OpenAI 클라이언트로 바로 호출할 수 있다. 초 단위 과금(a10g-large 기준 시간당 1.5달러)이라 테스트·평가·배치 생성에 적합하고, H200 다중 GPU와 tensor-parallel 설정으로 Qwen3.5-122B 같은 대형 모델도 서빙 가능하다. SSH 접속 디버깅, Gradio 채팅 UI, 코딩 에이전트 백엔드 연동까지 지원해, 프로덕션용 Inference Endpoints를 쓰기 전 자체 호스팅 모델을 빠르게 실험할 수 있는 경로를 제공한다.
- •`hf jobs run` 한 줄로 OpenAI 호환 vLLM 서버를 HF 인프라에 배포, Kubernetes·서버 프로비저닝 불필요
- •HF 토큰 기반 접근 제어로 비공개 엔드포인트 제공, 초 단위 과금(a10g-large 시간당 $1.50)
- •h200x2 + tensor-parallel-size 2 설정으로 122B Qwen3.5 MoE 등 대형 모델 서빙 가능
- •SSH 접속, Gradio 채팅 UI, 툴 콜링 활성화를 통한 코딩 에이전트 백엔드 활용법 안내
- •실험·일회성 평가는 HF Jobs, 장기 운영 서비스는 scale-to-zero 지원 Inference Endpoints 권장
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Run a vLLM Server on HF Jobs in One Command
- 1.hf jobs run 단일 명령으로 HF 인프라에 vLLM 기반 OpenAI 호환 LLM 엔드포인트를 초당 과금으로 구동
- 2.vllm/vllm-openai 이미지에 --flavor로 GPU 지정, --expose로 포트 노출, HF 토큰으로 인증
- 3.--tensor-parallel-size로 다중 GPU 샤딩, 122B Qwen3.5 MoE를 H200x2에 구동
- 4.Gradio UI, --ssh 디버깅, Pi 코딩 에이전트 백엔드로 동일 패턴 확장
왜 중요한가?
서버 프로비저닝이나 쿠버네티스 없이 명령 한 줄로 사설 추론 엔드포인트를 띄우고 초당 과금만 내면 되므로, 테스트·평가·배치 생성 같은 단발성 작업의 진입 장벽을 크게 낮춘다. 장기 운영용 Inference Endpoints와의 선택 기준도 함께 제시한다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:39AI 초안

