Intel TDX 기밀 인스턴스의 NVIDIA H100 80GB GPU에서 기밀 컴퓨팅 모드와 일반 모드의 LLM 추론 성능을 비교한 벤치마크 연구다. Mistral-7B v0.1과 Qwen3-30B-A3B를 대상으로 고정 요청률 실험에서 기밀 모드는 첫 토큰 지연(TTFT)을 각각 21.8%·27.8% 늘렸고, 전역 토큰 처리량은 17.7%·21.1% 감소시켰다. 폐루프 동시성 실험에서도 처리량 격차가 11.5~20.2%로 유지됐으며, 특히 큰 모델은 기밀 모드에서 포화점에 더 일찍 도달했다. 기밀 GPU 추론이 부하 상황에서도 실사용 가능한 처리량을 유지하지만, 용량 계획 시 상시적 처리량 손실과 대형 모델의 조기 포화를 함께 고려해야 함을 시사한다.
- •Intel TDX + NVIDIA H100 80GB 환경에서 기밀 컴퓨팅 모드의 LLM 추론 오버헤드를 정량 측정
- •기밀 모드에서 TTFT가 Mistral-7B 21.8%, Qwen3-30B-A3B 27.8% 증가
- •전역 토큰 처리량은 각각 17.7%, 21.1% 감소하며 폐루프 동시성 실험에서도 11.5~20.2% 격차 유지
- •대형 모델일수록 기밀 모드에서 포화점에 더 일찍 도달 — 용량 계획 시 별도 고려 필요
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Benchmarking Confidential GPU Inference on NVIDIA H100 under Intel TDX
- 1.Intel TDX 기밀 인스턴스의 NVIDIA H100에서 기밀 컴퓨팅 LLM 추론 오버헤드 실측
- 2.기밀 모드에서 첫 토큰 지연 Mistral-7B +21.8%, Qwen3-30B-A3B +27.8% 증가
- 3.전역 토큰 처리량은 각각 17.7%·21.1% 하락, 폐루프 실험에선 11.5~20.2% 격차
- 4.큰 모델일수록 기밀 모드에서 포화점에 더 일찍 도달해 용량 계획 시 주의 필요
왜 중요한가?
민감 데이터 처리·모델 자산 보호를 위해 기밀 컴퓨팅이 배포 요건이 되는 추세에서, H100+TDX 조합의 실제 성능 페널티를 정량화한 드문 벤치마크다. 약 20% 처리량 손실과 대형 모델의 조기 포화라는 수치는 기밀 추론 인프라 용량 산정에 바로 쓸 수 있다.
본문 미리보기
arXiv:2607.19353v1 Announce Type: new Abstract: Confidential computing is becoming a practical deployment requirement for AI inference workloads that process sensitive inputs or protect proprietary model assets. However, the performance cost of enabling confidential execution for GPU-accelerated large language model serving remains workload dependent and operationally important. This paper presents a benchmark study comparing standard non-confidential execution with confidential computing mode
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:40AI 초안

