LLM 서빙 프레임워크가 민감 정보를 포함한 대량의 사용자 데이터를 공유 인프라에서 처리하는 상황에서, CPU 측 서빙 프레임워크와 GPU 측 LLM 연산자 간 사용자 데이터 격리를 보장하는 시스템 'GIFT(GPU Information Flow Tracking)'를 제시한 연구다. GIFT는 CPU 구성요소가 데이터 흐름만 조율할 뿐 내용을 조작하지 않는다는 점에 착안해 사용자별 암호화만으로 서빙 로직 수정 없이 격리를 구현하고, GPU 커널의 제한적이고 예측 가능한 정보 흐름을 정적으로 분석해 계측이나 GPU 지연 없이 격리 규칙을 사전 계산한다. 신뢰할 수 없는 운영체제·하이퍼바이저로부터도 보호하는 컨피덴셜 컴퓨팅 확장판 'GIFT-CC'도 함께 제시했으며, vLLM과 DistServe에 구현한 결과 지연시간을 유지하면서 처리량 오버헤드는 4~10.7%에 그쳤다.
- •CPU 서빙 프레임워크와 GPU LLM 연산자 간 사용자 데이터 격리 시스템 GIFT 제안
- •사용자별 암호화로 서빙 로직 수정 없이 격리 구현('암호화=격리' 접근)
- •GPU 커널의 예측 가능한 정보 흐름을 정적 분석해 계측·지연 없이 격리 규칙 사전 계산
- •컴피덴셜 컴퓨팅 결합한 GIFT-CC로 신뢰 불가능한 OS·하이퍼바이저로부터도 보호
- •vLLM·DistServe 구현 결과 처리량 오버헤드 4~10.7%, 지연시간 동일 수준 유지
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Here is a GIFT: Enforcing User Data Isolation in LLM Serving via GPU Information Flow Tracking
- 1.CPU측 서빙 프레임워크 수정 없이 사용자 데이터 격리를 강제하는 GPU 정보흐름추적 시스템 GIFT 제안
- 2.CPU는 데이터 흐름만 오케스트레이션한다는 통찰을 활용, 사용자별 암호화만으로 격리 구현
- 3.GPU 커널의 예측 가능한 정보흐름을 정적 분석해 커널별 흐름 규칙을 사전 계산
- 4.신뢰할 수 없는 OS·하이퍼바이저까지 방어하는 GIFT-CC로 확장, vLLM·DistServe에서 처리량 오버헤드 4~10.7%로 구현
왜 중요한가?
여러 사용자 데이터를 공유 GPU 인프라에서 처리하는 LLM 서빙 환경의 프라이버시 격리 문제를, 서빙 로직 변경 없이 낮은 오버헤드로 해결해 상용 멀티테넌트 LLM 서비스에 바로 적용 가능하다.
본문 미리보기
arXiv:2608.25431v1 Announce Type: new Abstract: LLM serving frameworks process large volumes of user data--often containing sensitive information--on shared infrastructure. Ensuring isolation between users who share the same serving framework (on CPUs) and LLM operators (on GPUs) is critical for privacy protection. This paper presents GIFT, a GPU Information Flow Tracking system that enforces user data isolation in LLM serving with minimal overhead. Moreover, the design of GIFT is non-intrusi
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
