이 연구는 완전동형암호(FHE) 기반 언어모델 추론을 가속하는 HEAT(Homomorphic Encryption-Aware Training) 기법을 제안한다. FHE는 암호화된 상태에서 비선형 연산을 반복적으로 근사해야 하는데, 반복 횟수가 많을수록 정밀도는 높아지지만 부트스트래핑이 잦아져 지연시간이 커지는 문제가 있다. HEAT는 비선형 함수별 반복 횟수를 학습 가능한 파라미터로 만들어 모델 가중치와 함께 공동 최적화함으로써, 아키텍처 변경이나 재학습 없이 근사 오차에 적응하도록 한다. 암호화된 GPT-2 디코딩 실험에서 반복 횟수를 3.1배, 부트스트랩 횟수를 1.6배 줄이고 종단 지연시간을 1.4배 단축하면서도 복호 일치율은 오히려 개선됐다. 느리기로 악명 높은 FHE 기반 LLM 추론의 실용화 가능성을 한층 앞당긴 결과다.
- •HEAT: 비선형 함수별 근사 반복 횟수를 학습 가능하게 만들어 모델 가중치와 공동 적응시키는 FHE 전용 파인튜닝 기법
- •암호화된 GPT-2 디코딩에서 반복 횟수 3.1배, 부트스트랩 1.6배, 지연시간 1.4배 감소
- •정확도(복호 일치율)는 오히려 기존 캘리브레이션된 베이스라인보다 향상
- •반복 횟수와 양자화 비트폭의 관계를 규명해 양자화 인지 학습과의 성능 격차도 이론적으로 bound
- •아키텍처 변경이나 처음부터 재학습 없이 적용 가능
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
HEAT: Faster Fully Homomorphic Inference via Approximations-Weights Co-Adaptation
- 1.완전동형암호(FHE)로 암호화된 상태에서 언어모델을 돌릴 때 병목인 비선형함수 근사 반복횟수를 학습 가능하게 만든 HEAT 기법 제시
- 2.반복횟수와 모델 가중치가 훈련 중 공동 적응해 추론 시 근사 오차에 아키텍처 변경 없이 적응
- 3.암호화된 GPT-2 디코딩 실험에서 반복횟수 3.1배, 부트스트래핑 1.6배, 종단간 지연시간 1.4배 감소
- 4.보정된 암호화 베이스라인 대비 디코딩 일치율도 함께 개선
왜 중요한가?
FHE 기반 비공개 LLM 추론은 지연시간이 커 실용화의 최대 걸림돌이었는데, 재훈련 없이 반복 횟수를 모델과 함께 최적화해 부트스트래핑 빈도를 크게 줄여 프라이버시 보존 AI 추론의 실용성을 끌어올렸다.
본문 미리보기
Fully homomorphic encryption (FHE) allows a server to run a language model directly on encrypted user prompts, but current approaches remain prohibitively slow. Ciphertexts natively support only addition, multiplication, and rotation, and multiplications may be composed only to a bounded depth before a costly bootstrapping operation is required to continue. Every nonlinearity must therefore be approximated by an iterative method; each iteration increasing the number of multiplications. A higher
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안



