Spectral-LSH는 프롬프트가 모델에 들어가기 전에 압축하는 학습 불필요 방법으로, 프리필 어텐션의 시퀀스 길이 제곱 비용 문제를 겨냥한다. Krylov 부분공간 방법과 랜덤 피처로 암묵적 어텐션 커널 연산자의 지배 성분을 O(N²) 구체화 없이 근사하고, 어텐션 고유공간에서 SimHash로 유사 토큰을 묶어 인과적 위치를 부여한 매크로 토큰으로 집계한다. Mistral-7B, Qwen2.5-7B/14B를 C4에서 평가한 결과 압축률 4배 이하에서는 가벼운 청킹이 최선이지만 8배 이상에서는 스펙트럴 경로가 품질을 보존하는 상전이가 관찰됐다. 16배 압축에서 Qwen2.5-14B의 PPL 비율을 9.533에서 3.427로 낮췄고, JSON·코드·표 형태 구조화 입력 스트레스 테스트에서도 8배 압축 시 청킹보다 모든 지표가 개선됐다. 장문 프롬프트 추론 비용 절감의 실용적 선택지를 제시한다.
- •Krylov 부분공간+랜덤 피처로 어텐션 커널 지배 성분을 O(N²) 없이 근사하는 학습 불필요 프롬프트 압축
- •어텐션 고유공간에서 SimHash로 유사 토큰을 매크로 토큰으로 집계
- •압축률 상전이 발견: 4배 이하는 청킹 우세, 8배 이상은 스펙트럴 경로가 품질 보존
- •16배 압축에서 Qwen2.5-14B PPL 비율 9.533→3.427, 구조화 입력에서도 청킹 대비 전 지표 개선
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Spectral-LSH: Sub-Quadratic Prompt Compression via Krylov-Projected Locality-Sensitive Hashing
- 1.학습 불필요 프롬프트 압축 기법 Spectral-LSH 제안, O(N²) 어텐션 계산 없이 동작
- 2.Krylov 부분공간+랜덤 피처로 어텐션 고유공간 근사 후 SimHash로 토큰을 매크로토큰으로 병합
- 3.압축률 4배 이하는 청킹이 유리, 8배 이상에선 스펙트럴 방식이 품질 보존에 우위
- 4.16배 압축 시 Qwen2.5-14B PPL 비율 9.533→3.427로 개선
왜 중요한가?
긴 프롬프트 프리필 비용이 서빙 병목인 상황에서, 모델 수정·재학습 없이 입력 단계에서 압축하는 방식이라 기존 서빙 스택에 바로 붙일 수 있다. 압축률에 따라 청킹과 스펙트럴 방식을 전환하는 적응형 설계로 저·고압축 두 영역을 모두 커버한 점이 실용적이다.
본문 미리보기
arXiv:2607.19368v1 Announce Type: new Abstract: Long-prompt inference remains expensive because prefill attention scales quadratically with sequence length. We propose Spectral-LSH, a training-free prompt compression method that operates before the prompt enters the language model. Spectral-LSH approximates the dominant components of an implicit attention-kernel operator using a Krylov subspace method together with random features, avoiding explicit $O(N^2)$ attention-kernel materialization. It
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:40AI 초안

