연구진이 프롬프트를 서버로 보내기 전에 난독화해 보호하는 ObfusLM, SentinelLMs, TextObfuscator, DPNR 등 경량 방어 기법들이 기존에 알려진 것보다 훨씬 취약함을 보이는 반지도 임베딩 역변환 공격 DeepInvert를 제안했다. 핵심 통찰은 라벨 없는 난독화된 임베딩도 섭동에도 불구하고 활용 가능한 의미적 구조를 유지한다는 점으로, 라벨된 섀도 데이터의 지도학습과 라벨 없는 대상 임베딩에 대한 새로운 비지도 일관성 목적함수를 혼합 학습 파이프라인으로 결합했다. 9개 방어 기법, 5개 작업, 4개 모델 아키텍처에 걸친 실험에서 DeepInvert는 대부분의 방어에서 기존 공격을 능가했으며, ObfusLM에 대해서는 토큰 복구율 73.5%를 달성해 기존 최고 기록인 26.2%를 크게 앞질렀다. 실용성을 유지하기 위해 충분한 신호를 남기는 난독화 기법은 역변환에도 취약하다는 근본적인 긴장 관계가 드러났으며, 일부 DP 기반 방어만 단순 분류 작업에서 두 목표를 함께 만족할 수 있었다. 프롬프트 난독화 기반 방어 전반에 대한 재평가가 필요함을 시사한다.
- •ObfusLM 등 프롬프트 난독화 방어를 똕는 반지도 임베딩 역변환 공격 DeepInvert를 제안했다
- •라벨된 섬도 데이터 지도학습과 비지도 일관성 목적함수를 결합한 혼합 학습 파이프라인을 사용했다
- •ObfusLM 대상 토큰 복구율 73.5%로 기존 최고 기록(26.2%)을 크게 앞질렀다
- •유용성을 지키는 난독화는 역변환에도 취약하다는 근본적 트레이드오프를 드러냈다
- •9개 방어·5개 작업·4개 아키텍처에 걸친 실험으로 프롬프트 난독화 방어 전반의 재평가를 촉구한다
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
DeepInvert: Semi-Supervised Embedding Inversion Against Obfuscated Language Models
본문 미리보기
arXiv:2608.04477v1 Announce Type: new Abstract: Cloud-based language model services routinely process prompts containing sensitive information. Obfuscation-based defenses---including ObfusLM, SentinelLMs, TextObfuscator, and DPNR---mitigate this risk by transforming prompt representations before transmission, offering a lightweight alternative to cryptographic solutions. We show these defenses provide far less protection than previously believed. We present DeepInvert, a semi-supervised embed
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:57AI 초안



