머신 언러닝 방법을 벤치마킹하는 것은 대형언어모델에서 민감한 지식이 실제로 제거됐는지 확인하는 데 중요하지만, 기존 벤치마크는 주로 단일홉 질문과 좁은 범위의 멀티홉 질문에 그친다. 이 논문은 두 가지 한계를 지적한다. 지식은 고립돼 있지 않아 다양한 멀티홉 추론 경로가 일반 질의보다 지식 유출을 유발할 수 있고, 언러닝은 경량 사후 적응 같은 복구 공격으로 부분적으로 되살아날 수 있어 정적 평가만으로는 불충분하다. 저자들은 다양한 추론 경로와 복구 공격에 걸쳐 강건한 지식 제거를 평가하는 새 벤치마크를 도입하고, 3개 모델·6개 언러닝 방법·2개 정교하게 구축한 데이터셋으로 실험했다. 결과는 기존 방법들이 멀티홉 추론 경로와 복구 공격에 취약함을 보여줬으며, 저자들은 망각 품질·강건성·모델 유용성 사이의 트레이드오프도 추가로 분석했다.
- •기존 머신 언러닝 벤치마크가 단일홍에 치우치고 멀티홍 질문 범위가 좋다는 대해 새 벤치마크 제안
- •멀티홍 추론 경로가 지식 유출을 유발하고 경량 사후 적응 같은 복구 공격이 언러닝을 무력화할 수 있음을 지적
- •3개 모델·6개 언러닝 방법·2개 데이터셋으로 실험 수행
- •기존 언러닝 방법들이 멀티홍 추론과 복구 공격에 취약함을 입증
- •망각 품질·강건성·모델 유용성 간의 트레이드오프 분석
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Leak-Resistant Unlearning: A New Benchmark for Evaluating Multi-Hop Reasoning Consistency and Recovery Robustness
본문 미리보기
arXiv:2608.04519v1 Announce Type: new Abstract: Benchmarking machine unlearning methods is critical to understand whether sensitive knowledge is removed from large language models (LLMs) or not. Current unlearning benchmarks include mainly single-hop questions and a narrow set of multi-hop questions. Although effective, they still face two challenges. (1) Knowledge is not isolated, whereby diverse multi-hop reasoning paths can potentially induce knowledge leakage than normal queries. (2) Unlear
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

