연구진은 명령어 튜닝, 특화, 양자화 등으로 변형된 LLM의 세밀한 계보 추적이 어렵다는 문제에 대응해, 학습이 필요 없는 지문 기법 BReF를 제안했다. A/B/C/D 답변 옵션에 대한 확률 분포가 통제된 텍스트 교란에서 어떻게 이동하는지를 비교하며, 모델 쌍마다 25개의 공동 반응 프로브를 선택해 교란 로그비율(PLR) 반응 방향을 전역 코사인 유사도로 비교한다. 34개 체크포인트, 22개의 문서화된 직계 부모 관계, 411개의 용의자-후보 쌍으로 구성된 통합 벤치마크에서 BReF는 22/22 사례 모두에서 문서화된 부모를 정확히 찾아냈고(MRR=1.0000), DP-DF AUC도 1.0000을 기록했다. 다만 동일 계열 내 구분(DP-SF AUC 0.8969)은 상대적으로 어려웠으며, 크기 기반 기존 방식 대비 유의미한 성능 향상을 확인했다.
- •학습 없이 LLM 계보를 추적하는 지문 기법 BReF 제안
- •A/B/C/D 답변 확률 분포의 교란 반응 방향을 코사인 유사도로 비교
- •34개 체크포인트, 22개 문서화 부모 관계에서 22/22 정확히 식별(MRR=1.0000)
- •밀접하게 관련된 체크포인트 간 동일 계열 구분은 상대적으로 더 어려움(AUC 0.8969)
- •크기 기반 baseline 대비 유의미한 정확 검색 성능 향상 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Beyond QA Matching: Perturbation-Response Fingerprinting via Probability Distributions for Large Language Models
- 1.학습 없이(training-free) 모델 계보를 식별하는 지문 기법 BReF 제안, A/B/C/D 확률분포의 섭동 반응 방향 비교
- 2.34개 체크포인트·22개 문서화된 직계 관계·411개 후보쌍 벤치마크에서 직계 부모 22/22 완벽 검색(MRR=1.0)
- 3.DP-DF AUC 1.0 달성, 동일 계열 모델 간 구분(DP-SF AUC 0.8969)은 상대적으로 어려움 확인
- 4.정적·무작위 프로브·순열·보정 등 다양한 대조군 실험으로 크기 기반 Top-25 대비 유의미한 성능 우위 입증
왜 중요한가?
파인튜닝·양자화·증류 등으로 변형된 LLM의 출처(부모 모델)를 추적하는 것은 라이선스 준수와 모델 출처 검증에 실질적으로 필요한데, 이번 결과는 파라미터 접근 없이도 높은 정확도로 계보를 식별할 수 있음을 보여준다.
언급 프로젝트
본문 미리보기
arXiv:2609.06330v1 Announce Type: new Abstract: Large language models are often instruction-tuned, specialized, quantized, or otherwise transformed, making fine-grained provenance difficult. In this paper, we introduce BReF, a training-free fingerprint that compares how probability distributions over four answer-option labels A/B/C/D move under controlled textual perturbations. For each pair of models, BReF selects 25 jointly responsive probes and compares their perturbation log-ratio (PLR) res
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

![[10월8일] “수학 문제 4000개에 AI 투입해 성과”…오픈AI가 보여준 과학연구의 변화](https://cdn.aitimes.com/news/photo/202610/216072_220045_048.png)

