Weight Patching은 같은 아키텍처의 쌍 모델(베이스 vs 행동 특화) 간에 선택된 모듈 가중치를 교체해 특정 능력의 '소스-레벨' 원인을 식별하는 파라미터 공간 개입 방법이다. 활성화 공간 국소화의 한계(중요해 보이는 모듈이 실은 상류 신호를 집계·증폭할 뿐)를 극복한다. 명령 준수(instruction following) 태스크에 적용해 얕은 소스 후보 → 집계·라우팅 모듈 → 하류 실행 회로로 이어지는 계층 구조를 발견하고, 메커니즘 인식 모델 머징에 활용 가능함을 입증.
- •파라미터 공간에서 능력의 원인 모듈을 식별하는 Weight Patching
- •기존 activation-space 국소화의 한계(집계·증폭 혼동) 극복
- •명령 준수 태스크에서 모듈 계층 구조 발견(얕은→라우팅→실행)
- •벡터 앵커 행동 인터페이스로 내부 기준 제공
- •메커니즘 인식 모델 머징 성능 개선에 활용 가능
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Weight Patching: Toward Source-Level Mechanistic Localization in LLMs
- 1.LLM 내부 능력의 실제 위치를 파라미터 공간에서 찾기
- 2.활성화 기반 해석의 한계 극복, 원인 모듈 식별
- 3.모델 머징 품질 개선에도 활용 가능
왜 중요한가?
Interpretability 연구가 활성화 공간에 쏠려 있던 관행에 파라미터 공간 접근을 도입. 모델 병합·MoE 설계·선택적 지식 전이 같은 실용적 응용 가능.
언급 프로젝트
본문 미리보기
arXiv:2604.13694v1 Announce Type: new Abstract: Mechanistic interpretability seeks to localize model behavior to the internal components that causally realize it. Prior work has advanced activation-space localization and causal tracing, but modules that appear important in activation space may merely aggregate or amplify upstream signals rather than encode the target capability in their own parameters. To address this gap, we propose Weight Patching, a parameter-space intervention method for so
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 15:12AI 초안

