도구 증강 LLM이 불필요하게 도구를 호출하는 문제를 활성화 스티어링으로 제어할 수 있음을 보인 해석가능성 연구다. 도구는 추론 시점 컨텍스트에만 존재해 가중치에 직접 인코딩되지 않는데도, 헤딩 앵커 위치에서 추출한 스티어링 벡터가 5개 오픈소스 모델과 3개 도메인에서 도구 호출 행동을 양방향으로 인과적으로 제어했다. 특히 파라미터 내 추론으로 충분한 도메인에서 불필요한 도구 사용 억제가 가장 효과적이었다. 다만 기하학적 분석에서는 선형 인코딩 가설이 예측하는 일관된 음의 정렬 대신 확산적·이봉형 정렬이 나타났고, 도구 유형별로 내부 시그니처가 상이해 교차 도구 특성 중첩이 낮았다. 저자들은 이를 도구의 비파라미터적 본질을 반영하는 것으로 해석하며, 기하학적 불규칙성과 인과 효과의 관계는 열린 문제로 남긴다.
- •헤딩 앵커 위치에서 추출한 스티어링 벡터로 도구 호출을 양방향 인과 제어
- •5개 오픈소스 모델·3개 도메인에서 효과 확인, 파라미터 추론 충분 도메인에서 억제 최대
- •도구 호출 스텝은 선형 인코딩 예측과 달리 확산적·이봉형 정렬을 보임
- •도구 유형별로 내부 시그니처가 상이해 교차 도구 특성 중첩 낮음
- •비파라미터적 도구 표상의 기하학적 불규칙성과 인과 효과 간 관계는 열린 문제
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Controlling Tool Use with Heading-Specific Activation Steering
- 1.헤딩 앵커 위치에서 추출한 스티어링 벡터가 LLM 툴 호출을 양방향 인과 제어
- 2.오픈소스 모델 5종·3개 도메인에서 검증, 파라미트릭 추론이 충분한 영역에서 불필요 툴 사용 억제 효과 최대
- 3.기하 분석 결과 깔끗한 선형 구조가 아닌 확산·이봉형 정렬, 툴 타입별 내부 시그니처도 상이
- 4.툴이 컨텍스트에만 존재하는 비파라미트릭 속성이 이 기하적 불규칙성의 원인이라고 가설
왜 중요한가?
가중치에 인코딩되지 않고 순전히 컨텍스트에만 존재하는 '툴 사용 결정'조차 activation steering으로 인과적으로 제어 가능함을 보인 첫 사례급 결과다. 불필요한 툴 호출로 비용·지연이 커지는 에이전트 제품에서 프롬프트 수정 없이 내부 개입으로 행동을 조절할 수 있는 가능성을 연다.
본문 미리보기
arXiv:2607.05790v1 Announce Type: new Abstract: Tool-augmented large language models extend their capabilities beyond parametric knowledge through external tools, but tend to invoke them unnecessarily. We investigate whether tool-use decisions have any stable internal representation that can be extracted and manipulated, a question that is non-trivial given that tools exist entirely in context at inference time and have no direct encoding in model weights. We show that steering vectors extracte
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

