TTE-Flash는 명시적 Chain-of-Thought 추론 대신 잠재적 생각 토큰(think tokens)을 활용해 멀티모달 임베딩 추론을 효율화하는 방법론입니다. 생각 토큰을 잠재 변수로 학습시켜 일정한 추론 비용으로 고성능 추론 인식 표현을 생성합니다. TTE-Flash-2B 모델은 MMEB-v2 벤치마크에서 명시적 CoT 모델을 능가하며, 생각 토큰이 텍스트와 시각적으로 해석 가능함을 보여줍니다. 15개 비디오 데이터셋에서 생각 토큰 수 증가에 따른 스케일링 특성도 확인되었습니다.
- •명시적 CoT 추론 대신 잠재 생각 토큰을 도입해 일정한 추론 비용으로 추론 인식 멀티모달 표현을 생성합니다.
- •TTE-Flash-2B가 MMEB-v2 벤치마크에서 명시적 CoT 모델을 능가하며, 생각 토큰은 텍스트·시각적으로 해석 가능합니다.
- •15개 비디오 데이터셋에서 생각 토큰 수 증가에 따른 스케일링 특성이 확인되었으며, 적응형 예산 할당 가능성이 시사됩니다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
TTE-Flash: Accelerating Reasoning-based Multimodal Representations via Think-Then-Embed Tokens
- 1.명시적 CoT 대신 잔재적 사고 토큰(latent think tokens)으로 추론 인식 멀티모달 임베딩 생성
- 2.CoT 생성 손실과 대조 학습을 결합해 일정한 추론 비용으로 고성능 표현 달성
- 3.TTE-Flash-2B이 MMEB-v2에서 명시적 CoT 모델 상회, 15개 비디오 데이터셋에서 확장 특성 확인
왜 중요한가?
멀티모달 임베딩의 추론 능력을 일정한 비용으로 유지하는 효율적 방법론으로, 실용적인 멀티모달 AI 시스템 개발에 중요한 기여를 한다.
언급 프로젝트
본문 미리보기
arXiv:2605.16638v1 Announce Type: new Abstract: Recent research has demonstrated that Universal Multimodal Embedding (UME) benefits significantly from Chain-of-Thought (CoT) reasoning. In this paradigm, a generative model produces explicit reasoning traces for a multimodal query, with the final representation extracted from an embedding token attending to both the query and the reasoning. Despite its effectiveness, the computational overhead of generating explicit CoT traces is often prohibiti
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:12AI 초안

