구글이 AI 모델이 영상 전체를 동일하게 처리하는 대신 분석 목적에 맞춰 필요한 장면을 스스로 찾아 정밀 분석하는 '에이전트 기반 비디오 이해' 기능을 제미나이 3.7·3.6 플래시와 3.5 플래시-라이트에 도입했다. 이 기능은 시각 프레임뿐 아니라 오디오와 자막을 함께 활용하며 필요하면 특정 구간을 더 높은 프레임 속도로 재분석하는 방식으로 작동한다. 표준 비디오 분석 벤치마크에서 분석 비용을 최대 66%, 토큰 소비량을 최대 88% 줄이면서도 정확도는 최대 7% 향상시킨 것으로 나타났다. 구글은 이 기능을 개발자용 API뿐 아니라 향후 제미나이 앱과 유튜브의 '애스크 유튜브' 기능에도 확대 적용할 계획이다.
- •구글이 제미나이 3.7·3.6 플래시 등에 필요한 장면만 스스로 탐색하는 '에이전트 기반 비디오 이해'를 도입했다.
- •분석 비용은 최대 66%, 토큰 소비량은 최대 88% 줄었고 정확도는 최대 7% 향상됐다.
- •시각 프레임 외 오디오·자막을 함께 활용하며 필요한 구간은 더 높은 프레임 속도로 재분석한다.
- •구글은 이 기능을 제미나이 앱과 유튜브 '애스크 유튜브'로 확대 적용할 계획이다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
"필요한 장면 스스로 탐색"...구글, 제미나이 '에이전트 비디오 분석' 도입
- 1.구글, 필요한 장면만 스스로 찾아 분석하는 '에이전트 기반 비디오 이해' 기능을 제미나이 3.7/3.6 플래시, 3.5 플래시-라이트에 도입
- 2.기존 고정 FPS 처리 대신 AI가 시각·오디오·자막을 활용해 필요 구간을 동적으로 재탐색
- 3.표준 벤치마크에서 분석 비용 최대 66%, 토큰 소비 최대 88% 절감하면서 정확도는 최대 7% 향상
- 4.10분 사용법 영상부터 수시간 장시간 녹화까지 효과, 별도 요금 없이 기존 제미나이 API 가격 체계 적용
왜 중요한가?
긴 영상을 높은 FPS로 분석하면 비용이 급증하고 낮추면 핵심 장면을 놓치던 기존의 상충 관계를, AI가 스스로 탐색 범위를 조절해 완화했다는 점에서 장시간 영상 분석의 비용·정확도 트레이드오프를 실질적으로 개선한 사례다.
구글의 '에이전트 기반 비디오 이해' 기술은 AI가 영상 분석 비용과 정확도를 동시에 개선하는 새로운 접근법을 제시합니다. 국내 미디어, 보안, 자율주행 등 대용량 영상 데이터를 다루는 산업에서 효율적인 분석 솔루션을 찾는 데 중요한 대안이 될 것이며, 영상 AI 활용의 지평을 넓힐 잠재력을 가지고 있습니다.
본문 미리보기
구글이 AI가 영상 전체를 단순히 훑는 방식에서 벗어나 필요한 장면을 스스로 찾아 정밀하게 분석하는 기술을 선보이며, 영상 이해의 비용과 정확도를 동시에 개선하는 새로운 접근법을 제시했다. 구글은 1일(현지시간) AI가 영상 전체를 동일한 방식으로 처리하는 대신 분석 목적에 따라 필요한 장면을 스스로 찾아보고 집중적으로 분석하는 새로운 ‘에이전트 기반 비디오 이해(Agentic Video Understanding)’ 기능을 공개했다.이를 통해 장시간 영상 분석에서 토큰 사용량과 비용을 크게 줄이면서도 정확도는 오히려 높일 수 있게
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
