谷歌近日宣布,为Gemini 3.7 Flash、3.6 Flash以及3.5 Flash‑Lite模型引入了一项突破性的智能体视频理解功能。这一创新技术不仅显著提升了模型对视频内容的分析能力,还在降低资源消耗和成本方面表现出色,为视频处理领域带来了新的变革。
传统视频处理方式多采用静态模式,即按照固定帧率读取视频内容,默认帧率为1FPS。开发者虽然可以通过应用程序接口调整参数,但这种方式在处理长视频时往往面临高额Token开销与遗失关键视频细节的矛盾。谷歌此次推出的智能体视频理解功能,将模型的核心推理能力与原生视频工具相结合,能够从视频的视觉帧、音频和转录文本中动态检索、扫描和核验目标片段,有效解决了这一难题。
基准测试数据显示,搭载智能体视频理解能力的Gemini模型在视频分析方面取得了显著进展。最高可将视频分析成本降低66%,Token消耗量减少88%,同时分析准确率提升最高达7%。这一技术优势在长视频处理场景中尤为突出,开发者无需再在成本与细节之间做出艰难选择。其中,Gemini 3.7 Flash与新功能的结合表现尤为出色,实现了分析质量与成本效率的平衡,处于视频理解任务准确率与成本的帕累托最优前沿。
智能体视频理解功能赋予了模型自主决策能力,使其能够根据任务目标自主选择读取内容、播放速度以及信息模态。模型可以智能地选取视频帧、音频和转录文本等,只提取任务所需片段与信号,从而大幅缩减了开发工作量。以往需要开发者手动完成的筛选操作,如今可由模型通过智能循环调用内部工具自动完成。
该功能还具备多项实用特性。它支持亚秒级时刻检索,能够精准捕捉固定帧率下容易遗漏的状态变化和剪辑边界,为高精度自动化视频编辑提供了有力支持。同时,它还能对长达数小时的长视频进行复杂内容检索,而无需消耗海量Token资源。该功能还能针对指定时间窗口调高采样帧率,完成快速运动画面和细微视觉异常的检测,并对时序下的重复动作和多类物体实现精准计数。
目前,这项功能已在Google AI Studio和Gemini企业智能体平台的Gemini应用程序接口上线。开发者只需在接口配置中将处理模式设置为“agentic”,即可轻松开启这一能力。该功能支持本地视频上传和YouTube视频解析,为开发者提供了更加便捷的视频处理方式。
谷歌计划将这项技术能力逐步推广至面向普通用户的产品中。未来,该功能将推送至Gemini应用全部Flash、Flash‑Lite模型用户。智能体视频理解还将赋能YouTube视频页面的“Ask YouTube”功能,依托Gemini模型输出更贴合视频画面内容的问答结果,为用户带来更加智能的视频观看体验。










