谷歌推出智能体视频理解功能,优化Gemini模型视频分析效能
创始人
2026-09-03 14:00:47

来源:环球网

【环球网科技综合报道】9月3日消息,据biggo报道,谷歌近日宣布为Gemini 3.7 Flash、3.6 Flash以及3.5 Flash‑Lite模型新增智能体视频理解功能,在提升模型视频分析准确率的同时,显著降低视频分析的资源消耗与使用成本。该功能沿用Gemini API标准Token计费规则,不额外收取功能使用费。

据介绍,以往模型处理视频多采用静态处理模式,按照固定帧率读取视频内容,默认帧率为1FPS,开发者可通过应用程序接口进行参数调整。全新的智能体视频理解功能,将模型核心推理能力与原生视频工具相结合,能够从视频视觉帧、音频、转录文本当中,动态检索、扫描、核验目标片段。

基准测试结果显示,搭载智能体视频理解能力的Gemini模型,最高可将视频分析成本降低66%,Token消耗量最高下降88%,分析准确率最高提升7%。该技术优势在长视频处理场景中表现突出。传统静态处理模式下,开发者往往需要在高额Token开销与遗失关键视频细节二者之间权衡取舍,新技术可有效摆脱这一困境。谷歌方面表示,Gemini 3.7 Flash搭配该新功能,综合表现最优,实现了分析质量与成本效率的良好平衡,处于视频理解任务准确率与成本的帕累托最优前沿。

不同于固定帧率读取媒体流的静态处理方式,智能体视频理解赋予模型自主决策能力,可根据任务目标自主选择读取内容、播放速度,选取视频帧、音频、转录文本等信息模态,只提取任务所需片段与信号。以往需要开发者手动完成的筛选操作,如今可由模型通过智能循环调用内部工具完成,有效缩减开发工作量。

该功能具备多项实用能力,支持亚秒级时刻检索,精准捕捉固定帧率下容易遗漏的状态变化与剪辑边界,助力高精度自动化视频编辑;可对时长数小时的长视频开展复杂内容检索,不用消耗海量Token资源;能够针对指定时间窗口调高采样帧率,完成快速运动画面、细微视觉异常的检测,还可以对时序下的重复动作、多类物体实现精准计数。

目前,这项功能已经在Google AI Studio、Gemini企业智能体平台的Gemini应用程序接口上线,支持本地视频上传与YouTube视频解析,开发者只需在接口配置中将处理模式设置为“agentic”,即可开启该能力。

按照谷歌规划,这项技术能力还将逐步向面向普通用户的产品落地。后续该功能将推送至Gemini应用全部Flash、Flash‑Lite模型用户;未来数月,智能体视频理解还将赋能YouTube视频页面的“Ask YouTube”功能,依托Gemini模型,输出更贴合视频画面内容的问答结果。(纯钧)

相关内容

热门资讯

跳票两年终有音讯,游戏《监狱建... IT之家 9 月 3 日消息,《监狱建筑师 2》是一款原计划 2024 年推出的建造和管理私人监狱的...
汕头词元出海产业生态联盟正式启... 9月2日,“词元出海:开创数字贸易新前沿”专题活动在广州越秀国际会议中心如期举行。活动紧扣“粤港澳大...
代表在线·暖民心|徐根全:匠心... 在中国黄金集团江西金山矿业有限公司的工业自动化控制室里,电子屏上跳动的参数曲线恰似矿山的“脉搏”。徐...
【光明论坛】持续推动高水平科技... 【光明论坛】 作者:陈伟伟(国家发展和改革委员会经济体制与管理研究所研究员) 近日,国新办举行“开局...