Google过去六周发布了三个Flash模型,但真正值得关注的,是9月1日上线的“主动视频理解”。它让AI自己判断该盯住哪一段画面、什么时候倒回去重看、用什么方式去看,而不是按固定频率逐帧读取。官方演示里,模型被要求数掌声次数——这对传统逐帧方式并不容易,因为瞬间发生的动作很容易被漏掉或与别的声音混在一起。 传统AI理解视频的方式更像“看图说话”:系统把视频切碎,按每秒1帧之类的频率提取静态画面。这样的做法控制了计算量,却会错过极短的动作;当视频长到几个小时,庞大的帧数还会撑爆模型的上下文窗口。视频理解的瓶颈,既是精度问题,也是成本问题。 主动视频理解把模型推理和一套原生工具绑在一起,让模型先形成循环式判断,再调用内部工具把对应片段取出来精读。开发者原本也能手动拼出类似逻辑,但需要写不少胶水代码,如今这部分被模型自己接管。谷歌称,启用后Token消耗最多可降低88%,分析成本最多可降低66%,同时准确率还能提升最多7%。
文章图片 2
成本结构的变化,往往比单点跑分更能决定一项能力能否普及。长视频理解过去动辄消耗大量Token,很难规模化用在直播、监控或长教程场景;当按需取样把成本压下来,同样的算力预算就能覆盖更多时长与更多并发。这也是多模态落地中一个容易被忽视的现实约束。 从国内产业视角看,视频理解走向规模化,考验的不只是模型算法,还有背后的推理成本与调度效率。无论是直播分析还是企业级视频检索,任务负载都具有明显的峰谷特征,能否按需弹性供给GPU资源、把不同长度的视频任务排好优先级,会直接影响单位成本。星战科技在大模型API广场与算力调度上的投入,正是围绕这类“把成本算清楚”的需求展开。
文章图片 4
应用侧的变化同样直接。该能力已能通过Google AI Studio和Gemini Enterprise Agent Platform里的Gemini API调用,支持上传视频和YouTube视频两种输入,定价沿用标准Token计费。谷歌还计划把相关能力推送给Gemini App用户,并在未来几个月为YouTube的“Ask YouTube”提供支持。 当用户可以直接向一段视频提问、并让AI定位到具体时间点,海量视频资源就有了被调用为结构化知识的可能。谷歌能否回到旗舰模型第一梯队尚不确定,但“让AI理解世界并与世界互动”这条赛道,可能才刚刚重新开始。
文章图片 6