AI资讯

Google DeepMind 为 Gemini 推出智能体视频理解,token 消耗最多降 88%

Google DeepMind 为 Gemini 推出智能体视频理解,token 消耗最多降 88%

速览

  • Gemini 新增智能体视频理解,覆盖三款 Flash 系列模型
  • 模型不再固定帧率读视频,而是按需搜索、扫描、回看片段
  • 官方称 token 降 88%、成本降 66%、准确率升 7%
  • 长视频收益最大,可避免高 token 成本或丢失关键细节
  • 支持亚秒级时刻检索、长视频大海捞针、异常检测与计数
  • Gemini 3.7 Flash 处于准确率—成本帕累托前沿
  • API 设 agentic 即可启用,按标准 token 计费
  • 后续将进入 Gemini 应用并支撑 YouTube 的 Ask YouTube

Google DeepMind 发布 Gemini 的智能体视频理解(agentic video understanding)功能,已在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 三款模型上线。与按固定帧率(默认 1 FPS)读取视频的静态处理不同,该功能让模型结合核心推理与原生视频工具,动态搜索、扫描并检查目标视频片段,覆盖画面帧、音频和转录文本,只抓取真正需要的时刻与信号。官方基准测试显示,开启该功能后视频分析成本最多降低 66%,token 消耗最多降低 88%,准确率最多提升 7%;其中 Gemini 3.7 Flash 综合质量与成本效率最佳,处于测试模型的准确率—成本帕累托前沿。效率提升在长视频上尤为明显,从 10 分钟教程、90 分钟讲座到数小时录像均适用。该功能支持视频上传和 YouTube 视频,通过 Google AI Studio 与 Gemini Enterprise Agent Platform 的 Gemini API 使用,只需在 API 配置中将处理方式设为 agentic,采用标准 token 计费,不额外收费。功能还将陆续进入 Gemini 应用,并在未来数月支撑 YouTube 观看页的 Ask YouTube 功能。

关键事实

  • 智能体视频理解已在 Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite 上线
  • token 消耗最多降低 88%,成本最多降低 66%,准确率最多提升 7%
  • 静态处理默认按 1 FPS 读取视频,帧率可通过 API 调整
  • 功能支持视频上传与 YouTube 视频,通过 Google AI Studio 和 Gemini Enterprise Agent Platform 的 Gemini API 使用
  • 启用方式是在 API 配置中把处理方式设为 agentic,按标准 token 计费,无额外功能费
  • 未来数月将支撑 YouTube 观看页的 Ask YouTube 功能

为什么值得关注

长视频分析长期受制于 token 成本与细节丢失的两难,成本降 66%、token 降 88% 意味着数小时录像的检索与异常检测更可行,开发者不必再自建分段流程;普通用户后续也能在 Gemini 应用和 YouTube 上用到基于画面的问答。

背景与影响

此前开发者若想只分析视频的关键片段,需要自行编写流程来定位和截取,开发成本较高。Gemini 的智能体视频理解把这一过程交给模型内部的工具调用循环完成,与已有的 agentic vision(代码执行结合原生图像理解)思路一致。官方称多家早期访问合作伙伴在测试中取得了良好表现。

信源:Google DeepMind

原文标题:Introducing agentic video understanding with Gemini

阅读原文 →

本文整理自公开报道,版权归原作者所有;文中观点仅供参考,不代表本站立场。如有版权问题,请联系我们。