Google 为 Gemini 上线智能体视频理解:动态选段而非固定抽帧 Google 9 月 1 日为 Gemini 3.7… — AI一线|ShareCentre — TG.ME

Google 为 Gemini 上线智能体视频理解:动态选段而非固定抽帧

Google 9 月 1 日为 Gemini 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite 上线智能体视频理解。传统默认流程以每秒一帧扫描整段视频;新模式会先分析问题,再主动搜索相关片段,并按内容调整帧率与分辨率,同时结合画面、音频和转录完成回答。

开发者可在 Gemini API 的视频输入中把 processing 设为 agentic,并在响应里查看模型搜索过的片段与处理步骤。功能当天已进入 Gemini API、Google AI Studio 和 Gemini Enterprise Agent Platform,支持上传视频与公开 YouTube 视频;它沿用所选 Gemini 模型的标准 Token 价格,不另收功能费。

Google 在所选视频基准上报告,这种动态处理最高减少 88% 的 Token、降低 66% 的成本并提升 7% 的准确率。面向消费者的 Gemini 应用集成将于近期推出,YouTube 内的 Ask 功能计划在未来数月接入。

官方发布:
https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/
开发文档:
https://ai.google.dev/gemini-api/docs/video-understanding
September 2, 2026 426 1