谷歌推Gemini 3.6 Flash:降低企业AI代理token成本

谷歌近日发布了Gemini 3.6 Flash和3.5 Flash Lite两款新型号,目标直指企业AI代理(Agent)运行中的延迟与token成本问题。这两款模型被定位为“新主力”,旨在为生产环境中的自主软件代理提供更经济的推理能力。

在企业级AI应用中,运行自主代理的经济性取决于一个固定公式:模型需要在多步任务中表现出色,同时将每次推理的token消耗控制在预算之内。然而,这一平衡点极少有厂商公开透明地展示。谷歌此次推出的新模型,正是为了在推理能力与成本之间找到最优解。

Gemini 3.6 Flash:高性能与低成本兼顾

据谷歌介绍,Gemini 3.6 Flash在多项基准测试中表现出色,尤其擅长需要多步推理的复杂任务。相比前代,其延迟降低了约40%,而token成本则下降了近50%。这意味着企业可以在不牺牲Agent性能的前提下,大幅降低运营开支。

与此同时,Gemini 3.5 Flash Lite则更专注于轻量级场景。它针对实时响应要求高、计算资源有限的边缘设备进行了优化,token成本比标准Flash版本再低60%。谷歌表示,这两款模型将共同覆盖从云端到边缘的各类企业Agent需求。

企业Agent面临的成本困境

“在部署一个需要执行10步推理的Agent时,如果每一步消耗100个token,单次任务就需要1000个token。当Agent每天运行数百万次时,token成本会迅速失控。”——某AI基础设施分析师

当前的AI Agent市场正从概念验证走向大规模部署,但成本是最大的拦路虎。许多企业发现,虽然Agent能自动化复杂工作流,但推理过程中的反复调用让token账单高企。谷歌的新模型正是针对这一痛点:通过优化模型架构和推理引擎,在保证任务成功率的前提下,压缩每次推理所需的token数量。

行业背景与竞争态势

此次发布让谷歌在Agent模型中占据先机。此前,Anthropic的Claude 3.5系列和OpenAI的GPT-4o都在强调各自的推理能力,但鲜有直接针对Token成本的优化。谷歌的Gemini系列天然受益于其庞大的基础设施和TPU生态,这使其能在不牺牲质量的情况下压缩成本。

值得注意的是,谷歌还同步推出了全新的Agent开发框架“Vertex AI Agent Builder”,与这两款模型深度集成。该框架允许开发者以可视化方式编排多步Agent工作流,并自动推荐最经济的模型组合。这进一步降低了企业构建AI Agent的门槛。

编者按:成本竞争是Agent大规模落地的关键

AI Agent的普及不仅取决于能力,更取决于成本。当推理的边际成本趋近于零时,企业才会放心地将关键业务交给自主代理。谷歌此次的模型更新,本质上是在推动“token经济学”的进化。未来,我们预计更多厂商会将“每任务成本”作为核心KPI,而非仅仅关注准确率。Gemini 3.6 Flash和3.5 Flash Lite的到来,可能标志着AI Agent从“能用”到“经济可用”的转折点。

本文编译自AI News