Gemini 3.8 Flash发布:性价比逼近Claude Opus 5,谷歌用Flash系列打一场速度战

美东时间2026年9月2日,谷歌正式发布Gemini 3.8 Flash与Gemini 3.8 Flash Cyber两款新模型。前者在DeepSWE v1.1长周期软件工程基准中得分73.7%,与Claude Opus 5的74.0%相差不足一个百分点,而调用成本仅为后者的15%;后者在CyberGym漏洞发现测试中以86.2%的成绩超过同期所有参测商业模型,通过Fairwind计划向全球650余家经审核机构开放。这是谷歌六周内第三次发布Flash系列模型,据独立评测机构Artificial Analysis统计,也是不到四个月内推出的第四款Flash模型。

从单次生成到长周期Agent:升级的核心逻辑

Gemini 3.8 Flash此次的核心变化,不是让模型“更聪明”,而是让模型“做得更多”。谷歌将其定位为面向长周期软件工程、多步骤智能体任务和专业领域复杂推理,设计哲学与前代有明显不同:面对不确定性时,新模型不会直接输出低置信度答案,而是通过消耗更多Token在内部完成自我验证和反思,再经历多轮工具调用后输出结果。

这一设计在基准数据上有直接体现。据Artificial Analysis独立评测,Gemini 3.8 Flash高推理档的综合智能指数达到59分,较Gemini 3.7 Flash的56分提升3分,在196个参测模型中排名第17位,输出速度约302.1 Token/秒,位居所有模型前三。但代价同样清晰:高推理档每项任务的实际成本约0.58美元,比3.7 Flash的0.40美元高出约40%。原因在于,新模型每项任务平均输出Token数量增加约30%,智能体评测中的交互轮数也随之增加。

这意味着,Token单价没变,但模型“思考更多、调用更多”,实际花费上涨。谷歌保留了多个推理档位来应对这一问题:中推理档每项任务成本约0.41美元,低推理档约0.24美元。对追求成本效率的应用场景,开发者可以主动降低推理强度,或继续沿用3.7 Flash。

价格剪刀差:一组让竞争对手难以忽视的数字

性价比是Gemini 3.8 Flash最具杀伤力的竞争维度。据TradingKey报道,目前Gemini 3.8 Flash引导价为每百万输入Token 0.75美元、每百万输出Token 3.75美元,该价格锁定至2026年12月31日,2027年1月1日起将上调至1.50美元和7.50美元。

与之对比:Claude Opus 5输入和输出价格分别为每百万Token 5美元和25美元,GPT-5.6 Sol为4美元和20美元,GPT-5.6 Terra为2美元和12美元。在DeepSWE v1.1测试中,Gemini 3.8 Flash以73.7%的分数超过GPT-5.6 Sol(72.7%)和GPT-5.6 Terra(69.6%),仅略低于Claude Opus 5的74.0%——但调用成本约为Claude Opus 5的1/7、GPT-5.6 Sol的1/5。

在专业领域多学科推理测试HLE-Verified(覆盖科学、技术、人文及专业知识)中,Gemini 3.8 Flash得分54.9%,超过Claude Opus 5的54.4%、GPT-5.6 Sol的54.5%、GPT-5.6 Terra的51.1%和Claude Sonnet 5的31.0%。单从这两项测试的数字来看,Gemini 3.8 Flash在旗舰级任务上已具备与顶级模型直接竞争的实力,价格则停留在工具模型区间。

RSI:谷歌把Flash系列升级速度本身当成论据

理解这次发布,需要跳出单一模型评测的框架。谷歌公开将Gemini 3.8 Flash的发布与递归自我改进(RSI)战略挂钩:让模型具备足够强的代码能力,进而参与自身乃至下一代模型的研发过程,打通研发闭环。

据华尔街日报等媒体报道,谷歌DeepMind联合创始人谢尔盖·布林亲自介入,与DeepMind CTO Koray Kavukcuoglu共同监督一支专项编码突击队,目标是将编程模型改造为全自动AI研究员。谷歌在内部备忘录中直接表述:“为了赢得最后的冲刺,我们必须紧急弥合智能体执行方面的差距,把我们的模型变成主力开发者。”

谷歌DeepMind研究员姚顺宇在模型发布后评价:“对模型而言,这只是迈出了一小步;但对于RSI来说,这是一次巨大飞跃。”这句话揭示的逻辑是:一个能在长周期Agent循环中快速、廉价地反复迭代的模型,天然具备参与自动化研发流程的条件——速度与极低的推理成本,本身就是一种结构性优势。

据报道,谷歌内部代码工具Jetski的测试结果显示,谷歌工程师已更倾向于使用Gemini 3.8 Flash,而非Anthropic的Opus系列模型。这是一个内部验证信号,但尚未有独立第三方在真实生产环境中作系统性对比。

Gemini 3.8 Flash Cyber:一款不对外开放的专项模型

与通用版同步发布的Gemini 3.8 Flash Cyber,是此次发布中定位更为特殊的一款。该模型专注于网络安全漏洞发现与自动修复,不面向公众开放,而是通过谷歌新启动的Fairwind计划,向经过审核的可信防御团队提供,覆盖政府机关、关键基础设施运营者及软件供应商等类型的机构。

在性能层面,据TradingKey报道,Gemini 3.8 Flash Cyber在CyberGym漏洞发现测试中得分86.2%,超过Gemini 3.5 Flash Cyber的77.5%、GPT-5.6 Sol的83.6%、Mythos 5的83.8%以及GPT-5.5-Cyber的85.6%。在谷歌内部覆盖20种编程语言的真实漏洞测试中,成功率为71.0%,高于Gemini 3.7 Flash的58.9%和3.5 Flash Cyber的46.6%。在CWE-Bench自动补丁测试中,pass@1达到47.2%,接近当前领先前沿模型的47.8%,且成本更低。

谷歌还披露了一项Chrome安全团队的内部测试结果:Gemini 3.8 Flash Cyber在该场景中生成正确漏洞补丁的效率是同期参测商业模型的2.6倍。

Fairwind计划的设计逻辑有双重含义:一方面通过准入门槛降低滥用风险,另一方面也意味着谷歌在网络安全AI领域选择了B2B路径——不是向个人开放,而是向机构渗透。650余家初始合作机构,构成了一个围绕高价值政企客户的早期生态。

产业格局:Flash系列正在改变竞争的基准线

对竞争格局的实质影响,不只是Gemini 3.8 Flash这一款模型本身,而是谷歌在106天内推出四款Flash模型这个迭代节奏。

对Anthropic和OpenAI而言,这意味着“顶级模型的编程和推理能力”正在快速商品化。当一款定价在旗舰模型1/7价位的模型能在DeepSWE v1.1上几乎追平Claude Opus 5,以“旗舰性能”为差异化支撑点的高价策略将面临越来越大的压力。当然,基准测试与实际生产场景之间仍存在落差,多轮对话质量、指令跟随稳定性、低错误率的长文本处理,都是基准分数无法完整呈现的维度。

对开发者而言,Gemini 3.8 Flash的引入提供了一个新的选型锚点,但需要注意一个操作层面的细节:所谓低价,指的是Token单价,而非任务总价。该模型因为“思考更多”而消耗更多Token,高推理档的实际每任务成本已比3.7 Flash贵40%。开发者需要根据具体场景选择推理档位,才能真正实现预期的成本控制。对于追求极致性价比的批量任务,中推理或低推理档,乃至继续使用3.7 Flash,可能是更务实的选择。

对企业选型而言,Gemini 3.8 Flash Cyber和Fairwind计划打开了另一个维度的考量:如果所在机构属于政府、金融、关键基础设施或大型软件供应商,是否申请Fairwind资格、如何将AI漏洞修复纳入现有安全流程,将成为一个新的待决策项。

对照:Flash密集发布与Flash系列历史演进

Artificial Analysis的数据提供了一条有意义的历史坐标线:Gemini 3.8 Flash是谷歌106天内推出的第四款Flash模型。从3.5 Flash Cyber到3.7 Flash再到3.8 Flash,每次迭代的DeepSWE分数分别在65.3%(3.7 Flash)和73.7%(3.8 Flash)之间跳跃,单次提升8.4个百分点。如果这一节奏延续,下一代Flash模型可能在2026年底之前出现。

与之形成对比的是谷歌旗舰模型线的静默——据Fortune等媒体报道,谷歌的Gemini 3.5 Pro旗舰模型目前仍未发布,Flash系列实际上承担了谷歌在前沿AI竞赛中的主要正面出击任务。这一策略有其内在逻辑:在RSI框架下,编程能力强、速度快、成本低的工具模型,比追求综合能力的旗舰模型更适合作为自动化研发的驱动力。但长期来看,如果旗舰模型线继续缺席,谷歌在长文本、深度推理等旗舰任务上的竞争窗口可能被对手拉大。

战略判断

第一,价格下行压力将在2026年底前集中释放。Gemini 3.8 Flash的引导价锁定至12月31日,2027年1月1日起涨价一倍。在此之前,竞争对手面临要么跟随降价、要么接受成本比较劣势的压力窗口。OpenAI和Anthropic是否在第四季度推出新的成本优化版本,以及Gemini 3.8 Flash涨价后开发者迁移行为的数据,是关键信号。

第二,RSI叙事能否自我验证,取决于下一个里程碑的速度。谷歌将Flash的迭代节奏本身作为RSI的证据,但这一逻辑成立的前提是:每代模型确实参与了下一代模型的研发,而不仅仅是由人类工程师加速开发的结果。判断这一点的关键信号,是谷歌是否能在未来几个月内公布具体的AI辅助研发比例数据,或Gemini旗舰模型线何时重新出现。

第三,Fairwind计划的网络安全路径,短期内更可能是企业渗透工具,而非通用安全产品。650余家机构的初始规模意味着谷歌在这一领域选择了精耕而非广播。如果Chrome安全团队2.6倍效率的数据能够在更多机构中独立复验,将构成该计划快速扩张的强力背书。

总体而言,Gemini 3.8 Flash的发布在产业层面确立了一个新的坐标:旗舰级编程推理性能与工具级价格同时成立,在此之前,这两个维度在主要商业模型中几乎从未同时出现。这一坐标是否稳定,取决于实际生产场景中的持续验证,以及竞争对手在2027年初定价调整节点前的应对策略。