谷歌Gemini 3.7 Flash发布:0.75美元输入价打响推理成本战

谷歌Gemini 3.7 Flash发布:0.75美元输入价打响推理成本战

2026年8月14日,据财联社报道,谷歌正式推出Gemini 3.7 Flash模型。官方披露的核心信息只有一组数字,但这组数字的分量不小:输入价格为每100万个词元0.75美元,输出价格为每100万个词元3.75美元,并且明确这是今年年底前提供的限时优惠价格

先给结论:谷歌这次没有把弹药押在参数和榜单上,而是押在了”单位推理成本”上。Flash档位从来不是用来打榜的,它是用来抢调用量的。

一、官方披露了什么:一张表看懂

本次发布对外公开的确定性信息相当克制,梳理如下:

项目 官方披露内容
模型名称 Gemini 3.7 Flash
消息来源与时间 财联社,2026年8月14日
输入价格 0.75美元 / 100万词元
输出价格 3.75美元 / 100万词元
价格性质 年底前限时优惠价
输入输出价差 5倍

需要说明的是,除定价之外的基准测试成绩、上下文窗口、多模态能力等细节,本次报道并未一并披露。因此下面的分析只围绕”定价策略”本身展开,不对未公开的性能指标做推测。

二、Flash档位的战略意义:谷歌在守哪条线

1. Flash是”量”的入口,不是”榜”的门面

大模型厂商的产品线通常分成两层:旗舰档位负责刷榜、负责证明技术上限、负责拿下高价值复杂任务;Flash/mini这类轻量档位负责承接真实世界里绝大多数高频、低复杂度、对延迟敏感的请求。

从商业角度看,后者才是决定营收规模的那一层。一家企业每天可能只有几百次需要旗舰模型深度推理的请求,但可能有几十万次分类、抽取、改写、路由、摘要类调用。谷歌把0.75美元这个价格标在Flash上,指向非常明确——它要的是这几十万次。

2. 限时优惠的潜台词

“年底前限时优惠”这四个字值得单独拿出来说。它至少传递两层信息:

  • 获客窗口:优惠期本质是一段迁移补贴期,目的是让开发者在这几个月里完成接入、把业务逻辑写进Gemini的API,形成切换成本。
  • 定价弹性预留:标注”限时”意味着谷歌为后续调价保留了空间,既可以在需求验证后回调,也可以在竞争加剧时把优惠常态化。

换句话说,0.75美元不一定是长期价格,但它一定是一个用来抢占心智和迁移窗口的价格。

三、5倍输入输出价差说明什么

输入0.75美元、输出3.75美元,价差整整5倍。这个结构本身就是一份使用说明书。

输入侧便宜,鼓励开发者”大胆喂上下文”——把长文档、完整对话历史、检索到的知识片段一股脑塞进提示词,成本压力有限。输出侧贵,则是在给”让模型少说话”定价:能用结构化字段回答的,不要写成长篇散文;能返回JSON的,不要返回带解释的自然语言。

对于做RAG、做智能体、做文档处理的团队,这个价差意味着一个非常具体的优化方向:输入可以放开,输出必须收紧。控制输出长度带来的成本收益,是控制输入长度的5倍。

四、同一天的另一条消息:竞争坐标在移动

值得注意的是,就在同一天(8月14日),OpenAI也对外发布了名为Ultrafast的新模式,主打把旗舰模型GPT-5.6 Sol的运行速度提升至标准模式的14倍。

两家头部厂商在同一天分别从”更便宜”和”更快”两个方向出招,这个巧合本身就说明了当前竞争的重心:大模型的竞争,正在从”谁的答案更好”转向”谁能在单位成本和单位时间内交付更多有效工作”。参数规模的叙事在退场,工程效率与商业化单位经济性的叙事在上场。

五、给企业用户的三条实操建议

  • 做模型分层,别一把梭:把任务按复杂度分级,高频简单任务下沉到Flash档位,只把真正需要深度推理的请求留给旗舰模型。这一步通常能砍掉大部分账单。
  • 把优惠期当迁移期,不当省钱期:限时优惠的正确用法是在这段时间里完成压测、跑通业务链路、建立可迁移的抽象层,而不是把预算模型建立在优惠价上。
  • 盯输出长度,不只盯调用次数:在5倍价差结构下,输出token是主要成本项。约束返回格式、限制最大输出长度,往往比减少调用次数更有效。

FAQ

Q1:Gemini 3.7 Flash的具体价格是多少?

据财联社2026年8月14日报道,输入价格为每100万个词元0.75美元,输出价格为每100万个词元3.75美元。该价格为今年年底前提供的限时优惠价格。

Q2:这个价格是永久的吗?

不是。谷歌明确说明这是今年年底前的限时优惠价格。年底之后的定价官方尚未公布,企业在做预算规划时不宜直接按优惠价外推。

Q3:Flash档位适合什么场景?

Flash这类轻量档位通常面向高频、对延迟敏感、复杂度相对可控的任务,例如文本分类、信息抽取、内容改写、请求路由、摘要生成等。需要长链条深度推理的复杂任务,仍建议评估旗舰档位模型。

Q4:输入和输出为什么差5倍价格,我该怎么用?

输出侧的计算成本天然高于输入侧,因此厂商普遍对输出token定价更高。实操上意味着可以相对放开输入上下文长度,但要严格约束输出长度和格式,优先让模型返回结构化的短结果,这样成本优化效果最明显。

结语

Gemini 3.7 Flash这次没有华丽的发布会,只有一组价格。但在2026年的大模型市场,价格本身就是最硬的产品声明。当头部厂商开始在同一天分别比拼成本和速度时,说明这个行业已经从技术竞赛期,进入了效率竞赛期。对企业而言,这是好事——真正该关心的问题,从”用哪个模型最强”变成了”怎么用最划算”。

© 版权声明
THE END
喜欢就支持一下吧
点赞8 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容