大模型原厂涨价,第三方托管却越卖越便宜
21世纪经济报道 · 财经与投资
原创 21记者 2026-09-05 09:52 广东 记者丨 陈归辞 邓浩 编辑丨卜羽勤 张明艳 大模型价格战正在出现一个矛盾的场景: 模型原厂提高官方API价格,同一份开源权重在第三方市场上的调用价格却持续下降。 8月13日,DeepSeek在发布V4-Pro正式版的同时宣布调整API价格,并引入峰谷计费。新价格于北京时间8月17日零时生效,高峰时段输出价格为27元/百万tokens,缓存未命中价格为9元/百万tokens,缓存命中价格为0.30元/百万tokens,分别为此前价格的4.5倍、3倍、12倍。空闲时段价格统一为高峰时段的一半。 智谱GLM Coding Plan新版订阅套餐Lite、Pro、Max 月费分别为 118 元、538 元和 1078 元,此前为49元、149元、469元,三档分别上涨约 141%、261% 和 130%。同时,计费方式由此前的请求次数限制,改为以Token消耗为基础的积分制。非高峰时段则可享50%基础积分消耗的抵扣。 但在主流聚合调用平台OpenRouter上,另一条价格曲线正朝相反方向运动。 目前,同一款DeepSeek V4-Flash-0731由数十家服务商提供推理服务,Open Inference的报价低至0.05美元和0.16美元,Sail Research、AkashML等服务商报价为0.065美元和0.18美元。最低报价只有官方低谷价格的约四分之一。 GLM-5.3在AkashML、Decart、io-net等服务商上的报价降幅为5%至16%;GLM-5.3 Flash在GMICloud、NovitaAI、DeepInfra等服务商上的报价降幅则达到50%。 “抬价的是原厂对自己端点的定价权,压价的是别人拿同一份权重做托管的边际成本。”新加坡无限对齐创始人、Codex生态合作伙伴宋斐对记者表示。 两条反向运动同时出现,意味着开源模型的权重、推理服务和最终产品正在被拆分,原厂牌价不再等同于模型的市场服务价格。 为什么市场价能继续下探? 实际上,原厂与第三方托管商出售的并不是完全相同的商品。 DeepSeek需要承担模型训练、后训练、安全评估、版本迭代以及官方API稳定性等成本,还要为高峰并发预留推理资源。第三方托管商获得开放权重后,主要竞争的是如何更低成本地完成推理,可以通过不同芯片、量化精度、批处理、缓存和集群调度压缩边际成本。 此外,Agent的兴起还改变了官方API的负载结构。 与普通问答相比,Coding Agent需要反复携带系统提示、工具定义、代码仓库信息和历史轨迹,大量请求具有相同或相似的前缀,因此高度依赖上下文缓存。缓存可以减少重复计算,但对应的KV Cache仍会持续占用显存。在并发高峰期,长上下文、长输出的Agent任务可能明显挤占推理容量。 此前DeepSeek调价中,涨幅最大的正是Agent负载高度依赖的缓存命中输入。以V4-Pro为例,缓存命中输入的低谷、高峰价格分别达到旧价的6倍和12倍;缓存未命中输入和输出价格的涨幅相对较低。 DeepSeek官方将峰谷定价解释为更合理地调配资源、维持服务稳定,并未直接表示调价针对Agent流量。宋斐认为,从价格结构看,其实际效果是提高高峰Agent负载的成本,引导可延后的批量任务转向低谷时段,从而缓解显存和推理容量压力。 第三方托管商则面临另一套商业逻辑。权重开放后,任何具备部署能力的云厂商都可以围绕同一模型提供服务。部分服务商使用低成本GPU或国产芯片,部分通过FP8、INT8等量化方式减少显存和计算消耗,也有厂商愿意用促销价格换取利用率、客户和流量。 由此,研发模型的公司不再垄断模型的推理供给。原厂可以决定官方API的价格,却无法阻止其他公司围绕同一份权重展开成本竞争。 OpenRouter等聚合平台进一步放大了这种分化。同一模型的价格、速度、可用率、缓存政策和数据留存方式被放进同一张供应商列表,用户可以根据价格或性能选择路由。原本分散的云服务由此成为一个可直接比较的市场。 不过,最低报价也不能简单等同于全市场成交价。不同端点在量化精度、工具调用效果、并发保障、数据留存和故障率上存在差异;一些折扣也可能是阶段性促销。 原厂靠什么赚钱? 当开放权重的推理服务逐渐商品化,单纯出售token将越来越难以维持长期溢价。 原厂必须将定价权转移到推理服务之外。 而且原厂之间的竞争也日趋激烈,刚刚过去的两个月之内,国内大模型厂商旗舰模型密集发布。 在万创投行董事总经理苏婉怡看来,头部模型之间在用户可感知层面的差距已经很小,缺的是“能力 + 成本 + 国产化适配”三者均衡的综合实力——推理成本控制能力、工具调用能力、Agent稳定性、企业场景的交付能力。 苏婉怡认为, 模型厂商真正的定价权来自两处:一是推理成本,谁能