原厂抬价、托管商打折:开源大模型定价权争夺战

原厂抬价、托管商打折:开源大模型定价权争夺战

  大模型费用 战正在出现一个矛盾的场景:模型原厂提高官方API费用  ,同一份开源权重在第三方市场上的调用费用 却持续下降。

原厂抬价	、托管商打折:开源大模型定价权争夺战-第1张图片

  8月13日 ,DeepSeek在发布V4-Pro正式版的同时宣布调整API费用 ,并引入峰谷计费 。新费用 于北京时间8月17日零时生效,高峰时段输出费用 为27元/百万tokens ,缓存未命中费用 为9元/百万tokens,缓存命中费用 为0.30元/百万tokens,分别为此前费用 的4.5倍 、3倍、12倍 。空闲时段费用 统一为高峰时段的一半。

原厂抬价、托管商打折:开源大模型定价权争夺战-第2张图片

  智谱GLM Coding Plan新版订阅套餐Lite 、Pro、Max 月费分别为 118 元、538 元和 1078 元 ,此前为49元 、149元、469元,三档分别上涨约 141%、261% 和 130%。同时,计费方式由此前的请求次数限制 ,改为以Token消耗为基础的积分制 。非高峰时段则可享50%基础积分消耗的抵扣。

  但在主流聚合调用平台OpenRouter上,另一条费用 曲线正朝相反方向运动。

  近来 ,同一款DeepSeek V4-Flash-0731由数十家服务商提供推理服务 ,Open Inference的报价低至0.05美元和0.16美元,Sail Research 、AkashML等服务商报价为0.065美元和0.18美元 。最低报价只有官方低谷费用 的约四分之一。

  GLM-5.3在AkashML、Decart、io-net等服务商上的报价降幅为5%至16%;GLM-5.3 Flash在GMICloud 、NovitaAI、DeepInfra等服务商上的报价降幅则达到50%。

  “抬价的是原厂对自己端点的定价权,压价的是别人拿同一份权重做托管的边际成本 。 ”新加坡无限对齐创始人、Codex生态合作伙伴宋斐对记者表示。

  两条反向运动同时出现 ,意味着开源模型的权重 、推理服务和最终产品正在被拆分 ,原厂牌价不再等同于模型的市场服务费用 。

  为什么市场价能继续下探?

  实际上,原厂与第三方托管商出售的并不是完全相同的商品 。

  DeepSeek需要承担模型训练 、后训练、安全评估、版本迭代以及官方API稳定性等成本,还要为高峰并发预留推理资源。第三方托管商获得开放权重后 ,主要竞争的是如何更低成本地完成推理,可以通过不同芯片 、量化精度、批处理、缓存和集群调度压缩边际成本。

  此外,Agent的兴起还改变了官方API的负载结构 。

  与普通问答相比 ,Coding Agent需要反复携带系统提示 、工具定义、代码仓库信息和历史轨迹,大量请求具有相同或相似的前缀,因此高度依赖上下文缓存 。缓存可以减少重复计算 ,但对应的KV Cache仍会持续占用显存。在并发高峰期,长上下文、长输出的Agent任务可能明显挤占推理容量。

  此前DeepSeek调价中,涨幅最大的正是Agent负载高度依赖的缓存命中输入 。以V4-Pro为例 ,缓存命中输入的低谷 、高峰费用 分别达到旧价的6倍和12倍;缓存未命中输入和输出费用 的涨幅相对较低。

  DeepSeek官方将峰谷定价解释为更合理地调配资源、维持服务稳定,并未直接表示调价针对Agent流量。宋斐认为,从费用 结构看 ,其实际效果是提高高峰Agent负载的成本 ,引导可延后的批量任务转向低谷时段,从而缓解显存和推理容量压力 。

  第三方托管商则面临另一套商业逻辑。权重开放后,任何具备部署能力的云厂商都可以围绕同一模型提供服务。部分服务商使用低成本GPU或国产芯片 ,部分通过FP〖捌〗、 INT8等量化方式减少显存和计算消耗,也有厂商愿意用促销费用 换取利用率 、客户和流量 。

  由此,研发模型的公司不再垄断模型的推理供给。原厂可以决定官方API的费用  ,却无法阻止其他公司围绕同一份权重展开成本竞争。

  OpenRouter等聚合平台进一步放大了这种分化 。同一模型的费用 、速度、可用率 、缓存政策和数据留存方式被放进同一张供应商列表,用户可以根据费用 或性能选取 路由。原本分散的云服务由此成为一个可直接比较的市场。

  不过,最低报价也不能简单等同于全市场成交价 。不同端点在量化精度 、工具调用效果、并发保障、数据留存和故障率上存在差异;一些折扣也可能是阶段性促销 。

  原厂靠什么赚钱?

  当开放权重的推理服务逐渐商品化 ,单纯出售token将越来越难以维持长期溢价。原厂必须将定价权转移到推理服务之外。而且原厂之间的竞争也日趋激烈,刚刚过去的两个月之内,国内大模型厂商旗舰模型密集发布 。

  在万创投行董事总经理苏婉怡看来 ,头部模型之间在用户可感知层面的差距已经很小,缺的是“能力 + 成本 + 国产化适配 ”三者均衡的综合实力——推理成本控制能力 、工具调用能力、Agent稳定性、企业场景的交付能力。

  苏婉怡认为,模型厂商真正的定价权来自两处:一是推理成本 ,谁能把每token的边际成本压下来 ,谁就有降价的空间;二是生态黏性,开发者把应用建在你的模型上,迁移成本高 ,这才是壁垒。

  “行业正在从‘稀缺溢价’走向‘效率竞争’,下面 比拼的是算力结构和生态黏性 。”苏婉怡对记者表示。

  智谱近期围绕GLM模型 、ZCode和Coding Plan形成的组合,可以被视为原厂重建定价权的一种尝试。

  8月 ,智谱发布GLM-5.3和GLM-5.3-Flash,同步全量开放包括Lite、Pro、Max和团队版本的GLM Coding Plan订阅,以订阅制交付编码智能体能力 。同月 ,ZCode宣布全面升级,推出Goal 、Subagents、Remote Control以及闲时任务四大功能。据智谱介绍,近来 ZCode用户数已突破100万。

  智谱正在加快构建的这套“基础模型+Coding Harness+订阅服务”AI编程生态 ,瞄准的是推理服务之外的价值空间:模型调用越趋向商品化,单一模型的替代成本越低;但一旦模型嵌入开发环境和开发工作流,用户迁移所需要付出的代价就不仅是重新更换一个API ,更是重新适配整个工作环境 。

  这也意味着 ,用户购买的不再只是某个模型的token,而是可接入主流编程工具的额度、模型能力和开发工作流。即使底层API面临降价压力,产品订阅仍可能通过便利性 、稳定性和迁移成本保留溢价。

  另一种夺回定价权的方式是把定价权写进许可条款和工程中 。

  7月 ,月之暗面发布Kimi K3,随这款2.8万亿参数大模型的权重一同发布的是“Kimi K3 License ” 。Kimi放弃了此前宽松的MIT许可,规定任何企业及其关联方如果以MaaS方式直接向第三方提供推理或微调服务 ,且连续12个月收入超过2000万美元,必须与月之暗面另行达成商业协议。同时,对于月活超过1亿或月收入超过2000万美元的产品 ,必须在界面显著位置标注“Kimi K3”。

  K3依然允许下载、修改、微调和商业使用,对于绝大多数开发者和中小团队而言,这些条款并无实际影响;但对于云厂商 、模型聚合平台等大玩家而言 ,“免费午餐”结束了 。

  DeepSeek和智谱的权重是全精度发布,第三方拿到之后可以自己量化 、换芯片、调批处理,成本压得比原厂低。K3的做法把这条路堵了一半。

  “K3权重发布时就是训练用的低精度 ,第三方拿到手 ,往上转精度没有收益,往下再压又要掉效果,量化这一档的成本空间基本没了 。推理这块月之暗面只开了模型执行的部分 ,生产环境里怎么调度、怎么排缓存 、哪些请求前缀热,这些都是在自家流量上跑出来的,第三方没有这份流量 ,同样的硬件跑不到同样的利用率。所以K3和DeepSeek不一样,第三方在成本上占不到便宜,护城河从权重挪到了托管效率 ,再加许可条款兜底。 ”宋斐表示 。

  中软世界 此前已公开宣布“商业层面采用Token分成机制,对基于Kimi大模型产生的Token消耗收益及其他合作衍生收入按约定比例分成”。另据近日市场消息披露,月之暗面正与微软、亚马逊和谷歌谈判 ,希望让K3进入Azure、AWS和Google Cloud,并从相关服务获得的收入中拿走比较高 30%的分成。

  此外,还值得注意的是 ,近日智谱又将Coding Plan搬上了天猫销售 。仅一天后 ,天猫又将阿里云 、DeepSeek、Kimi、MiniMax等多家头部大模型厂商的订阅服务集中到“天猫AI空间站”上销售。

  大模型登上电商平台,意味着AI订阅开始从模型厂商官方网站 和托管商的销售渠道,走向第三方电商平台的标准化货架。原先主要面向开发者和企业客户的订阅服务 ,如今尝试向更多普通消费者敞开 。可以想象,未来AI订阅可能像买流量包一样被比价和促销 。

(文章来源:21世纪经济报道)

©版权声明
THE END