近期,全球大模型市场呈现出截然不同的价格走向。美国头部模型企业纷纷降价,而中国部分领先模型却开始尝试提高价格,这一反差引发行业广泛关注。
在降价阵营中,OpenAI与Anthropic的竞争尤为激烈。7月30日,OpenAI大幅下调GPT-5.6 Luna和Terra的价格,其中Luna降价幅度达80%,而Sol价格保持不变。同时,该公司通过减少Codex、ChatGPT Work的额度消耗,并多次重置付费用户额度,间接提升了同等订阅价格下的可用计算量。Anthropic随后也取消了Claude Sonnet 5原定于9月生效的50%涨价计划,维持了每百万Token输入2美元、输出10美元的API首发价。这一系列动作表明,美国模型厂商正通过价格战争夺用户,尤其是企业和开发者市场。
OpenAI与Anthropic的竞争背后,是Agent市场形成的全新竞争链条。降低使用门槛、吸引更多真实任务运行、暴露更多失败模式、改进Agent性能,进而争取更多工作负载,已成为模型厂商的核心策略。价格作为直接影响调用频率的关键因素,在Agent场景中尤为重要。更少步骤完成同样任务,意味着更低成本,这也解释了Anthropic为何取消涨价计划。
与此同时,中国大模型市场却呈现出不同的态势。8月11日前后,DeepSeek在官方API定价页预告近期将整体涨价,并称“预计涨幅较大”。尽管目前DeepSeek仍处于全球前沿模型的最低价区间,其V4-Flash每百万Token输入仅0.14美元、输出0.28美元,但此次涨价仍引发市场关注。7月16日发布的Kimi K3也采取了高价策略,每百万Token普通输入20元、输出100元,面向长程编程和复杂知识工作。
中国模型涨价的背后,是开放权重模型迅速扩大可替代任务范围的压力。DeepSeek、Qwen、Kimi、GLM等中国开放权重模型已成为企业实际调用和部署的重要选项。它们虽未必在所有任务上追平最强的Claude和GPT,但正在快速占领“哪些工作已不再需要最贵模型”的战略区域。数据显示,OpenRouter平台上开放模型处理的Token占比从1月的34%升至6月的65%,平台最受欢迎的四个模型全部来自中国。这一趋势表明,中国模型正在压缩美国旗舰模型能够收取高溢价的任务范围。
企业用户的行为变化也推动了这一趋势。斯坦福Digital Economy Lab的调查显示,42%的企业AI项目认为底层模型完全可以替换,尤其在常规、规则明确的任务中,这一比例高达71%。企业开始将模型视为可替换零件,根据成本、准确率、相关性和延迟等因素动态选择模型。这种“multi-LLM gateway”策略,使得模型忠诚度下降,客户虽在,但价格竞争愈发激烈。
Agent的普及进一步放大了这一效应。与聊天时代一次问题对应几次模型调用不同,Coding Agent一次任务可能涉及几十甚至上百次调用,导致Token成本迅速上升。企业真正关心的指标逐渐从“每百万Token价格”转向“每成功任务成本”。例如,一个0.5美元的模型若需试40次,可能比5美元但8步完成任务的模型更贵。这种变化使得模型厂商不得不重新考虑定价策略。
在中国模型中,DeepSeek和Kimi代表了两种不同的商业选择。DeepSeek凭借极低价格建立了巨大使用规模和开放生态,此次涨价旨在测试定价权。若价格上涨后调用量基本保留,说明其全球采用已超出“因为便宜所以用”的范畴;若大量任务迁移至其他模型,则表明低价在此前采用中的作用更大。而Kimi K3从一开始就定位为长程Coding、Agent和知识工作旗舰,采取高价策略。其需求已出现早期信号,发布数日后因需求超过计算能力,Moonshot一度暂停新的Kimi订阅。
价格变化只是表层现象,判断模型商业位置的关键在于是否形成稳定、持续并能够转化为收入的真实使用。目前虽无覆盖全球模型使用量的完整统计,但通过综合真实调用、生产部署、分发渠道、开发者生态、商业变现和持续使用六个维度构建的模型采用度指数(MAI)显示,不同模型的“采用结构”已明显分化。Claude的优势集中于企业生产部署和分发渠道,DeepSeek依靠低价和开放生态扩大使用规模,Kimi则通过开放权重扩大分发,同时以高价API承接更高价值需求。
这一系列变化表明,Token的绝对定价已越来越难直接代表商业价值。美国高端旗舰模型的溢价正在向下压,中国开放权重模型的价格优势开始向上收缩。最终,市场将重新定价Task本身,即每天有多少真实工作愿意持续运行在某个模型或模型组合上。











