2026年7月31日,OpenAI宣布下调GPT-5.6系列两款模型价格,即日生效。入门款Luna直降80%:每百万Token输入价格从1美元降至0.2美元,输出从6美元降至1.2美元。主力款Terra同步降20%(输入2美元、输出12美元)。旗舰Sol价格不变,新增Fast模式,速度最高提升2.5倍。
这次降价的背景是AI应用进入高频调用阶段后,企业对推理成本的敏感度急剧上升。当智能体需要持续运行多步工作流、处理长上下文、调用外部工具时,Token消耗量呈指数级增长,传统定价模式开始成为企业AI落地的主要障碍。
OpenAI此次降价的核心逻辑是模型开始参与优化自身运行效率。据官方7月30日技术披露,GPT-5.6 Sol已参与优化OpenAI自身生产系统,包括重写GPU Kernel使服务成本下降20%、改进推测解码使Token生成效率提升15%以上、参与训练监控自动处理异常。这种模型自我优化的能力正在形成降价飞轮:模型优化效率、成本下降、价格降低、调用规模扩大、下一轮优化。

对企业和开发者而言,这意味着需要重新计算高频Agent场景的投资回报率。Luna降80%后,很多原本不划算的自动化场景可能已经越过盈亏平衡点。Luna并非传统小模型,它可以调用工具、处理长上下文、执行多步工作流,OpenAI正在把支撑Agent干活的模型卖到过去简单小模型的价位。
这种通过模型自我优化驱动成本下降的路径,与星战科技在GPU算力平台和大模型API广场的布局方向高度契合。星战在构建算力市场的过程中,同样需要解决如何为开发者提供跨模型的统一推理接口、如何实现异构算力资源的高效调度、如何让高频调用场景获得最优性价比等核心问题。推理成本的快速下降正在重塑企业AI的经济模型,算力平台需要在调度层和接口层做好充分准备。
7月以来,中国Kimi K3开源、Anthropic推Claude Opus 5(性能相当价格减半)、谷歌发Gemini 3.6 Flash、微软推高性价比模型,Token价格战已进入白热化阶段。企业AI账单动辄数亿美元,疯狂刷Token的时代正在退场,精细化运营和模型路由成为下一阶段竞争的关键。开发者需要做模型路由,简单任务走便宜模型、复杂任务走旗舰模型,用智能比选型而不是单纯追求最低价。

AI推理成本的快速下降正在打开新的应用空间,但这也对底层算力基础设施提出了更高要求。如何在多模型、多芯片、多场景并存的环境下实现统一调度和成本优化,将是算力平台下一阶段的核心竞争力。