9月3日晚间全球AI服务发生大范围宕机,风波未平,9月4日凌晨三点半OpenAI发布GPT-6 Astra,先向部分企业开放,9月5日便全量推送给付费用户。OpenAI总裁Greg Brockman以一句“欢迎来到AGI时代”为它开场。发布不到一周,早它一步登场的新模型就被抢去了风头。 先看成绩单。官方口径下,Astra在多个关键基准上大幅跃升:ARC-AGI-3从上一代的7.8%跳到99.9%,ExploitBench拿下满分,FrontierMath Tier4得到98分。需要说明的是,部分高分跑在OpenAI自建的评测框架上;第三方把框架剥掉后,ARC-AGI-3约为62.7%,仍是榜单第二名成绩的两倍。 与上一代旗舰相比,综合智能指数基本持平,真正的进步落在任务侧:Terminal-Bench 4.0得分57.9%,OSWorld 2.0达到72.6%,单任务平均耗时约40分钟,比上一代75分钟缩短近一半;AutomationBench从18.1%跃升到41.4%。“会刷题”与“能干活”之间的差距,这一代主要拉在后者。
文章图片 2
效率才是这轮发布最被低估的变化。多家第三方机构测出,Astra在Agent类任务上的Token消耗明显下降:最高档设置下比对手少用约65%的输出Token,Terminal-Bench的API成本估算较竞品低约六成。OpenAI的思路是让同样的算力装下更多有效推理,而不是单纯让模型“想得更久”。 省Token并非没有代价。外媒报道,Astra的训练动用了十万卡规模的GPU集群,是OpenAI迄今规模最大的一次训练;架构层面还传出采用循环深度技术的消息,让同一组网络层反复运行以加深计算。它省的是运行时的花销,押的是更大的训练投入与更深的架构设计。
文章图片 4
这会重构行业竞争的衡量口径。当单价不断走低、各家比拼推理效率,完成一个真实任务要消耗多少Token、花多少钱,开始比跑分更能说明问题。对企业来说,单任务成本下降意味着同样的预算能支撑更多真实请求,AI从演示走向生产的门槛随之降低。
文章图片 6
而当单任务Token被真正压下来,企业关心的不再是买不买得起一次调用,而是能否看清每一次调用、把省下的预算调度到更多生产任务。把“省下的Token”变成可计量、可编排的算力产出,正是星战科技在大模型API广场与GPU算力平台上坚持透明计量与算力调度的原因。