GPT-6不只Astra。Astra发布没几天,GPT-6 Sol就被曝出正在内测,而且表现抢眼:据爆料网友Lentils的说法,Sol整体输出能力明显弱于刚发布的Astra,但速度更快,单次测试速度约为Astra的6倍,依然属于“怪物级”模型。有网友把同一个任务拿给不同模型测试——让模型生成一辆BMW M4 Competition的SVG图,GPT-6 Sol用Max档位零样本生成,耗时约3分钟、输出约2.8万Token,而GPT-6 Astra同样用Max档位输出约2.5万Token,耗时约19分钟。 另一个演示更直观。网友展示了一个名为“The Realm of Aurellune”的像素风沙盒世界原型,GPT-6 Sol一次性生成了城镇、农田、河流、城堡与缩略地图,还配上昼夜切换、放置地名、调整细节等控制面板,整体更像一款已搭好雏形的模拟经营游戏——这是zero-shot、Max推理档位、15分钟、总花费6万Token生成的效果。目前可以推测,Astra偏向最高难度的深度推理,Sol则偏向速度、吞吐量和规模化Agent调用。至于发布时间,有网友称可能落在9月29日的OpenAI开发者大会。
文章图片 2
在同一天,OpenAI还公开了一组内部研究数据:截至今年8月中旬,研究员每上8小时班,背后就有约3.1个Agent工作日并行运转;按API价格计算,中位数研究员每天消耗的Agent推理资源已超过600美元。OpenAI同时宣布实现“自动化AI研究实习生”目标——一个能干活的研发节点,在人类指导下能独立完成边界清晰的研究任务。英伟达CEO黄仁勋则高调祝贺,称Astra使用约10万套NVIDIA Grace Blackwell NVLink72训练,接下来还有40万套GPU上线。 当模型开始按“深度”与“速度”分工,产业侧的需求会跟着分化。深度推理型模型适合复杂规划与高难问题,但耗时与成本高昂;吞吐型模型单位时间能处理更多任务,更适合把大量重复性、流程化的工作交给Agent批量执行。前者是少数、昂贵、慎用;后者是海量、便宜、常态调用——两种能力对应的是两种完全不同的算力供给形态。
文章图片 4
这背后还连着模型安全与可控性的新课题。OpenAI首席科学家Jakub Pachocki同日发布万字长文,提出AI更像是在海量数据与算力里自己“长”出来的,人类越来越难通过思维链审查理解它的全部行为;在对抗性压力测试里,Astra甚至展现出压低测试成绩、绕开监控等倾向。这些都指向一个现实:模型越强、Agent工具越多、运行时间越长,越需要独立于模型的安全边界与治理机制。
文章图片 6
对国内AI产业来说,GPT-6家族的分工是一种参照:当模型按“深度”与“吞吐”分化,企业选型就不再是“哪个模型最强”的单点问题,而是“什么任务该用哪种档位、花多少算力”的系统问题。吞吐型模型支撑规模化Agent调用,意味着同一时间会有海量并发请求打向推理服务,峰值负载怎么扛、空闲算力怎么调度,直接决定服务成本与体验。 把模型档位分化、Agent并行调用与GPU扩容放到一起看,算力正在从“军备竞赛的规模”走向“调度的效率”。谁能让不同规格的模型在统一平台上按需供给,让高吞吐任务与深度推理任务共享同一套弹性GPU资源,谁就能把算力账单压下来。让模型调用按档位计量、让GPU按任务峰谷弹性伸缩,正是星战科技在GPU算力平台、算力调度与大模型API广场方向上持续投入的落点。