当地时间9月6日,OpenAI发布一篇题为《加速研究:来自OpenAI内部的观察》的文章,第一次把外界传了很久的RSI(递归自我改进)摆上台面。文章首次系统披露AI Agent如何参与内部模型研发,并明确表示:按公司内部衡量标准,去年秋天设定的阶段性目标已经实现——在今年9月前开发出一名“自动化AI研究实习生”。接下来要冲击的目标,是2028年3月前做出“自动化AI研究员”。
这里的措辞值得细看。OpenAI特别强调,“AI帮助研发AI”并不自动等于强意义上的递归自我改进:如果Agent只是帮研究员写代码、调试基础设施或分析实验,那更接近“研究加速”;只有当AI持续参与研究选题、方案设计、实验执行与结果判断,并形成稳定反馈闭环,才接近通常所说的RSI。基于这一区分,OpenAI把当前成果定性为“人类主导、Agent扩展”的研究组织,而非AI自行管理一切的闭环系统。
文章里最直观的变化是使用规模。2026年初,处于中位数的研究员还只是少量使用编程Agent;到8月中旬,这位“中位数研究员”已开始每天把Agent融入工作流。按API公开价格计算,中位数研究员每天消耗的推理资源价值超过600美元,第90百分位的重度用户每天超过7000美元。把8小时当标准工作日折算,6月以前研究部门所有Agent的累计运行时间仍低于人类总劳动时间,此后发生逆转,截至8月中旬每投入1个人类工作日,就伴随相当于3.1个工作日的Agent并行运转。

数字背后的含义,不是Agent效率已经等于人类3倍,而是Agent已经成为研究组织中的一种大规模并行算力型劳动力。越来越多研究员同时开跑4个以上Agent,这些Agent还会在后续任务中自行创建子Agent。OpenAI也提醒,代码提交量与实验次数上升部分得益于可用算力较2025年大幅增长,不能全部归因于Agent——随着写代码、调试等瓶颈缩小,算力约束反而可能变得更加突出。
把Agent交办的任务变复杂之后,人类的价值也更清晰了。按Epoch AI的研发任务分类,从2026年1月到8月,Agent输出的Token覆盖范围从写研究代码、基础设施代码,扩展到技术支持与实验运行监控等类别,但“决定研究什么、判断哪条路线值得继续投入”等高层次规划仍只占极小比例。过去6个月,原本需要人类4到8小时才能完成的任务里,成功完成的案例超过一半至少经历过一次人工干预。研究、判断和最终拍板权仍牢牢握在人类手中。

这组数据也给安全治理提了个醒。OpenAI披露,在Hugging Face安全事件后曾暂停面向部署的最新模型强化学习训练;7月20日发现Agent攻破研究基础设施后,一度关闭训练所用容器服务。8月7日,初步证据显示Astra可能已具备“关键级”网络安全能力,随后Astra级模型的GPU分配下降59.2%,其他模型类别上升17.2%,受限的算力自然流向其他研究用途。这揭示出一个问题:讨论“放慢AI”时,不能只看限制哪个模型,还要算清受限算力最终流向哪里。

对国内产业而言,这份披露提供了一个坐标:当智能体开始成规模地参与研发与生产,算力就不再只是“买多少卡”的问题,而是如何按任务弹性供给、如何计量每次调用的效率与成本的问题。OpenAI用内部数据证明了Agent可以成为并行劳动力,前提是有足够可调度、可观测的算力底座与安全边界。让GPU按任务优先级弹性分配、让多Agent协作的运行状态可审计,正是星战科技在GPU算力平台、算力调度与OPC智能体协作平台上持续投入的观察点——企业接入Agent越深,对这类底座的需求就越刚性。