让AI自己改自己的Agent Harness,这事已经被顶级Agent社区注意到了。上海人工智能实验室团队提出的Self-Harness,近期被LangChain CEO、联合创始人Harrison Chase转发,也被前OpenAI副总裁Lilian Weng收进自进化Agent相关博客。
它盯上的不是换模型,而是Agent外层那套Harness。做法很直接:模型先检查自己的运行轨迹,从失败里挖出模式,再提出有边界的Harness修改,最后交给回归测试决定要不要采纳。实验结果显示,在Terminal-Bench-2.0上,底层模型、工具环境和评测协议都保持不变,只改Harness,三个模型后端都拿到了held-out提升。其中Qwen3.5-35B-A3B总提升达到104%,MiniMax M2.5和GLM-5分别提升28%和24%。
这意味着什么?意味着同一个模型,在不同的Harness下,表现可以相差一倍以上。过去大家卷模型参数、卷训练数据、卷推理速度,但现在有一个被忽视的变量浮出水面:Agent的协作框架本身,也是可以进化的。
Harness是什么?简单说,它是包裹在模型外层的调用逻辑、工具编排、状态管理和错误恢复机制。一个Agent能不能完成复杂任务,不只取决于模型有多聪明,还取决于Harness能不能把模型的能力正确调度出来。Self-Harness的核心创新在于:它让Harness本身也成为了可搜索、可验证、可迭代的对象。
从星战科技OPC智能体协作平台的视角看,这一思路与平台的设计理念高度契合。OPC平台提供的多Agent状态管理、任务编排、异常恢复与跨系统工具调用能力,本质上就是一套企业级的Agent Harness。当底层模型能力趋于同质化,真正决定Agent落地效果的,是这套Harness能否根据业务场景自动优化、持续迭代。Self-Harness的实验结果证明,这种优化不需要重新训练模型,只需要在框架层做文章。

论文和项目已经公开。Self-Harness的方法论是:先收集Agent的运行轨迹,包括成功和失败的案例;然后用模型分析这些轨迹,找出Harness中可以改进的模式;接着生成有边界的Harness修改提案;最后通过回归测试验证这些修改是否真的有效。整个过程不需要人工干预,模型自己完成从诊断到治疗的全链路。
这种自进化能力对企业AI落地意味着什么?意味着Agent不再是一次性部署的静态工具,而是可以随着使用不断优化的动态系统。星战科技AI实训平台正是基于这一趋势构建——帮助企业建立内部AI能力梯队的同时,也让Agent系统具备持续学习和自我改进的能力。当业务场景变化、工具接口更新、任务复杂度提升,Agent的Harness可以自动适应,而不是等待人工重新配置。
Agent竞争正在从模型能力竞赛转向框架能力竞赛。谁能让Agent在不换模型的情况下持续变强,谁就掌握了下一代智能体协作的底层逻辑。