在AICon全球人工智能开发与应用大会上,蚂蚁数字科技资深技术专家魏长征结合两个真实项目,分享了AI Coding进入Agent独立执行任务阶段后涌现的新问题:代码产出速度成倍提升,需求约束、Code Review与测试验收机制能否同步跟上。
从对话框提问,到IDE插件、AI IDE,再到Claude Code等终端工具,开发者角色正在变化——从代码的生产者,逐渐变成结果的评判者。交给AI的任务也从写几行代码,扩展到独立完成一项任务、由人来验收。
两个案例形成了对照。一个40多万行的Rust新项目从第一天就把Harness内建进研发流程,核心文档明确唯一事实源,每次变更同步提交变更文档并经过CI门禁;一个60多万行的C++存量项目则先让Agent扫描项目、订正事实、重建文档和质量门禁,再推进C++20升级。改造完成后的一个月,后者的代码缺陷率从20%以上降到了个位数。

核心矛盾是产能与验证的不对称。一个Agent可能一天完成过去三个月的代码量,原本分散在几个月里的需求模糊、目标漂移、事实冲突和质量欠账被集中放大。Reviewer面对一次四五千行的提交,人力很难逐行覆盖,Code Review很容易流于形式。
这与星战科技在OPC智能体协作平台上强调的方向一致:让多个模型、工具与智能体围绕同一目标协同工作,同时把约束、验证与验收做成可管理、可复用的流程,让智能体在明确边界内承接长链条任务。多智能体协作的价值,不在于各自产出更多,而在于产出可被验证、可被追溯。

文中还提到,模型行为会波动——一段时间倾向补全更多Case,另一段时间又倾向少做,这类变化未必能被Harness及时发现。从AI协作走向真正自治、稳定的开发体系,仍有不少路要走,也需要持续探索。
AI Coding提升的是代码生产速度,Harness要解决的是让验证速度与验收能力与之匹配。只有需求、开发、测试与交付形成完整闭环,AI的高产能才可能真正转化为稳定的软件工程效率。
