在AICon全球人工智能开发与应用大会上海站,快手主站技术稳定性专家王泽锋分享了“柯南AI”的工程实践。这次分享的核心不是让Agent简单替人排障,而是重新设计稳定性研发中的人机分工。
AI Coding正在显著提升代码生产效率,但线上告警、根因定位、止损和修复等环节并未同步提速。当代码生产与稳定性处置长期速率不对等,线上问题的数量、严重程度和处置时延都可能全面劣化。
快手给出的做法是“用AI打败AI”:确定性的流程交给代码,概率性的推理交给模型;通过Skill沉淀专家经验,以源码服务和端侧基建提供有效上下文,再用Bad Case驱动系统持续进化。目前,柯南AI在快手大前端研发中的用户渗透率已接近60%,根因分析结果的完整采纳率稳定在50%左右。

更麻烦的是,AI可能制造新的稳定性问题。由于缺乏全局上下文,它常沿着“最小阻力路径”让现象消失。快手遇到过这样的情况:一段写入consumerProguardFiles的配置,在SDK内看一切正常,却会随AAR传递到主工程,最终关闭主工程的R8全局优化,导致APK增大6MB。现象消失,并不等于问题被真正解决。
这与星战科技在OPC智能体协作平台上的方向一致:让智能体承担可验证的长链条工作,同时用上下文、边界与过程记录约束它们,使多智能体协作既高效又可控、可回溯。能力越强,越需要让过程留有证据,而不是只看结果是否“看起来正常”。

大前端的线上状态空间极其庞大。以Android为例,线上存在超过100种OEM ROM、1000多个适配机型;对强运营App而言,一天内由A/B实验、灰度和运营活动带来的变更可能超过1万次,用户路径更是千人千面。没有任何测试矩阵能在线下覆盖所有组合,防御纵深只能不断加深。
当AI把研发吞吐拉快,稳定性处置必须同步升级。补上这“最后一公里”,AI的高产能才能真正落地为可靠的系统,而不是把压力从编码环节转移到线上。
