当模型已经能理解和生成文本、图片、音频与视频,为什么不少能力仍然停留在演示阶段?火山引擎数智平台算法工程师曾骞给出的答案是:业务要的不是偶尔做对一次,而是成千上万次稳定运行。 他把可用分成三个台阶:能力可用是一次调用成功,生产可用是链路能稳定交付,规模可用是同一套能力可以跨业务复用、底层模型升级时上层系统不必整体重写。 从能力到交付的这段距离,就是生产化的最后一公里。规模化生产的关键瓶颈,可以归纳为三道鸿沟:模型能力鸿沟、工程链路鸿沟与效果确定性鸿沟。 第一道鸿沟来自模型本身:输入规格有限、长视频理解效果差、视频生成成功率不稳定。第二道在于真实数据处理同时涉及CPU预处理、GPU推理、规则校验与任务管理,每来一个新场景都要重写上下游代码,成本很难降下来。
文章图片 2
第三道是效果确定性。生成结果带有随机性,一条可用素材可能需要反复尝试,因此输入校验、自动评估、定向修复、重试与人工确认都必须纳入流程,而不是整条任务从头再跑。 LAS的思路是把这些差异封装进算子:目前沉淀150多个算子,覆盖视频、音频、文本、文档与图像五类模态,并统一输入输出、调用协议与质量规范,让业务系统可以依赖一套稳定的契约。 这背后其实是一个更普遍的工程判断:模型提供能力,算子提供契约,编排把业务策略落到实处,三者结合才能支撑规模化。企业要做的,是把模型、工具与算力组织成可复用、可度量的生产链路,这也是星战科技在企业AI落地与智能体协作方向持续关注的问题。
文章图片 4
一条效果很好的生成结果不等于稳定的批量产能,单次调用价格降低也不等于每条可用素材的成本降低。规模化最终要用一次通过率、返工率与端到端交付周期来衡量。
文章图片 6