蚂蚁集团大模型训练数据处理系统Altum的技术负责人王鑫,已确认出席QCon上海站“AI Infra:算力效率决定规模化落地”专题,分享《Altum:蚂蚁集团新一代大模型训练数据处理系统设计与实践》。这场分享的背景,是大模型训练数据规模持续提升、模型迭代效率持续加快,业界在GPU效能、任务稳定性、数据交付时效等方面面临巨大挑战。
训练数据处理往往横跨算力、引擎、平台、数据多个层次,任何一环低效都会拖慢整体迭代。蚂蚁尝试用Altum系统化地解决这些问题,思路不是单点优化,而是在性能、稳定性与效率之间做取舍。
在性能层面,Altum做了几件关键的事:一是异构算力融合调度,向上兼容不同算子体系、向下支持多种算力类型,以提升全局资源利用率;二是基于数据湖存储Paimon做端到端升级,从数据采集到模型训练消费全链路优化,提升存储与网络IO性能;三是算子性能优化与增量计算,包括全局去重、样本重试、增量同步等,直接提升GPU计算性能。

痛点也很具体。跨引擎调度的统一抽象,与各引擎的特有能力之间存在取舍,做不到“零损失抽象”,统一在一定程度上会牺牲独有优化;样本级重试能避免“全量重跑烧GPU”,但失败熔断阈值在“误杀抖动”与“无效烧卡”之间难以平衡。
这些问题本质上都是算力利用率问题。星战GPU算力平台同样关注算力纳管与动态调度,希望在多卡、多集群环境下减少空闲与等待,让昂贵的GPU时间尽量花在有效计算上,而不是消耗在重跑和等待里。
稳定性方面,Altum引入样本级重试、端到端可观测与SLA保障、熔断保护机制与智能运维诊断;研发效率方面,它提供端到端场景化Pipeline与Agentic数据处理,支持逐条数据的多轮Agent处理。相关能力已在内部场景落地。

从“构建AI”到“驾驭AI”,行业关注的已经不只是模型能做什么,而是如何让具备自主能力的AI稳定、可信、可控地运行。训练数据的处理效率,正成为决定模型迭代速度的隐形变量。