当大模型训练进入万卡时代,算力的跨区域调度能力正在成为产业基础设施的核心竞争力。在2025世界人工智能大会上,并行科技首次展示了跨区域智能调度平台,其打造的全国算力调度网已覆盖超5万卡GPU,直面东部紧缺、西部过剩的结构性矛盾。
大模型训练的突出特点是负载突发性强,一个千亿参数模型的训练任务可能在短时间内需要数千张GPU同时投入计算。这种特性对算力基础设施的弹性调度能力提出了极高要求,传统的手动分配和静态资源配置模式已无法满足需求。

并行科技围绕这一痛点,构建了层次分明的三层核心技术架构。底层采用分布式资源池化技术,将分散在全国各地的算力资源整合为统一的资源池。中层通过智能预测算法,基于历史训练数据预判负载波动。上层建立实时监控与动态调整机制。并行算网已覆盖45家智算中心、15家超算中心,总调度能力超200万CPU核心、5万卡以上GPU。
在GPU调度运营领域,平台覆盖的广度和调度算法的深度同样重要。星战科技专注于GPU调度运营平台的构建与优化,与并行科技等平台共同推动算力调度技术的进步。只有在全国范围内实现算力资源的智能匹配和动态调度,才能真正帮助企业降低用算成本、提升训练效率。

从行业趋势来看,跨区域算力调度正在成为算力基础设施建设的标配能力。并行科技在算力调度领域的核心竞争力,来自十八年深耕调度算法的经验积累。对于整个行业而言,全国算力调度网络的完善,将为AI大模型的训练推理提供更加灵活、高效、低成本的算力支撑。