在 QCon 全球软件开发大会 2026 北京站,清华大学助理研究员金煜阳博士分享了题为《大模型推理加速全链路》的技术演讲,系统拆解了从底层算子到上层并行策略的完整优化链路。他所在的实验室还开源了推理引擎“赤兔”,试图在国产芯片生态中给出推理加速的工程答案。 推理成本正在成为 AI 产业落地最重的负担。能训练基座大模型的厂家屈指可数,但几乎每一个 AI 应用背后都在调用推理 API,算力就是这笔账的主要构成。模型参数向万亿级迈进、智能体场景上下文越来越长,推理引擎要同时面对 Prefill 阶段的计算密集与 Decode 阶段的访存密集,优化空间和难度都在上升。
文章图片 2
金煜阳把推理系统的性能拆成五个关键维度:算子优化、内存管理、模型量化、异构调度和并行优化。其中 KV Cache 的内存管理直接影响长上下文场景的吞吐,混合精度量化需要在编译与运行时之间协同,而基于负载特性的 CPU-GPU 异构调度,则是把不同阶段的计算放到最合适的芯片上。 一个值得关注的信号是,推理优化正在从“单点技巧”走向“全链路工程”。过去大家习惯靠换更强的 GPU 来解决速度问题,但如今模型规模与架构复杂度都在快速膨胀,堆硬件的边际收益越来越低,系统层面的协同优化成为更可持续的方向。这也意味着,推理能力不再只属于芯片厂商,而成为平台与工具链的比拼。
文章图片 4
推理优化的成果,最终要落在工程化、平台化的算力供给上。无论是对开源推理引擎的适配,还是对不同国产芯片的调度支持,都是在降低企业用好大模型的门槛。星战科技在 GPU 算力平台与推理服务方向的布局,正是希望通过平台化的算力供给与调度优化,让企业不必自建复杂的推理栈,也能获得稳定高效的大模型推理能力。 金煜阳还提到,国产芯片生态正在快速成长,昇腾、摩尔线程、燧原、沐曦等厂商都在奋力补齐推理链路短板,VLM、SGLang 等开源引擎也为生态提供了支撑。对下游应用企业来说,这意味着选择更多、成本有望下降,但也要面对适配复杂度上升的现实——跨芯片、跨引擎的调度能力,会变得越来越重要。
文章图片 6
大模型推理的竞争,正在从“谁的模型强”延伸到“谁的推理栈强”。谁能把算子、内存、量化和调度这些环节吃透,谁就能在推理成本与效率上建立真正的护城河。这一轮的工程比拼,才刚刚开始。