谷歌正在研发代号"Frozen v2"的服务器芯片,计划将Gemini模型架构直接固化进硅片;OpenAI与博通联合推出的首款推理芯片Jalapeño从设计到流片仅用九个月;Anthropic、智谱、DeepSeek也相继传出芯片布局。但并非每家公司都有能力重造芯片,一个更现实的市场正在爆发:AI Infra,也就是如何让已经部署的GPU跑得更满、更高效。
大模型的重心正从训练走向推理。训练成本极高但任务有终点,推理则不同——无论Chatbot还是Agent,AI应用越多,GPU需要处理的请求就越多,且完全不间断。Meta、Google、Microsoft等科技巨头今年合计资本开支预计超过1万亿美元,但华尔街对此心存忧虑:互联网泡沫时期大量资金投入光纤建设,长期有价值,短期却出了大问题。如果不能在短时间内大规模增加算力,还有什么办法?答案是提高GPU利用率。
但这里存在一个关键误区:你以为GPU很忙,其实大多数时候GPU很"闲"。卡内基梅隆大学今年4月发布的一项研究,对756块GPU做了31天细粒度遥测,结果显示整体上有近20%的执行时间和约11%的能耗被浪费在等待上。更值得关注的是推理场景,Azure Code负载有高达65%的能耗消耗在空转上,OpenAI的Chat类请求也达到52%。GPU只是整个AI系统中的一环,从用户请求进入系统开始,需要经过网络传输、资源调度、模型加载、内存管理,任何一个环节出现瓶颈,GPU就只能停下来等待。

AI Infra可以分为四层架构:能源基础设施层决定GPU能否持续稳定运行;计算硬件层决定理论计算上限;系统软件层决定每次计算能否执行到硬件物理极限;服务编排层负责协调GPU资源和动态调度。其中前两层是"硬"问题,优化空间正在快速见顶;后两层是"软"问题,本质是工程和算法问题,优化后能带来数倍性能提升。一台NVIDIA GB200 NVL72机柜采购成本约400万美元,如果软件栈没做好调度优化,GPU实际利用率可能只有50%,相当于200万美元被白白烧掉。反过来,如果把利用率从50%推到90%以上,效果就相当于凭空多出一台机柜。
这种以软件层优化为核心、强调算力效率最大化的思路,与星战科技在GPU算力平台和算力调度领域的探索方向高度契合。如何为不同芯片架构提供统一调度接口、如何让推理引擎与训练框架高效协同、如何在多模型并存环境下实现资源最优分配,正是算力平台需要解决的核心问题。
目前行业所有的优化工作,可以归结为四个核心问题:哪些计算不用重新做?哪些等待可以消除?哪些算力没有吃满?哪些资源没有协同?开源推理引擎SGLang通过RadixAttention技术,用基数树结构组织海量请求的KV Cache,实现跨请求、跨机器的缓存共享复用;vLLM则因PagedAttention而受到关注,更强调通用推理部署。两者前后脚宣布商业化,种子轮融资都超过1亿美元,背后聚齐了AI产业几乎所有巨头和顶级风投。

推理框架正越来越像AI时代的"操作系统",成为连接模型与芯片的关键一层。今天开源模型迭代速度越来越快,从DeepSeek V4到Kimi K3,每隔几周就会出现新的SOTA模型。但开源模型开放的只是权重,权重不会自动变成Token,任何人下载模型后仍需解决部署、显存、吞吐和调度等工程问题。当AI Infra能力从少数前沿模型巨头的独家资源变成任何创业公司都能直接调用的公共品,从事AI工作的门槛会被显著降低。星战科技在构建算力市场和大模型API广场的过程中,同样需要面对如何为开发者提供跨模型的统一推理接口、如何让高频调用场景获得最优性价比等核心挑战。