AI PC概念喊了两年,联想在柏林IFA 2026期间的Lenovo Innovation World 2026上,把“本地跑大模型”从演示台搬进了背包。最重要的产品是联想联合英伟达推出的Yoga Pro 9n(国内型号YOGA Pro 15 Spark)——一台可以本地运行千亿参数大模型的量产笔记本,重1.65千克、最薄16.7毫米,最高配备128GB统一内存。按英伟达对RTX Spark的规格说明,这套配置能在本地运行1200亿参数、最高支持100万token上下文的大语言模型。 传统PC里CPU内存与GPU显存相互独立,大模型参数要在两者之间反复搬运,显存容量直接决定能跑多大的模型。消费级独显的显存通常只有十几二十GB,模型稍大就装不下。RTX Spark的统一内存架构让CPU与GPU共享同一个物理内存池,最高128GB对两者同时可用,模型权重、输入数据与中间结果只需保存一份,千亿参数级模型因此得以在一台笔记本上落地。开发者仍可沿用CUDA技术栈,数据不必上传云端,后台还能协调多个AI智能体跨应用完成复杂创作任务。
文章图片 2
联想不是唯一押注统一内存的玩家。苹果刚更新的Mac mini和Mac Studio几乎把本地AI的性能上限再抬高了一截:Mac mini最高64GB统一内存并支持Thunderbolt组集群,Mac Studio的M5 Ultra版本最高支持512GB统一内存、每秒1.2TB带宽。今年6月WWDC上,苹果演示了4台Mac Studio通过Thunderbolt 5互联,基于MLX跑起万亿参数规模的开放权重模型Kimi K2.6,4机集群推理性能最高可达单机3倍。 把两家方向放在一起,能看到端侧AI的瓶颈已经从单纯的算力,转到“模型装不装得下、数据搬不搬得动”。苹果用统一内存加Thunderbolt集群铺开整条线,联想与英伟达则把同样的能力第一次带进Windows与CUDA生态,并用FP4精度和统一内存把本地上下文上限推到100万token量级。对已围绕CUDA开发AI应用的开发者来说,既有知识与经验可以沿用,这让Windows在争夺“个人Agent主机”时多了一份软件吸引力。
文章图片 4
笔记本之外,联想还在为Agent铺路。商用新品ThinkCentre X Ultra(国内型号X Tiny)在1.6升机身里塞进AMD锐龙AI Max+ PRO 495系列与最高128GB统一内存,最多四台设备可集群互联成一个统一计算平台,运行更大模型、更长上下文与多智能体工作流。一个部门可以先从一台用起,模型变大、业务增长时再逐台叠加——从“一人一台电脑”到“AI一台我一台”,办公桌正在变成最小的AI算力节点。 端侧算力崛起不意味着云端失去意义,反而让端云分工变得更清楚。本地统一内存擅长承接低延迟、高隐私、长上下文的交互型任务,而训练、超大模型推理与批量生成这类重负载仍属于云端。当模型厂商更有动力为端侧做蒸馏与量化,端侧设备成为Agent的常驻宿主,云端则负责把最重的计算弹性调度出去,两端需要的是同一套“按需供给、随用随取”的逻辑。
文章图片 6
对国内产业来说,端侧AI的进展打开了新的落地场景,也让算力供给走向两端分化。千亿模型能在一台笔记本上运行,意味着更多中小企业可以低成本尝试私有化部署与本地智能体,不必事事上云;但模型迭代、垂类微调与重推理任务,依然要依赖可弹性伸缩的云端GPU资源。端上做即时响应、云上做深度计算,让算力在两端之间被灵活调度,正是星战科技在GPU算力平台与算力调度方向上持续布局所对应的产业趋势。