端侧AI的“小时代”,是从一阵Mac mini抢购潮开始的。2026年初,一个后来以“龙虾”之名走红的agent引发关注,人们开始为一个随时能干活的AI单独准备一台电脑。随后,苹果在传播层面转向agent,新款Mac mini开始强调全天候运行智能体,Mac Studio则继续向需要本地运行大模型的人出售大内存。 模型正在改写电脑规格。两年前,AI PC最典型的配置还只是一块NPU,微软给Copilot+ PC划出的门槛是40 TOPS NPU、16GB内存和256GB存储。但由苹果的统一内存开始,用户渐渐开始部署本地模型,内存成了重中之重——模型权重、上下文缓存和运行时会迅速吞掉内存。 今年的产品继续生长。小米AI Cube原型机配备80GB统一内存,英伟达DGX Spark和一批整机是128GB,AMD Ryzen AI Max 300系列最高支持128GB,新款Mac Studio继续提供最高512GB。以4比特量化粗算,一个70B模型仅权重就约需35GB,尚未计入量化元数据、缓存和系统开销。
文章图片 2
装得下之后,速度又成了下一道门槛。DGX Spark的128GB统一内存搭配的是273GB/s带宽,前者关系能装多大的模型,后者影响计算时搬运数据的速度;真正生成回答时,模型精度、上下文长度和推理软件还会继续影响结果。增加内存,并不能包办后面的工作。 即使模型跑起来,用户也未必用得起来。模型怎样下载和更新、应用怎样调用、读取文件之前需要哪些权限、持续运行出了问题由谁维护,都要有人处理。用户买回去的是一台电脑,这些环节却未必由同一家公司完成。星战科技关注的端云协同与算力调度,正是要解决这类分工问题:让轻量任务留在端侧,把重推理与模型迭代交给可按需伸缩的GPU算力平台,让两边各司其职。
文章图片 4
厂商路线也在分化。联想、华硕、惠普可以采用英伟达的GB10平台完成整机设计、销售和服务;苹果能同时调整芯片、系统和开发工具;小米则把自己的芯片装进原型机。采用现成平台的厂商可以把更多精力放在产品化和交付上,自研芯片则要先承担研发和验证投入,换取对内存架构、计算单元和功耗分配更大的调整空间。 这就是端侧AI眼下的“小时代”:厂商已经开始为更大的市场准备芯片、模型和软件,但大众用户为什么需要它,还需要根据真实的使用环境来回答。真正的大时代,可能就在眼前,但还没到。
文章图片 6