苹果前不久发布的新 Mac,刷新了“AI 电脑”的性能预期:Mac mini 被定义为全天候跑 Agent 的生产力工具,Mac Studio 最高支持 512GB 统一内存。但真正“强”的地方藏在过去大家不太关心的参数里——内存带宽。标准版 M6 来到 170GB/s,M5 Pro 推到 307GB/s,顶配 M5 Ultra 直接跨过 TB 级大关。 无独有偶,就在新 Mac Studio 发布前一天,小米公布的端侧 AI 加速芯片玄戒 O100,同样把内存带宽做到了 1.22TB/s;英伟达最新的消费级旗舰 RTX 5090,凭借 32GB GDDR7 显存,带宽接近 1.8TB/s。桌面 SoC、端侧 NPU 与独立 GPU 的架构路径大相径庭,却都在做同一件事:让内存里的数据跑得更快。
文章图片 2
原因并不复杂:今天的 AI 越来越能算,也越来越容易被内存“饿着”。大模型一旦跑起来,最消耗资源的往往不是计算,而是“搬数据”。自回归生成的 Decode 阶段,计算单元每生成一个新 token,都要把内存里几十亿、上百亿的参数权重完整读取一遍,计算单元再能算,大部分时间也在等内存喂饭,这种状态在体系结构里叫 memory-bound(内存受限)。 容量与带宽是两码事:容量决定电脑能装下多大的模型,带宽决定这些数据每秒能以多快的速度喂给计算核心。过去大家习惯“大就是好”,但模型上了几十 B、几百 B 之后,带宽不足带来的吞吐瓶颈越来越明显。这正是苹果、小米、英伟达集体死磕带宽的根本原因——它们都在为大模型时代重新定义电脑。
文章图片 4
内存带宽竞赛的背后,是端侧 AI 与大模型部署模式的变化。当 Agent 需要在本地持续感知、持续运行,端侧算力与内存带宽就成了体验的关键。对企业和开发者来说,这意味着端侧 AI 实训与部署要考虑的不只是模型大小,还有带宽与功耗的平衡——把合适的模型放到合适的算力上,而不是一味求大。星战科技强调的端云协同算力供给,正是希望在本地带宽有限的情况下,让企业能在端侧与云端算力之间灵活切换,缓解单点硬件的内存压力。 更快的内存也更贵,供应链上的连锁反应已经显现:内存颗粒、HBM 的涨价与产能争夺,正在推高整机成本。对普通用户而言,AI 电脑的性能门槛在上升;对厂商而言,谁能把带宽、价格与生态平衡好,谁就能在端侧 AI 市场占得先机。这场“内存墙”攻坚战,将深刻影响未来两年 AI 硬件的竞争格局。
文章图片 6
算力一路狂奔,内存掉队已经成为 AI 硬件最大的结构性问题。当内存带宽成为新的性能标尺,“死磕内存墙”就不只是厂商的营销话术,而是整个端侧 AI 时代必须跨越的门槛。