想用AI却不敢用AI的公司,正在成为大模型落地的新群体。医药、金融、工业制造等行业面对三层困境:云端接口一波动,跑在API上的智能体任务就可能中断重来;鼓励团队多用AI,Token账单却烧得飞快;更关键的是隐私、安全与合规,让它们无法把敏感数据交给在线模型与云端API。
解法的关键词是“本地”。近日,来自北京大学的元空智能与惠普合作,把开源大模型、Agent框架与面向办公、金融、科研场景的专有知识一起装进本地设备。模型与框架来自元空——多款Boxer开源模型分稠密与稀疏激活版本,上层是元空AI Work与元空AI Science两款Agent产品;底层算力来自惠普的常规笔记本、基于GB10架构的桌上算力盒与工作站。
演示场景足够具体:在一台惠普ZGX Nano上断网运行,元空AI Work调用本地模型,几分钟内自动扫描53张发票并完成解析、分类与归档,生成本地报表;另一台设备离线穿透含数千条目的银行流水,识别出资金快进快出的洗钱特征。关闭Wi-Fi,业务照常跑。

元空的参数选择也很务实。团队判断3B以下只能做聊天机器人、千亿级又过于笨重,于是主攻20B到100B的“生产力甜区”,已发布27B稠密模型与35B-A3B稀疏模型,在本地能做到数百token每秒的预填充速度与百毫秒级延迟,支持断网运行、检查点无损恢复与长期记忆。
成本账是另一张王牌。企业上云的支出是持续订阅,本地方案则是一次性资本开支:估算百人规模、重度调用海外旗舰闭源API的团队,每月云端开销可达数十万元、一年上百万元;一台基于GB10的ZGX Nano工作站跑一两个月省下的API费,就能抵消设备采购成本。惠普方面还点出云端的隐性代价——know-how被“反向蒸馏”的风险。

更深层的判断关于大模型产业本身。行业普遍认为预训练Scaling的边际回报在递减,真正的增量在后训练与强化学习,落地场景则在物理设备。元空AI Science正脱胎于北大科学智能学院,试图用统一的抽象协议层接入机械臂、检测仪器等真实实验设备,把干实验与湿实验的闭环打通。

一旦模型部署到真实设备与本地节点,云、边、端之间的算力分布就变得动态起来:重训练在云端,实时推理靠近业务,敏感数据留在本地。如何让异构算力按场景各归其位、统一调度计量,成为平台层的课题,也是星战科技在GPU算力平台与算力调度方向上持续投入的方向。