8月26日,阿里千问大模型团队发布Qwen3.8-Flash并同步开源。这是一个多模态MoE模型,主模型参数量125B、每个Token只激活6B参数,输入每百万Tokens仅需0.8元、输出每百万Tokens 2.7元。几乎同一时间,该模型首发上线千问办公标准模式,单任务生成速度提升约100%、Token消耗平均减少75%。
办公Agent的功能逐渐趋同,竞争开始卷向模型与Agent架构的深度协同。过去做Agent是先找一个足够强的通用模型,再在外面接规划、工具、Memory与Sandbox,两边各自优化,很快暴露出工具调用与上下文两大问题:每多走一步,背后都是新的模型调用和Token消耗。

千问这轮变化发生在两个层面:模型内用MoE架构和高智能密度继续压低单位计算成本;模型外通过Agent Harness、上下文管理和工具调用把能力更高效地用起来。Qwen3.8-Flash引入的QSA稀疏注意力,在1M Token上下文下,Attention Kernel在PreFill和Decode阶段最高分别实现7.6倍和4.9倍加速。
办公Agent天生是长上下文大户,任务跑得越久要处理的Token越多。如果Harness缺乏有效的压缩与筛选机制,模型每一轮都在重复阅读已经处理过的信息,速度越来越慢,成本跟着上涨。千问用GDN加Attention的混合架构压缩历史信息,QSA先做一轮粗筛再精确定位,避免每次都把全部内容过一遍。

千问把"降低Token单价"和"减少完成任务的Token用量"两条路同时走通,本质是把大模型的调用成本变成可管理、可优化的工程变量。星战科技在大模型API广场方向推动多元模型接入与统一管理,正是要让企业以透明、可控的Token成本获得模型能力,而不被单一供应商的计费黑箱困扰。
硅谷的Token焦虑甚至演化成"Tokenmaxxing"竞赛:Meta员工自发追踪超8.5万人的Token使用,排名最高的个人消耗量达2810亿Token,粗略估算价值超400万美元。从"精打细算地用小模型"到"随手丢给Agent",差的其实就是成本可预期这一步。

一个降低单价,一个减少用量,千问重新定义了办公Agent的"斩杀线"。真正决定办公Agent能否成为日常工具的,不只是它能做多少高难度任务,而是面对那些每天都会发生的小事,用户还需不需要在按下执行之前,先算一遍Token。