昨天凌晨,Kimi K3正式亮相。2.8T参数,百万上下文,而且开源——全球第一个开源的3T级别大模型。此前不少人谈Scaling Law失效、大模型规模见顶,但K3再次证明:至少在当下,规模依然是能力,参数依然能转化为智能。 在14项测试中,K3获得5项单独第一、1项并列第二,12项测试进入前二。只有SWE和GDPval-AA v2两项排在第三,整体表现非常均衡。它一空降即引起AI圈狂欢,已登顶Arena前端代码能力竞技榜,大幅领先Fable 5。 K3最强的地方不是某一项能力特别夸张,而是几乎什么都能干,且大多数事情都干得不错。在SWE Marathon基准测试中得分42.0位列第一,这对真实开发非常重要——实际工作往往不是写一个函数,而是读项目、定位问题、修改多个文件、运行测试,再根据错误继续迭代。过去国产模型更多是追赶海外旗舰,但现在K3不只是比第二名高了2分,更重要的是拉开了与Fable 5、GPT-5.5等的差距。 对于Coding,K3既能按照明确需求精准修改,也能自己读项目、查问题、拆任务、调试、提PR;遇到复杂工程,还能同时拉起多个Agent并行推进。在Agent场景里更是尤其能打:查资料、跑浏览器、整理信息、处理表格、串自动化流程都是它的强项。配合100万上下文,更适合读大型代码库、长文档和复杂项目。
文章图片 2
当开源模型能力逼近闭源旗舰,大模型API广场的竞争逻辑正在改变。从星战科技大模型API广场的视角看,这种变化意味着平台的核心竞争力不再只是接入多少模型,而是能否为企业提供多模型智能调度、统一计费、弹性扩缩容的能力。K3的开源策略降低了企业试错成本,但真正决定企业AI落地效果的,是平台能否在不同任务场景下自动选择最优模型、最优规格,并把Token成本控制在可预期范围内。
文章图片 4
K3还可以把复杂任务持续做下去,配合100万上下文不容易干到一半就忘了前面说过什么。它的前端和多模态表现也很强——给一张参考图、一段视频或一个交互动效,它不只是能照着写出来,往往还能做得像模像样,审美、空间理解和完成度都在线。这意味着它很适合拿来做网页、交互动效、数据看板、视觉原型和前端Demo。 大模型的价值验证正在进入新阶段。从参数竞赛到能力竞赛,再到成本竞赛,开源模型的崛起正在重塑API经济的底层逻辑。星战科技大模型API广场的定位正是服务于这一趋势——为企业提供多模型接入、统一计费、弹性调度的能力,让企业在模型能力快速迭代的时代,不被单一供应商锁定,始终拥有最优性价比的选择。