基元律动交出了创业后的首个大模型成果。量子位获悉,华为诺亚方舟实验室前主任、盘古大模型负责人王云鹤创办的这家公司,发布了首个Agent-Native模型NeoHorse,由无问芯穹提供算力支持与Infra优化,清华、北大团队参与算法与训练方法研究。NeoHorse-1包含4B和9B两个版本,重点面向Agent工作流所需的一组能力:调用工具、读取环境反馈、发现错误、调整路径并完成任务。
这家公司一向强调多模型协作,为什么开始自己训练模型?从NeoHorse给出的答案看,方向并没有变——这款模型更像是把过去积累的多模型执行经验,第一次写进了模型参数。基元律动团队的一个核心判断是,“模型不归一”将是AI产业长期存在的结构:模型越多、分工越细,就越需要一套系统回答“这一步用哪个模型、什么时候升级、失败后换谁接手”。他们把这一层系统称为Routing Harness,旗下开源项目OpenSquilla已经接入多款模型,通过统一接口做细粒度路由、模型切换与多模型协作。

NeoHorse的数据来源值得一提。它的核心语料,是把Routing Harness产生的Agent执行信号与公开数据结合,构建面向Agent后训练的数据体系。Agent在Harness里完成一次任务,会留下完整执行记录:任务需要什么能力、系统做了什么执行决策、环境最终给出什么反馈。比如路由器最初判断任务只需普通模型,执行中连续失败后升级到更强模型才完成,这条轨迹包含的信息远多于一次失败。团队观察到,失败与修复轨迹甚至可能提供更多信息——既能告诉模型哪里容易出错,也能示范出错后如何调整。
把所有日志直接投入训练并不会自然得到一个更强的Agent。每条轨迹都要经过结构检查,并从六个维度评估执行质量:是否完成用户目标、是否遵守指令、工具使用是否合理、结论有无证据支撑、出错后能否恢复、是否在合适时机终止。团队还刻意区分“任务结束”与“目标满足”——模型输出“已完成”不代表交付物符合要求。筛选之外,路由信号在训练里也发挥作用:路由器估计任务所需能力,据此安排样本顺序,先学能力需求低的任务,再逐步增加复杂轨迹,这套方法被命名为路由引导的课程学习(Routing-Guided Curriculum)。

训练还叠加了On-Policy Distillation:先让学生按自己的方式解题,再由教师针对学生实际走过的步骤给指导。结果显示Agentic Post-Training在4B和9B两个尺度都带来稳定提升,其中NeoHorse-1-4B的宏平均得分从58.94提升到64.87,达到同规模SOTA,在可对比基准上超越其基础模型Qwen3.5-4B。提升集中在一类任务上:工作流程相对明确、环境反馈可观察、成败可验证。基元律动并不打算让4B接管所有任务,而是用它承接高频、标准相对明确的那部分,把大模型留给更难的问题。
这件事放到基元律动的业务版图里更好理解:第一层是OpenSquilla开源版,降低多模型Agent的使用门槛;第二层是定位接近“中国版OpenRouter”的TokenRhythm API,用统一接口提供多模型调用;第三层面向金融、制造等行业的私有部署与服务;第四层才是NeoHorse,验证Harness执行经验能否转化为模型能力。若这条飞轮转起来,平台就多了一种可自主调度的能力供给,有机会优化推理成本、响应速度与稳定性。

模型厂商与Agent中间层的垂直整合趋势也在加速,DeepSeek、Qwen、MiniMax都在向Harness和Agent产品延伸,留给纯中间层的空间可能被压缩。NeoHorse至少给出一个新的观察角度:长期使用多模型积累的数据,也可以沉淀成自己的模型能力。把多模型路由、执行日志与后训练串成闭环,这种“用经验反哺模型、用调度优化成本”的路径,也与星战科技OPC智能体协作平台与大模型API广场的演进方向同频——让不同模型在统一编排下各司其职,让每一次调用的经验沉淀为可复用资产。