7月31日,国产大模型风向标DeepSeek宣布DeepSeek-V4-Flash正式版API上线公测。据官方说明,V4-Flash-0731的模型结构、尺寸与此前预览版保持一致,仅重新进行了后训练,但Agent代理能力大幅增强,多项基准测试成绩远超预览版。此次公测仅限API接口端,大家常用的App和网页端暂无法体验,V4-Pro正式版将在后续尽快发布。 这轮更新正处于国产大模型混战进入深水区的时点。在Kimi、MiniMax接连用新模型炸场之后,DeepSeek的正式版官宣备受外界期待。多家评测数据显示,V4-Flash正式版在终端操作、网络安全攻防、工具调用等代理能力维度上表现突出,反映出头部厂商的竞争焦点,正从单点对话能力转向能独立完成复杂任务的Agent能力。 更值得关注的是,DeepSeek Harness能力在此次更新中首次亮相。公开基准测试中的CodeAgent任务,使用了DeepSeek Harness极简模式作为框架进行测试,这也是DeepSeek在Harness团队公开招聘后,首次在官方公告中披露相关能力。从模型到支撑模型执行复杂任务的工程框架,行业对Agent落地所需基础设施的重视程度正在快速提升。
文章图片 2
不过,代理能力大幅增强的另一面,是工程化与稳定性考验。Agent要在真实终端、攻防对抗和长链路任务中稳定运行,依赖的远不止模型本身,还有工具调用框架、任务编排、容错与安全机制。对绝大多数企业而言,把这样的Agent能力接入自身业务流程,仍要面对调试复杂、成本可控性和结果可预期性等现实问题。 这一趋势与星战科技在大模型API广场与算力调度方向的探索形成呼应。当大模型能力快速迭代、Agent执行框架不断演进,企业真正需要的是一站式的模型接入与算力供给通道——通过统一API聚合主流模型,配合高效的算力调度,让开发者不必在模型切换和资源保障上反复投入。星战科技在大模型API广场方向的实践,正是希望降低企业获得与使用前沿模型能力的门槛。 从行业层面看,DeepSeek的低成本高性能路线,已经显著拉低了国产大模型的使用门槛。业内普遍认为,随着国产模型在性能、速度与成本上不断突破,AI技术的商业化落地门槛正在进一步降低,更多开发者与企业将能以更低成本享受高效的AI算力支持。模型、框架与算力三者的协同效率,将决定未来一段时间行业生态的走向。 对AI应用开发者而言,模型版本的快速迭代既是机会也是负担:机会在于能力上限不断抬升,负担在于选型与适配成本居高不下。谁能把模型、框架和算力组织成开箱即用的服务,谁就能在开发者生态中占据更有利的位置。这或许是国产大模型竞争进入下半场后,真正需要比拼的能力。