从 V4-Pro 到 Harness DeepSeek 正在补上智能体落地的工程一环
- +1 你赞过了
8月13日,DeepSeek 发布 V4-Pro 正式版,并将其同步更新至 APP、网页端和 API。对普通用户而言,网页端和 APP 的专家模式提供了新版本入口;对开发者而言,API 模型名保持为 deepseek-v4-pro,既有接入无需因版本升级改动模型标识。看似一次常规的模型迭代,实际上却释放了一个更清晰的信号:大模型竞争已不再只围绕参数、上下文和榜单展开,而是开始延伸到模型如何调用工具、如何管理任务、如何在真实环境中持续工作。
根据 DeepSeek API 文档,V4-Pro-0813 支持 100 万 Token 上下文、最大 38.4 万 Token 输出,并提供思考与非思考模式切换;JSON Output、Tool Calls、Responses API、Anthropic API 等能力也被纳入支持范围。与此同时,DeepSeek 为 V4-Pro 和 V4-Flash 提供 low、high、max 三档思考强度,并原生支持 OpenAI Responses API、适配 Codex。对于需要处理代码仓库、长文档、工具调用和多步骤工作流的开发者来说,这些改动的价值并不只是功能清单变长,而是让模型更容易被嵌入既有的开发与业务流程。
更值得关注的是,V4-Pro 的能力叙事并非孤立存在。DeepSeek 在发布页中明确提示,其公开基准中的 Code Agent 任务使用了 DeepSeek Harness 极简模式作为测试框架,并采用特定思考档位与采样参数。这个细节意味着,相关成绩反映的是模型、推理配置与执行环境共同组成的系统表现,而非可以脱离工具和流程单独衡量的裸模型能力。
同日上线的 DeepSeek Harness,正是这一变化的注脚。DeepSeek Harness v0.1 已以开发者预览形式开放源代码,并采用 MIT 许可证。它不是一个新的聊天模型,而是一套面向智能体运行的开源执行框架。DeepSeek 用 Agent = Model + Harness 概括其逻辑:模型负责生成与推理,Harness 则让模型能够理解工作环境、调用工具、保持任务状态,并在多轮执行中持续推进。
从产品设计看,Harness 的关键词是 Everything is a plugin。模型、工具、技能、会话、沙箱、存储、执行循环、调度和用户界面,都可以被作为插件选择、替换或重组。其 Standard 模式覆盖文件编辑、Shell、文件与网页搜索、规划、子智能体与工作流;Code 模式允许模型通过代码编排多轮工具调用;Minimal 模式则以更简化的工具集服务于基准测试;Creator 模式面向自定义运行预设和插件实验。换句话说,DeepSeek 试图提供的并非一个固定形态的智能体产品,而是一套能够由开发者按需组合的运行底座。
这一思路切中了当下 Agent 落地的真实痛点。大模型在演示中完成一个任务并不难,难的是在复杂环境中持续、可靠且可控地完成任务。一个可以进入生产流程的智能体,除了模型本身的推理与生成能力,还需要解决文件访问、工具权限、上下文管理、任务调度、失败恢复和运行审计等问题。Harness 所提供的追加式会话日志与轨迹查看、恢复、分叉、搜索、回放等机制,正是在尝试补齐这些通常不在模型榜单中体现、却直接影响工程交付质量的环节。
当然,Harness 现阶段仍处于开发者预览,官方也提示核心插件和 API 将持续演进,兼容性变化在所难免。这决定了它更适合被视为面向开发者的开放实验场,对于团队用户而言,真正值得验证的并非它能否在一次演示中跑通任务,而是它在自身代码库、权限体系和交付流程中,能否保持稳定、可审计与可维护。
此次 V4-Pro 正式版上线,还带来了 API 峰谷定价安排。新价格将于北京时间8月17日0时起生效,高峰时段为9时至12时、14时至18时,其余为闲时,闲时单价为高峰单价的一半。需要看到的是,这一机制并不能被简单概括为降价或涨价,而更像一次面向资源调度的精细化调整。对开发者来说,实际成本仍取决于缓存命中率、输入输出 Token 结构、任务运行时段和思考强度选择。随着智能体任务变得更长、更频繁、更依赖工具调用,如何设计可预测的成本结构,也将成为模型能力之外的重要课题。
小结
V4-Pro 与 Harness 同日上线,真正值得讨论的并非某一个分数的高低,而是大模型产品正在完成从能力展示到工程交付的转换。模型负责回答问题,Harness 负责让模型把问题做完;前者决定智能上限,后者决定智能能否稳定地落在真实场景中。未来对一套 Agent 系统的评价,也应从单纯比较模型能力,逐步转向任务完成率、运行稳定性、权限安全、成本可控性与可复现性等更完整的维度。
对 DeepSeek而言,开放 V4-Pro 的 Agent 能力,并以开源方式推出 Harness,是向智能体基础设施迈出的一步。对整个行业而言,这也意味着新一轮竞争不只在模型层发生,更会在工具、框架、工作流与开发者生态中持续展开。谁能把模型能力转化为稳定、透明、可扩展的任务执行能力,谁才更有机会在下一阶段的智能体应用中形成真正的产品价值。
最新资讯
热门视频
新品评测
X
微博认证登录
QQ账号登录
微信账号登录