过去一年,AI 圈比的是模型谁更强;昨晚 DeepSeek 开源了 DeepSeek Harness(DSH)——第一次把手伸到「模型输出之后」的执行层。模型决定智能上限,Harness 决定实际表现,竞争的战场正在切换。

封面 · DeepSeek 开源 Harness:从模型层卷到执行层

🎯 核心判断

/ section
事件 8 月 13 日 DeepSeek 连发两件事:V4 Pro 正式版 + 开源 Agent Harness(DSH)开发者预览版
本质 DSH 不是新模型,而是把模型接入文件系统/终端/网页/工具/子 Agent 的执行框架——DeepSeek 自己的 Vibe Coding 入口
信号 模型竞赛打了一年多后,DeepSeek 把战场拉到了执行层:同一模型放进不同 Harness,表现可以肉眼可见地不同

🔍 事件还原:两天,两块拼图

/ section

8 月 13 日早些时候,DeepSeek-V4-Pro 正式上线 App/Web/API(模型号 DeepSeek-V4-Pro-0813):1M Token 上下文、最高 384K Token 输出,官方重点强调 Agent 能力——Terminal Bench 2.1 达 87.9,DeepSWE 62.7,Toolathlon-Verified 74.1,DSBench-FullStack 71.1。当晚,DeepSeek Harness 开源发布,npx @deepseek-ai/dsh web 即可本地起 Web UI(GitHub:deepseek-ai/deepseek-harness)。

这其实早有预兆:7 月 31 日 V4 Flash 发布时,更新日志里就埋着一行——公开 Code Agent benchmark 使用的测试框架,正是「即将发布」的 Harness 极简模式。也就是说,Harness 在正式公开之前,已经在参与评估 DeepSeek 自己模型的 Agent 能力了。

🧩 源码架构拆解:七层 + 一条闭环

/ section

架构分析直接读 @deepseek-ai/dsh 0.1.0-rc.6 源码,不走文档转述。从宏观到微观,DSH 分七层——入口(dsh CLI)→ Profile 层(插件组合包)→ 插件宿主(Cordis)→ 核心运行时(dsh-base)→ 工具面 → 模型适配 → 持久化;一条任务沿这条链路跑一个闭环,事件全程落盘、可重建。

DSH 源码架构图:七层架构 + Agent 闭环拓扑

宏观 · 七层架构(源码实证)

〔dsh-base = 77 插件按域组合〕

入口 + Profile dsh CLI 用 --profile 选插件组合包:headless = base+headless、web = base+web-app;配置树 = bundles patch → 用户覆盖,层层叠加
宿主 + 运行时 Cordis 管依赖注入与插件生命周期;dsh-base 承载 Agent Loop、Session 事件溯源、LLM 服务、工具注册、沙箱/权限
工具 + 模型 + 持久化 工具面 fs/bash/web/subagent/skill/todo 挂钩真实环境;模型适配固定 deepseek-official(v4-flash,OpenAI 兼容);session.jsonl.zstd 全量落盘

微观 · 一条 Agent 闭环

〔实测 session 事件流〕

任务入环 用户任务 → 收件箱(inbox)→ Agent Loop:每 step 先模型调用生成 tool_calls,再调度工具执行(串行/并行组),结果回填进下一步
门禁 工具执行前过沙箱/审批(实测 preset=workspace-write、policy=ask);权限变化、上下文压缩都写进日志
落盘 循环直至 finish;用户消息/模型请求/工具调用/结果全程写入 Session Log——可恢复、可回放、可审计
Everything is a plugin——模型、文件系统、Shell、网页、Skill、子 Agent、交互界面全可替换;预设(标准/PTC/极简/创造)和形态(Web/TUI/Headless/ACP/SDK)只是同一套底层的不同组合。但读源码后最硬的一条判断:DeepSeek 的 V4 在公开 Code Agent benchmark 上用的就是 Harness 自己——模型和执行层是同一套体系联合设计,不是配套,是同源焊接

⚔️ 竞争格局:执行层开战

/ section
Claude Code Anthropic 的完整产品:造好一辆车给你开,多 Agent 编排 + Skill + 后台任务已成熟——AG 公司 11 个 bot 的编排底座就是同类 harness
Codex OpenAI 把 Agent Loop 称作 Codex Harness,桌面端加入多 Agent 并行、Skills、Automations、computer use——同样是产品
DSH DeepSeek 给的是发动机和底盘图:全开源、一切可拼、连 Agent Loop 都可替换——不是「DeepSeek 版 Claude Code」,而是可以自己造车的执行层基建

🔬 为什么 Coding 是试金石

/ section

AI Coding 正成为观察与训练 Agent 能力最理想的场景:代码反馈密集且客观——能不能编译、测试过不过、报错是什么,机器可直接验证,Agent 得以形成「执行→反馈→修改→再执行」的闭环。而 DSH 的 Session Log 要求「模型真正看到的一切都能从日志重建」(用户消息 / 模型请求 / 工具调用 / 上下文压缩 / 权限变化):既能恢复、回放、调试、审计,也让 Agent 执行过程第一次变得可系统化记录与分析——这正是评估 Agent 能力的实验场。

🎯 对我们的启示

/ section
实践者 同一模型放进不同 Harness,表现差异明显——选执行框架,和选模型一样重要
判断标准 看三件事:上下文如何组织、工具调用是否稳定、Session Log 能否可审计——这决定了 Agent 实际好不好用
AG 公司 我们自己的编排就跑在同类 harness 上;执行层正在成为新的差异化战场,值得持续追踪

模型决定智能的上限,Harness 决定它能否真的开始工作。

数据来源:DeepSeek 官方(GitHub / npm / api-docs 更新日志)· 追踪视角