DeepSeek 开源了一个 Agent 框架,一天 8 万星——它到底在卷什么?
8 月 13 日深夜,GitHub 上出现一个仓库,叫 deepseek-ai/deepseek-harness。24 小时不到,82,083 颗星。没有发布会,没有预告,只有一行 README 和一句口号:“Everything is a plugin”。
Hacker News 上 273 条评论吵成一团。有人夸它是"最后一个下场做 first-party harness 的模型实验室"(HN 讨论),有人冷笑"HN 看到 DeepSeek 三个字就会无脑点赞"。但没人否认一件事:模型厂商集体下场做 Agent 框架的这场仗,DeepSeek 正式参战了。
模型是灵魂,Harness 是身体
先搞清楚什么叫 harness。Claude Code、OpenAI Codex CLI,这些开发者在终端里跑的东西,本质都是 harness——一个把模型包装进真实环境的壳:模型负责思考,harness 负责给它眼睛(读文件)、手(跑命令)、记忆(存状态),让它能在真实项目里持续干活。
DeepSeek 这次开源的就是这么个壳,叫 dsh,一条命令就能跑:
npx @deepseek-ai/dsh web
默认起在 http://127.0.0.1:3080,Web UI 直接聊(README)。但壳和壳不一样,DeepSeek 这个壳的内核,是它敢喊"Everything is a plugin"的底气。
一切皆插件,连 UI 都能换

Harness 的底层是 Cordis,一个插件内核。模型、工具、技能、会话、沙箱、存储、循环、调度、UI——所有能力都是插件,可以热插拔、热替换,不用重启主程序。
怎么理解?拿 VS Code 打比方:VS Code 支持扩展,但编辑器本体和扩展是两套体系,装个插件经常要你重启窗口。Cordis 的做法更进一步,插件可以动态挂载、卸载,甚至能在线换 UI 组件——HN 上有人一句话总结:“它的大招是个 destructor?”(评论原文),语气半信半疑,但立刻有人接:“2026 年还有人嫌 destructor 没用?你写个插件调半天,还得重启整个 agent 才能生效的时候就不这么说了。”
熟悉 Java 的老哥补了一刀:这不就是 OSGi 和 Eclipse 的插件体系吗?“每一代人都以为自己重新发明了轮子”(评论原文)。话糙理不糙——热插拔插件系统在 IDE 领域早就成熟,但把它用在 agent 主循环上,确实是新场景:agent 跑长任务时中途改插件、调工具、换模型,不用重启整个会话,这个能力对每天跟 agent 打交道的人来说,价值是实打实的。
四种模式:从全能到裸奔
dsh 预置了四种运行时模式,定位很清晰:
- Standard:完整工具集,文件编辑、shell、搜索、技能、规划、子 agent,全能选手
- Code:标准模式能力之上,模型可以用 TypeScript 程序编排多轮工具调用
- Minimal:只有 bash 和文件编辑器两个工具,专门用来裸测模型
- Creator:给造轮子的人用的,可以边跑边检查运行时、内存里测插件、组合新模式
Minimal 模式很懂行——想对比模型本身的能力差异,就得把 harness 的加成剥干净。基准测试圈早就知道:同样的模型,换不同 harness,结果能差出一截。DeepSeek 主动提供"裸奔"模式,等于把评测的话语权交还给开发者(官网说明)。
每一次运行都留痕:和美国实验室对着干
dsh 最戳社区的点,是 Every run is traceable。系统提示、推理过程、工具调用、子 agent 调度、每一次上下文注入,全部记进一个 append-only 的会话日志,Trajectory 视图按来源分类展示,还能 resume、fork、搜索、回放(官网)。
这个设计放在今天格外扎眼。HN 上有人直言:“这是美国头部模型没有的能力——OpenAI、Anthropic 的 agent 完整轨迹是加密的,你想看自己 agent 到底干了啥,还得想方设法绕过 ToS 去解密”(评论原文)。
有人抬杠:"这不就是……日志吗?"底下回复很妙:"只是日志?是不缺东西的日志。开箱即用就给你完整事件流,这在 2026 年还真不算标配。"事件溯源(event sourcing)在服务端是成熟范式,但 agent 端到端全量留痕、可回放、可 fork,是把"可观测"从运维概念搬进了 agent 开发的主流程。调试 agent 的时候,谁不想看看模型到底"看"到了什么?
为什么又是 Node.js?
273 条评论里,争论最凶的居然是语言选择:为什么所有 agent harness 都是 Node.js 写的?
社区观点高度一致:异步是标配、到处能跑、解释型迭代快,但最核心的是——插件分发。npm 生态天然适合分发插件,而 harness 的价值恰恰在插件生态(评论原文)。有人不服:"LLM 都能替你写代码了,为什么不用编译型安全语言?"立刻有人反击:“当你大部分时间在等网络和 token 流的时候,原始性能根本不重要——重要的是 5 个 Claude Code 会话同时跑的时候,内存别爆炸。”(评论原文)
模型厂商的最后一战

把视线拉远一点。OpenAI 有 Codex CLI,Anthropic 有 Claude Code,Google 有 Gemini CLI,现在 DeepSeek 也下场了——HN 上那句评论说得很准:“这是最后一个还在发模型的实验室,也终于补上了 first-party harness”(评论原文)。
为什么所有模型厂商都在做这件事?因为模型正在变成"灵魂",而灵魂卖不上价。API 价格一年比一年低,模型能力的差距在缩小,真正决定开发者粘性的是"谁家的壳最好用"——工具链、插件生态、调试体验,这些才是新的护城河。DeepSeek 的选择是:既然要打,就把壳整个开源,用插件生态换生态位。许可证 MIT,模型随便接,Anthropic、OpenAI、本地模型都行(README)——这招和它开源模型的策略一脉相承:让所有人都围着我的生态转。
社区里另一个视角也值得听:harness 的帕累托前沿每个月都在变,新模型不断发布,“我想在不同模型之间用同一个稳定的工作表面,就像用同一个编辑器写所有语言”(评论原文)。如果需要在多个模型间做对比测试,像 likeai520.cc 这类 API 中转站可以省掉不少折腾,但 harness 这层,越来越多的人会自己掌控。
别急着站队
dsh 现在还只是 developer preview,官方 README 白纸黑字:“THERE WILL BE COMPATIBILITY-BREAKING CHANGES”——API 随时会变。一天 8 万星是热度,不是成熟度。插件系统是加分项还是花架子,要等第一批生产环境的长任务跑完才知道。
但有一点已经确定:模型厂商的战场,从"谁的参数大"转到了"谁的壳好用"。这一仗,DeepSeek 带着 8 万颗星开团了。
主要参考:DeepSeek Harness 官网、GitHub 仓库、HN 讨论帖、Cordis 论文
网硕互联帮助中心




评论前必须登录!
注册