先说结论
一场围绕 DeepSeek Harness 的三方对话(主持人鱼皮、开源开发者阿江、昇腾 CANN 社区核心开发者金炯),把"两天狂涨十万 Star"这个传播现象拆成了三层值得记住的东西:其一,DeepSeek Harness 最大的产品差异不是功能,而是一切皆插件——连模型、工具、Agent 循环这些官方内置件都能按同一套插件标准替换,甚至 Harness 能"自己改自己";其二,模型与 Harness 正在走向深度协同——DeepSeek V4 Pro 在自家 Harness 下表现更好的传闻,背后是训练阶段就让模型适应特定脚手架的机制(Kimi K3 论文已有先例),这动摇了"模型能力与工具无关"的假设;其三,它的爆火不只是营销,而是把开发门槛降到了"能对话就能搓插件"的程度——内测群里高中生能通宵写插件,社区几天就长出几千个插件。三位嘉宾的共识是:程序员不会消失,但护城河从写代码转向定义需求、验收结果和工程把控力。
一、“模型是大脑,Harness 是身体”:为什么此刻人人都在谈 Harness
对话从一个最基础的问题开始:harness 到底是什么。阿江给出了一个几乎已成社区共识的类比——模型像大脑,harness 就是让大脑真正干活的那套工具和身体。Agent 不只是模型,更准确说是"模型 + harness + 外层环境"。金炯进一步补充了一个公式:agent = model + harness + 算力——没有充足的算力供给,一切跑不起来。
这个看似简单的定义,其实踩在了一个行业转折点上。金炯观察到,模型层已经"卷成麻花":一家厂商一个多月就刷新一次模型,每天睁眼就有新模型发布,社区像讨论修仙等级一样比较各家模型。模型变得快,harness 必然要跟着变——DeepSeek Harness 后来居上,一上来就把"变化"推到极致:所有东西都插件化、全部可插拔。在金炯看来,这正是它精准命中社区当前状态和需求、迅速爆火的原因。
主持人的理解把 harness 放进了一个更清晰的坐标系:它是模型和操作系统之间的"驾驭层",包括给模型提供的工具、技能、文件系统、沙箱隔离。这个定义也解释了为什么 Claude Code、Codex 这些成熟产品之后,一个开发者预览阶段的工具还能引爆社区——它不是做了一个更好的 Claude Code,而是把整个驾驭层本身做成了可重组的素材。
与日常工具对比更能看清差异。阿江平时用得最多的是 Claude Code 和 Codex,他的判断是"本质上区别不是特别大",但 Claude Code、Codex 是大公司运作的成熟商业软件,面向 To C 小白用户;DeepSeek Harness 处于开发者预览阶段,对小白不友好。金炯则抓住了一个反常识的点:以前的 Harness 工具都是"给你一个装应用的入口",而 DeepSeek Harness 能自己改自己——在页面上原地生成一个插件、原地部署、改变界面。他的比喻是"自己扯自己头发上天"。
二、一切皆插件:开放到了连官方内置件都可以被替换
“一切皆插件"最容易被误解成"能多装几个插件”。阿江纠正了这个理解:最有价值的地方是连官方内置的东西都能按同一套插件标准替换——模型、工具、绘图组件,甚至 Agent 循环本身都没有焊死在框架里。开源则让二次开发和商业化的落地成本直接降下来。
节目提到(主持人转述自己的调研),插件系统基于一个名为 Codis 的技术实现,除了能热插还能热拔:卸载插件时,之前注册的工具、服务会自动取消,就像从没装过一样——这是很多 IDE 插件做不到的(装完卸载往往要重启)。
插件、Skill、应用三者的关系也被厘清。阿江的区分是:Skill 是沉淀在自己电脑上的技能包,任何人都可以创造,且是一套标准,可以在任何 Agent 上跑;DeepSeek Harness 插件则遵循它自己那套标准,代码大部分由开发者完成。金炯从任务层级切入:插件专注解决一个应用场景的问题,Skill 是一种上下文管理/知识管理手段——应用不一定非要用 Skill,你也可以直接裸加载一段 Markdown 知识库,或者写个脚本。主持人补充了一个直观的判别法:Skill 一般是给模型用的(要发给 AI、让 AI 遵循);插件不一定影响 AI 交互,比如装个皮肤美化插件,纯粹是让你用软件更方便。在 DeepSeek Harness 里"一切皆插件"意味着工具、Agent 循环机制都是插件,定义范围比 Skill 广得多。
这种极致开放也带来了真实的代价。与 VS Code 的对比很说明问题:两者方向相似——小核心 + 扩展生态——但 VS Code 有稳定的插件 API、市场、版本兼容和庞大用户群;DSH 还在开发者预览阶段,插件冲突是常态:A 的插件和 B 的插件一冲突,整个系统直接打不开(VS Code 插件挂了 IDE 还能用)。金炯观察到 DSH 插件有依赖树,形态上更像 Python 的 pip 包——灵活但缺少严谨审核。主持人给出的实用建议是:不要装太多不需要的插件,并且把 DeepSeek Harness 用 Git 托管起来,插件装坏了可以回滚到之前的版本。
三、模型与 Harness 的深度协同:V4 Pro 的"角色专武"是真是假
社区流传的说法是 DeepSeek V4 Pro 在自家 Harness 框架下性能有提升,这是本场对话技术含量最高的部分。
阿江的实测感受是"感知不明显"——他自己跑了些 benchmark,没有观察到特别大的性能提升。金炯提供了两条更有解释力的证据链。第一,他没观测到直接提升,但注意到 V4 Pro 在算子生成任务上的行为性格确实不同:倾向用更简单的方式实现问题,认为工作流太复杂会跳过步骤,调用工具的积极性不如其他模型。他当时就猜"会不会做了一个极简的毛坯房模式",当晚 Harness 发布,果然如此——模型发布与 Harness 发布的时间关系本身就在暗示深度配合。第二,他引用了 Kimi K3 论文中的做法:为了不让模型过拟合某个 Harness,训练时组合了各种各样的 Harness 工具调用和提示来生成轨迹。K3 论文反向印证了"模型行为会被 harness 深度塑造"这个机制。
主持人自己也经历了一次立场反转:V4 Pro 正式版刚上线时他测了一波,评价"很拉";等 Harness 出了之后在 Harness 下跑同样的任务,体感"还是有明显提升的"——评论区因此质疑他"昨天说拉今天说好"。他跑的几个前端、后端、全栈任务都支持这个体感,不过他明确说没有跑 benchmark。
“角色专武"的另一个载体是极简模式。阿江把它总结为两个字:少、稳。极简组合的提示词链路追踪非常短,暴露给模型的工具只有两个(一个基础执行、一个文本编辑),不注入运行时、不做上下文压缩——对一个编码模型来说,两个工具就能完成大多数任务。这有可能减少模型在工具复杂多变时产生的坏推理轨迹。金炯的猜想则指向提示词需求的下降:GPT-5 发布时出过一版系统提示词指南,删了大量提示词——当基模学的知识足够多,对提示词的需求可能在下降,模型可能接受过比较好的训练。但他立刻给自己划了边界:这只在部分 benchmark 任务上被观察到,更广泛的生产任务里基模是否充分掌握场景,还不能下结论,完整模式仍有存在必要。
主持人的小样本测试给出了量化体感:极简模式跑任务比标准模式快了约三分之一,效果与标准模式相当(有时更好、有时略逊)。社区里"从 we need 到 let’s"的说法(模型从"我们需要什么"变成"让我们尽力去做”)也与此相关,但他强调样本太少,“能不能发挥最大性能,把时间交给官方”。
还有一个被祛魅的点是缓存命中率 99%。阿江内测时跑到过 100%(Web UI 显示),但他拆解了神话:按官方文档的公共前缀等缓存策略,自己写 Agent 也能达到 99%——跑的轮数越多,分子分母的比例自然好看。主持人的解释更直白:缓存命中技术上并不复杂,就是比对每轮请求的提示词前缀,前缀相同就缓存重复部分以减少重复计算成本。结论:能省钱是真的,但这是设计模式带来的,不是 DeepSeek Harness 独有的黑科技。
四、热情从哪来:内测社区的"创造模式",与被削到极低的开发门槛
为什么短短几天长出几千上万个插件?三位嘉宾从亲身经历给出了几乎相同的答案:开发成本被削到了极致。
阿江是内测亲历者,他描述的内测群像是一部微缩的社区史诗:进群先看到一群二次元头像,里面有不止一个高中生;所有人都在 Vibe Coding(原文转写为"Web Coding",按上下文应为 vibe coding)写自己的插件,写完发到群里求点赞求 star;有人把门户广告做成插件,有人做了 Excel 插件让全群刷屏;公测时那个高中生学弟做了个大合影网站——“我要上晚自习了,你们能帮我测一测吗”,阿江说听到这句"整个人汗毛一立"。开发插件的过程低门槛到什么程度:源码放在那里、DiffSync(转写疑似,应为 DeepSeek 自身框架语境)放在那里、一切皆插件的框架(模型、Web UI 都是插件)直接让它参考,再把 Claude Code 侧 A2A Teams 的需求原理丢给它,插件就开发出来了——“人工成本非常非常低”。
金炯把这种热情翻译成了游戏机制的类比:什么最让人上瘾?一是给你任务让你完成、获取反馈,二是给你开放世界、原子化组件让你建造——救公主游戏的蓝图、拉电线游戏的生产流水线、动物聚会游戏的岛上蓝图。DeepSeek Harness 打开后有个"创造模式",可以改地图、在社区打标签分享蓝图——这就是玩游戏的快乐。
与 OpenClaw(转写为"龙虾"/OpenCLL,指 OpenClaw)的对比补充了另一个维度。主持人觉得 DSH 的火爆让他回到了今年三月 OpenClaw 刚出的时候,但嘉宾们指出了关键差异:OpenClaw 时代大家主要是"养虾"(用),DSH 时代大家是在参与创造——每个人都手搓几个插件分享到社区。定位上,阿江的用法分工明确:DeepSeek Harness/Claude 是"给我干活"的(在主用电脑上),OpenClaw Hermes 更像"在后面跑"的(部署在云服务器,适合监控类长时任务,更私人)。金炯的判断标准是业务场景:现成软件能搞定就不折腾;业务复杂时托管给 OpenClaw 反而不灵活——它在虚拟机里怎么思考你观测不到,只扔个结果过来,而 DSH 的可观测性好得多。
可观测性正是金炯最激赏的设计。看社区一两个月前就上线过类似插件(Combot Insight,回放模型思考过程与交互过程),因为生产任务一旦失败(八到三十几个小时的任务),错误起点可能藏在很早的某一轮对话里。DeepSeek Insights 把这个作为标准入口,让金炯"一看到就非常惊喜"。主持人的对比更有说服力:以前用 Claude Code 你根本不知道它实际给模型发了什么;在 DSH 里每步注入的系统提示词、调用的工具、传的参数、AI 在哪个环节花的时间和 token 都一目了然。
关于 Web UI 而非 CLI/桌面端的选择,答案也指向门槛与生态:网页更容易看懂、控制,是更容易上手的 Agent 入口;桌面端要处理 Windows/Linux/Mac 兼容性(团队还在疯狂招人);对插件开发者来说用前端技术栈写插件非常容易;跨端技术包层壳就能变桌面端——GitHub 上已经有一大堆 DeepSeek 桌面端项目,官方大概率不会亲自下场。
五、程序员的去处与国产生态的位置:需求定义、验收标准与"品味"
技术之外,这场对话对"人"的回答相当务实。
学 AI 不用焦虑。阿江的核心观点:从 ChatGPT 聊天式编程到 Copilot、Cursor、Claude Code,对程序员最重要的是定义自己的需求以及验收的标准——这一点不随工具变化,对非程序员同样成立。金炯的态度更松弛:“今天不学到明天可能也不用学了,概念又换了一波”,AI 是快速变化的实践学科,重要的是找到自己感兴趣的项目,围绕业务痛点从简单技术开始叠加;能用极简模式搞定就不搭任何 skill 和工作流。他特别强调了一个被普遍忽视的动作:给自己的业务场景搭一套 Benchmark 集——没有 benchmark 就无法衡量结果在生产环境能不能 work,而这件事比搓插件、搓工作流、写 skill 都难,大多数人写东西很快,但很少有人真正把生产环境的 benchmark 搭起来。
程序员的护城河仍在。主持人的总结是:不变的是理解能力、判断力、业务经验;变化的是工作方式——省下敲代码的时间去打磨需求、做好验收和交付。AI 出了问题要靠经验和水平拉回正轨,出了事还需要人背锅。具体到能力项:Git 版本控制、发布部署、CI/CD 流水线、安全、性能、架构决策,AI 可以辅助但人要整体把控。金炯补了一个社区概念:品味——程序员大部分时间本来就不在写代码,而在对齐需求、获取反馈、来回改;写代码速度提升一百倍,需求发现和验收定义也不会完全交给 Agent,“程序员的品味会成为一个很重要的点”。岗位层面,FDE(Forward Deployed Engineer)之所以流行,是因为企业需要的不是写代码的人,而是能利用 AI 真实把系统落地、解决实际问题的人——用主持人的话说,“从写代码的码农转变为驾驭 AI 的架构师”。
国产生态的部分,金炯的身份(昇腾 CANN 社区核心开发者、CANNboard/看Board 项目 Committer)让他的视角独特。他把华为这类算力厂商的角色总结为三层:提供从算力卡到超节点(A3 到 A5)的大量算力——现在算力紧张到各家 coding plan 基本都买不到、停止供应;提供高性能算子(FlashAttention 融合算子、DeepSeek 的 MegaMoE 通信计算融合)和推理引擎(MindIE,转写为"mind eye");以及在开源生态里拥抱 DeepSeek Harness 这样的生态,提供 skills 和 plugins 帮用户写算子、优化算子。他给"agent = model + harness"公式补的"算力"一项还有更深一层的含义:模型未来不仅会自己改 harness,还可能自己改算力——把算子性能优化得更好、把结构融合掉,算力是模型自己进化的另一环。
开源正在缩短底层差距。金炯给出了两个具体信号:昇腾 NPU 已变成开源社区,算子、通信包、API 全部开源——相比之下英伟达虽语料多但没把源码全开源,模型不能充分理解细节;社区里写 GPU kernel 的项目在 GitHub 1.5k star、GitCode 1.4k star,配合"看笨器"(转写疑似,指算子优化榜单)可以看到国产模型发一版涨一截,在不少 vector 算子领域已赶上人类手写水平。他的判断是:只要坚持开源、把中间过程往社区放、把基建老师傅的经验蒸馏成 skill 和知识库,生态差距会慢慢补上——“agent 给了我们非常多的机会”。
对话结尾还有两个快闪判断:其一,模型与自家 Harness 不会强绑定——官方源码明确支持多供应商(阿江已把 GPT-5.6 接进去),且 DeepSeek 开放 API 的收入模式决定了它不会负向削弱其他框架上的表现,顶多在自家工具上做增量优化。其二,AI 时代不会有"Windows/安卓级"的垄断者——阿江和金炯都认为会百花齐放、走向去中心化(AI 时代创造和开发变得容易,每个细分领域每个人都能造自己的 agent);主持人给出的"暴论"候选是豆包和元宝之一,理由是国民级影响力,但这只是猜想。
观察指标与启发
这场对话留下的可迁移判断,至少有这么几条链条:
插件化 → 开发成本坍缩 → 生态增速。DSH 几天几千插件不是营销奇迹,是"能对话就能搓插件"的必然结果。观察指标:插件总量与增速、插件冲突率、官方是否发布插件开发规范。启发:产品想借社区力,先把"贡献一个扩展"的成本压到最低,哪怕牺牲一点稳定性(DSH 的插件冲突问题正是这个取舍的代价)。
模型-脚手架协同训练 → “角色专武"现象 → benchmark 之外的评估维度。K3 用多 harness 轨迹防过拟合,DeepSeek 反向做深度协同,两个方向都证明 harness 在塑造模型行为。启发:评估一个模型不能只在通用 benchmark 上看分,还要看它在什么 harness 下被训练、在什么 harness 下被使用——通用跑分和"原生脚手架体验"的差值会越来越大。
可观测性成为刚需入口。DeepSeek Insights 被做成标准入口、看社区提前自研 Combot Insight、生产任务失败要回放几十轮前的错误起点——三条证据指向同一个需求:Agent 时代调试的本质是回放和理解模型的决策过程。启发:做深度 Agent 项目时,观测"为什么不调某个工具、为什么不遵从工作流、为什么产生幻觉"比看最终结果重要得多。
需求定义 + 验收标准 + 品味 = 人的位置。三位嘉宾从不同方向收敛到同一结论:写代码的边际价值在快速下降,定义"做什么、做到什么算好"的价值在上升;给自己业务搭 benchmark 集是大多数人欠下的功课,也是最值得补的一门课。
最后留一个不确定性清单:V4 Pro 在自家 Harness 下的提升目前只有体感和小样本,官方 benchmark 未出;“新一轮灰测对标 GPT-5”(原文 PhiBo 五,转写疑似)只是小道消息;DSH 仍在开发者预览阶段(已到 0.7 公测版,最新版本据说在兼容 Codex 插件格式、把 Codex 和 Claude 接成 Server Agent 调用),插件管理的规范性问题尚未解决——金炯建议关注的姿势是写个 Skill 定时抓取关注领域的网站发日报,“这样不容易从新闻里看了之后又焦虑”。