Blogs

    © 2023-2026 LI DONG LIN
    ICP备案: 蜀ICP备2026033972号-1苏公网安备32011202001775号
    HomeLabBlogsStack
    Blogs

    初探 Harness

    2026/7/19
    初探 Harness

    2025 年,Manus 把 agent 这个概念推成了一场大戏。宣传片里光标自己在移动,终端命令自己在执行,标语大同小异——让 AI 不止会说话,还会干活。资本随之涌入,阿里巴巴承诺提供算力和虚拟机,逻辑和微软投 OpenAI 并无二致。差别在于 Manus 手里没有自己的大模型,它做的只是一层调用框架。可即便如此,最疯的时候一个注册邀请码能在闲鱼上卖到上千元。

    好景不长。人们很快发现这种看起来炫酷的交互,实际处理效率并不高,而给每个用户配一台虚拟机的成本结构也撑不住——没有那笔算力赞助,它更像个实验室产品。OpenAI 随后在 ChatGPT 里加了类似的 agent 功能,同样是给你一个虚拟沙箱去跑。但日常工作里,有多少任务是非得一台虚拟机加命令行才能完成的?要查点东西,一个自带网页搜索的对话框比它高效得多。热度就这么退了下去。

    不过这件事留下了一个值得看的问题:这些产品用的模型其实差不多,好不好用的差距是从哪里来的。

    赋予大模型手和脚

    答案在模型和你的真实环境之间。模型本身只会生成 token,让它变成能干活的东西的,是包在它外面的那层壳——它决定模型能看到什么、能动什么、干错了怎么收场。 这层东西现在有个名字,harness。

    Manus 给的 harness 是一台干净的远端虚拟机,里面什么都没有,所以它能做的只有从零开始的演示型任务。VSCode 插件给的 harness 是当前这个工程的文件树和你的编辑器状态,所以它能改代码但走不出这个窗口。同样的模型放进不同的 harness 里,能力边界完全不同。这就是为什么 agent 这两年的进展,看着像模型变强了,其实很大一部分是这层壳变厚了。

    新的一轮是 OpenClaw 带起来的,热度比 Manus 更荒诞。中国这边掀起了安装业务,腾讯、阿里、天翼云都进了场,甚至有上门安装收服务费的,Mac Studio 一度被炒出天价。但那些只是追着热度来的非开发者很快发现,这东西对他们没什么用,反而给自己的本地数据添了风险。

    对不写代码的人,这只是成一个昂贵的玩具;但是,对每天和代码打交道的人,它是合作方式的一次真实转变。因为 agent 能力说到底就是主动执行终端命令的能力,而终端就是开发者本来的工作环境。 模型第一次能感知到用户真实的机器,而不是一个凭空造出来的沙箱。对我来说这就像它住进了自己家里,尽管参数和算力依然在远端——那么大的模型塞不进一台个人电脑,这不现实。厂商也读懂了这件事,开始把模型往 VSCode、往命令行里塞,做插件、做 CLI,主动挤进专业人士的工位。

    模型厂商亲自下场

    新的一轮的变化是模型厂商自己下场做 harness。最典型的是 OpenAI 的 Codex 和我一直在用的 Claude Science。

    Codex 就是 openai 自己赋予了自家模型手和脚,甚至做了全新的面向AI的代码编辑器。agent 不单独收费,而是揉进已有的订阅阶梯里,多用一点算力多算一点额度。它的定价权来自主产品的用户规模,agent 只是这份订阅里新增的一块用量。模型厂商把 harness 缝进日常产品里,让你几乎感觉不到多花了一份钱。Agent 正在从一门单独的生意,变成大模型产品里一个默认就该有的功能。

    新的竞赛

    这几天 Kimi K3 发布,参数规模逼近 3 万亿,是目前已知最大的开源权重模型之一,原生就带着很强的工具调用能力,官方直接把它和 Claude Fable 5、GPT 5.6 这些闭源旗舰摆在一起比。这样闹下去,最开始大力宣发 Agent 的 Manus 却吃了瘪——一旦模型自己就能熟练地做函数调用、扛住长程任务,那些靠「帮你把模型和工具接起来」挣钱的创新,价值就会被迅速稀释。 因为这件事模型自己会做了,不再需要额外一层壳。

    短短几周,harness 从一个由第三方提供的产品,变成了模型厂商的功能。模型和产品的生态体系显然还没定下来,而每次大模型厂商移动一步,就有一批产品的价值被重新算一遍。

    接着阅读

    二区论文发表:AI 交互中的信任与选择2026/8/18AI 开发网站心得2026/7/12AI时代的人机交互:从工具到伙伴的设计演进2025/6/1