Agent 精读(一):Agent 的能力边界,由 Harness 决定

这是《深入理解 AI Agent》精读专题的第一篇。读的是李博杰的开源书第一章「AI Agent 入门」,写下我自己的理解——不是摘抄,是用我的话重新讲一遍。
本章思维导图见 专题页 · 章节思维导图

一个公式,两个层次

最小实现是 Agent = LLM + 上下文 + 工具——大脑负责决策,眼睛(上下文)接收观察,手脚(工具)作用于环境。到了生产形态,同一个系统展开为 Agent = Model + Harness,其中:

1
Harness = 上下文管理 + 工具接口 + 约束 + 验证 + 纠正

这两个公式不是宏观与微观之分,而是同一个系统的 Demo 视角和生产视角:最小形态的 Harness 就是「上下文构造 + 工具接口」,生产系统还要在同一层加上约束、验证、纠正三层保障。

最容易记错的一点:Harness 不是模型的内部环境,原文的边界划得很死——Agent 边界内、模型之外。它环绕模型运行、治理模型与环境的交互,但沙箱里随行动变化的文件、外部数据库、网页和用户,永远属于 Environment。物理部署位置不决定概念归属。

Agent 和外部世界打交道,只靠两个接口

观察通道和动作接口共同构成 Agent 与外部环境之间的边界。上下文是眼睛——但它不只是”历史数据”,而是 Agent 在每个决策点收到并保留的全部信息:环境观察、用户记忆、领域知识、自身状态、任务进展。工具是手脚——从预定义的工具调用到动态生成代码,从委托子 Agent 到主动与用户沟通。

原文里我最认同的一句判断:没进上下文的信息,对模型来说不存在;没被动作接口允许的操作,模型即使知道该怎么做,也只能停留在文字建议上。

模型固定时,Harness 是唯一杠杆

许多看似需要「更聪明模型」的问题,其实只是接口问题:把任务所需的数据纳入上下文,或把完成任务所需的操作封装成工具,原本不可解的任务就可能变得可解。

这不是空话。LangChain 在 Terminal Bench 2.0 上从 52.8% 提升到 66.5%(排行榜 30 名开外跃升前 5),改变的不是模型,是 Harness——让 Agent 自动检查执行结果、检测循环、优化思考策略。所以书里说:当各家模型能力越来越接近,竞争优势就转移到了模型之外的工程实践。Harness 的五要素是一个闭环:上下文与工具让 Agent「能做事」,约束预防错误、验证发现偏差、纠正让闭环形成——三者共同让 Agent「不做错事」。

观察与动作空间的扩张

  • 三条路线各自为政:Deep Research(深度调研)、Coding(代码生成)、Computer Use(电脑操控)长期独立发展
  • Manus 首先合并:把三者放进同一个生产级 Agent——云端虚拟机里,虚拟浏览器扩大了观察空间,文件系统、代码执行与命令行扩大了动作空间
  • OpenClaw 再推一层:本地优先,跑在用户自己的设备上;通过 WhatsApp、Telegram 等消息渠道随时触达,本地 Gateway 把 Drive、Notion、本地文件——分散在各账号与设备的数字生活——在授权后拉进同一个观察空间

Pattern 清晰:谁扩大了观察与动作空间,谁就重新定义了 Agent 的能力边界。

下一步

  • 本章的 ReAct 循环与编排模式(工作流 vs 自主)部分,第二篇笔记补全
  • 跑通第 1 章配套实验 context(Starter 入口),把「最小 Harness」亲手搭一遍

参考来源