跳到正文
Agent.SpaceAgent 入门打开 Agent.Space
Agent 入门第 2 章02 / 08

模型和 Agent Harness:一次任务里,谁负责什么

约 5 分钟阅读

读完这一章,你会看到模型、Harness 和工具时,知道各自负责哪一部分。

你准备让 Agent 做邀请页,界面却先让你选 Agent,又让你选模型。刚刚还只是想约个散步,怎么像在给电脑配零件?

先别着急。这里的两个选择,分别关系到“用什么能力理解任务”和“怎样把任务执行下去”。我们把一张邀请页的制作过程拆开,就好懂了。

模型负责理解和生成

模型 处理给到它的信息,生成下一步的内容或行动建议。

你说“活动适合平时不运动的人”,模型可以据此调整文案,避免把邀请写成挑战书。你说“时间要醒目”,模型也可以生成相应的页面代码。

GPT 和 Claude 的具体型号是模型名称。不同模型的能力、速度和使用成本可能不同,适用的输入也可能不同。

不过,模型提出“修改这个文件”,还需要有软件把这件事真正执行掉。文件在哪里、当前能用什么工具、哪些动作需要询问你,都要有人组织。

Harness 把一次任务组织起来

Agent Harness 可以理解成围绕模型的一套执行软件。这个英文词比较生,先记住它做的事情就够了。

它把你的要求和相关文件交给模型,把可用工具说明清楚,处理工具执行和权限,再把结果送回来,让任务继续。对话变长时,怎样整理上下文,也是它可能负责的工作。

想象你说:“把集合时间从三点改成四点。”模型需要先看到相关内容,修改动作需要落到正确文件上,修改后的结果也需要反馈回来。Harness 就在组织这段过程。

因此,同一个模型,放在不同的 Harness 和环境里,使用体验也可能不同。能看到的材料、工具和执行方式变了,结果就可能变化;这并不意味着任何 Harness 都能把所有模型变得一样强。

工具是实际做动作的那一环

工具 可以读取文件、写入修改,或者运行一个检查。模型提出动作,Harness 按相应规则执行工具,工具再返回结果。

就拿邀请页来说:读取工具看到旧时间,编辑工具写入新时间,检查工具确认内容是否符合要求。这些动作需要发生在某个有文件、能运行程序的地方,也就是我们后面会讲的 Workspace

这种拆分是为了方便理解;不同产品会把这些部分打包到不同入口里。你不需要自己把每层组装一遍,才能使用 Agent。

蓝色模型位于执行框架内,框架连接读取、编辑和检查工具,共同放在工作空间中。
中间的模型负责理解,外层的 Harness 组织过程,周围的工具完成动作。

把几个座位记住就好

名称负责什么在邀请页里做的事
模型理解信息,生成内容与下一步建议理解“时间再醒目一点”,生成修改方案
Harness组织上下文、工具、权限和执行过程让读取、修改与检查接着发生
工具完成具体操作读取或修改网页文件
Workspace保存项目,提供工作的环境放置邀请页,承载相关对话和操作

Agent 则是这些能力围绕目标运转起来时,你正在合作的那个执行者。它不是一个与模型完全无关的“更大模型”。

选的时候,先解决眼前这件事

第一次做网页,先选一个当前可用的 Agent,再从界面提供的兼容模型中选择。不是每个 Harness 都支持所有模型,额度也需要单独满足。

如果结果不理想,先看具体问题:它没有读到活动资料,补资料可能比换模型更有效;它拿不到需要的工具,就要检查环境;它误解了你的要求,可以先说得具体一些。

关于 Harness 的技术细节,OpenAI 的官方说明介绍了工具执行、配置和持续对话的组织方式。第一次阅读到这里,能分清上面四个座位就已经够用了。