跳到正文
Agent.SpaceAgent 入门打开 Agent.Space
Agent 入门第 1 章01 / 08

AI Agent 是什么?从聊天到动手做事

约 7 分钟阅读

读完这一章,你会分清聊天与 Agent 工作方式,理解工具、环境、记忆和 Skills 如何配合。

你可能已经用过 ChatGPT:在输入框里问一句,AI 回你一段解释、一封邮件,或者晚饭吃什么的建议。聊着聊着,你会想:建议挺好,接下来的事情,也能请它帮我做吗?

比如,周末想约朋友散步。与其让群消息淹没集合时间,你决定做一张邀请网页。现在,你需要的成果很具体:一个能打开、能修改的页面。

Agent,中文常叫智能体。在这本教程里,它指能围绕一个目标,调用工具、观察结果,并在工作环境里继续推进任务的 AI 系统。你告诉它想做什么,它会判断下一步该做什么,并实际动手。

从聊明白,到做出来

还是这张邀请页,看看两种用法:

你想怎么合作可以怎样说这次期待的结果
先聊一聊“一张散步邀请页应该写些什么?”一份建议,帮你想清楚内容
交给 Agent 做“请做一张散步邀请页,保存成文件,检查后告诉我怎样打开。”实际的网页文件,以及完成情况

聊天很适合解释、讨论和出主意。Agent 的工作方式则把“接着做下去”也交给 AI:它可能先问集合时间,再写文件、检查按钮,发现问题后继续修改。你不用把“现在打开文件”“现在改第三行”逐条教给它。

左边的聊天窗口给出建议,右边的任务经过工具操作,留下文件和可以打开的邀请网页。
同一个想法,可以先聊清楚,也可以交给 Agent 动手。图里比较的是两种工作方式。

ChatGPT 是产品名,Chat 和 Agent 描述的是这里讨论的工作方式。一个产品可以同时支持它们,例如 ChatGPT 也提供 Agent 模式。看见聊天框,不代表它只能聊天;有搜索或生成图片的功能,也不意味着每次问答都在持续执行一项任务。

判断时,留意它这一次能做什么、实际做了什么,以及结果在哪里。

工具和环境:它怎样动手,在哪儿动手

AI 写出“我已经做好网页了”,文件可不会自己出现。真正把内容写进去,需要用到工具

工具让 AI 能执行具体动作。例如:

  • 读写文件:读取已有材料,把邀请页保存为 index.html,再修改集合时间。
  • 使用浏览器:查找资料,或者在具备相应能力时打开页面、检查显示效果。
  • 运行程序:处理表格、计算数据,或检查网页里的错误。

这些动作发生的地方,就是它的工作环境。可以是你自己的电脑、云端电脑,也可以是连接好的浏览器或业务系统。不同 Agent 拿到的工具和访问权限不同,能做的事也就不同。

在 Agent.Space,我们把这次项目放进一个云端 Workspace:你在浏览器里提要求,Agent 在云端操作文件。第一次做邀请页,不用先在自己的电脑上安装一套开发工具。至于文件怎样保存、下次怎样继续,第 4 章会带你认路。

持续工作:做一步,看一步

Agent 通常不是把计划说完就结束。它会根据每一步的实际结果,决定接下来做什么:

  1. 看目标和材料:邀请谁?几点集合?还缺什么信息?
  2. 选动作,调用工具:创建网页,写入活动内容。
  3. 看执行结果:文件保存成功了吗?检查有没有发现问题?
  4. 继续或调整:补上漏掉的地点,修好按钮;需要你决定时,回来问你。
围绕模型,理解要求、调用工具、观察结果和调整行动构成一个循环,最终产出网页。
动手、看结果、再调整。一次任务里,这个过程可能重复很多轮。

这就是“持续工作”的意思:围绕同一个目标,把几步操作接着做完。较长的任务也可以留下文件和进度,在支持接续的环境里继续。

它仍然会有停下来的时候:事情做完了,需要你补充信息,遇到了权限或额度限制,或者执行失败。能持续推进,不代表每个程序都永远在线。回来时先看当前状态,再决定下一步。

记忆和经验:下次少从头解释

你刚说过“语气轻松一点”,它后面的文案就变随意了。这通常是因为这句话还在它当前的上下文里——也就是这次处理任务时,能看到的对话、材料和工具结果。

那隔几天,换一段新对话,它还知道吗?这就要看信息有没有被保存,并在需要时重新读到。

记忆可以理解成留给以后用的笔记。有些 Agent 产品会按配置保存偏好、反馈或项目知识,再在后续任务里使用;例如 Claude Code 的记忆机制。具体记住什么、放在哪里、哪些对话能用,要看相应产品。

对我们的邀请页,一个容易理解的做法是请 Agent 把已确认的安排写进项目笔记:活动适合新手,走累了可以休息,集合地点已经确定。下次继续时,先让它读这份笔记,就少了一轮重新交代。

经验还可以多走一步:把这次试出来的好做法留下来。比如,你发现集合时间埋在长段落里很容易被漏看;改到标题下面以后,朋友一眼就找到了。可以把“关键信息放在前面,完成后用手机宽度检查”记下来,供下一张活动页参考。

这类积累靠的是保存和再次使用信息,不等于每聊一次就重新训练了模型。笔记里的决定也可能过期,重要内容仍要确认;新 Agent 也不会自动知道所有其他对话。

Skills:把好做法装进一本小手册

如果你经常做活动页,就没必要每次从零交代整套流程。这时可以把稳定、管用的做法整理成一个 Skill,复数写作 Skills,通常译作“技能”。

把它想成一本给 Agent 看的做事手册:什么时候用、按什么步骤做、怎样检查。假设有一本“活动邀请页”手册,里面可能写着:先确认时间地点,再安排内容,最后检查手机排版和参加按钮。它还可以附上模板、示例或帮助执行的小程序。

在支持 Skills 的产品里,Agent 可以在适合的任务中读取这本手册,你也可以明确指定使用某个 Skill。常见的 Agent Skills 格式SKILL.md 文件保存说明;第一次只要理解用途,不必马上学会写这个文件。

Agent 的工作台一侧是记录活动事实的笔记,另一侧是包含步骤和检查项的操作手册。
项目笔记留下已确认的事,Skill 留下可复用的做法。需要时,Agent 再把它们读回来。

用邀请页把三个词分开:工具负责把文件改掉;记忆可以保存“这次活动适合新手”;Skill提供“做活动页时先确认哪些信息”的方法。Skill 里的说明可能指导工具操作,但实际能用哪些工具、访问哪些文件,仍由当前环境和权限决定。

所以,Agent 可以配合记忆和 Skills 越来越顺手,但这些能力需要相应支持。做你的第一个网页,先把任务交代清楚就能开始。

第一次合作,你来拿主意

你仍然是那个知道“为什么要办这场活动”的人。Agent 可能把“随便走走”写得像耐力选拔,你补一句“大家只是想散散心,不强调配速”,它就有了更明确的方向。

第一次布置任务,把三件事说清楚就好:想得到什么,手头有什么材料,怎样算做好了。比如,做一张邀请页;用你给的时间和路线;保存成文件,手机上能读,按钮能点。

然后回到成果里检查:文件能打开吗?信息对吗?需要改的地方有没有改到?这套来回配合,会比寻找一句“万能提示词”更有用。

下一章,我们再把背后的模型与 Harness分清楚。先知道这些部分怎样一起干活,遇到新名字时就不容易晕了。

想看更正式的解释,可以继续读 Hugging Face 的 Agent 入门,以及 Anthropic 对 Agent 工作循环的说明。这里的散步案例与练习叙事由 Agent.Space 原创。