跳到正文
Agent.SpaceAgent 入門打開 Agent.Space
Agent 入門第 1 章01 / 08

AI Agent 是什麼?從聊天到動手做事

約 7 分鐘閱讀

讀完這一章,你會分清聊天與 Agent 的工作方式,理解工具、環境、記憶和 Skills 怎麼互相配合。

你可能已經用過 ChatGPT:在輸入框問一句,AI 回你一段解釋、一封 email,或是晚餐吃什麼的建議。聊著聊著,你會想:建議是不錯,接下來的事,也能請它幫我做嗎?

比如,週末想約朋友散步。與其讓集合時間淹沒在群組訊息裡,你決定做一張邀請網頁。這下,你要的成果很具體:一個打得開、改得動的頁面。

Agent,中文常叫AI 代理。在這份教學裡,它指的是能圍繞一個目標,呼叫工具、觀察結果,並在工作環境裡繼續推進任務的 AI 系統。你告訴它想做什麼,它會判斷下一步該做什麼,然後實際動手。

從聊清楚,到做出來

一樣是這張邀請頁,來看看兩種用法:

你想怎麼合作可以怎麼說這次期待的結果
先聊一聊「一張散步邀請頁應該寫些什麼?」一份建議,幫你想清楚內容
交給 Agent 做「請做一張散步邀請頁,存成檔案,檢查後告訴我怎麼打開。」實際的網頁檔案,以及完成情況

聊天很適合解釋、討論和出主意。Agent 的工作方式,則是把「接著做下去」也交給 AI:它可能先問集合時間,再寫檔案、檢查按鈕,發現問題就繼續修改。你不用一條一條教它「現在打開檔案」「現在改第三行」。

左邊的聊天視窗給出建議,右邊的任務經過工具操作,留下檔案和可以打開的邀請網頁。
同一個想法,可以先聊清楚,也可以交給 Agent 動手。圖裡比較的是兩種工作方式。

ChatGPT 是產品名稱,Chat 和 Agent 指的是這裡討論的工作方式。一個產品可以同時支援兩種,例如 ChatGPT 也提供 Agent 模式。看到聊天框,不代表它只能聊天;有搜尋或產生圖片的功能,也不表示每次問答都在持續執行一項任務。

判斷的時候,留意它這次能做什麼、實際做了什麼,以及結果放在哪裡。

工具和環境:它怎麼動手,在哪裡動手

AI 寫出「我已經做好網頁了」,檔案可不會自己冒出來。真的要把內容寫進去,得靠工具。

工具讓 AI 能執行具體的動作。例如:

  • 讀寫檔案:讀取現有的資料,把邀請頁存成 index.html,再修改集合時間。
  • 使用瀏覽器:查資料,或在具備相應能力時打開頁面、檢查顯示效果。
  • 執行程式:處理表格、計算數字,或檢查網頁裡的錯誤。

這些動作發生的地方,就是它的工作環境。可以是你自己的電腦、雲端電腦,也可以是已經接好的瀏覽器或企業系統。不同 Agent 拿到的工具和存取權限不同,能做的事也就不同。

在 Agent.Space,我們把這次的專案放進一個雲端 Workspace:你在瀏覽器裡提要求,Agent 在雲端操作檔案。第一次做邀請頁,不必先在自己的電腦上裝一整套開發工具。至於檔案怎麼儲存、下次怎麼接著做,第 4 章會帶你認路。

持續工作:做一步,看一步

Agent 通常不是把計畫講完就收工。它會依照每一步的實際結果,決定接下來做什麼:

  1. 看目標和資料:邀請誰?幾點集合?還缺什麼資訊?
  2. 選動作,呼叫工具:建立網頁,寫入活動內容。
  3. 看執行結果:檔案有存成功嗎?檢查有沒有發現問題?
  4. 繼續或調整:補上漏掉的地點,修好按鈕;需要你決定時,回來問你。
圍繞著模型,理解要求、呼叫工具、觀察結果和調整行動形成一個循環,最後產出網頁。
動手、看結果、再調整。一次任務裡,這個過程可能重複很多輪。

這就是「持續工作」的意思:圍繞同一個目標,把幾步操作接著做完。比較長的任務也可以留下檔案和進度,在支援接續的環境裡繼續。

它還是會有停下來的時候:事情做完了、需要你補充資訊、碰到權限或額度限制,或是執行失敗。能持續推進,不代表每個程式都永遠在線上。回來時先看目前的狀態,再決定下一步。

記憶和經驗:下次少從頭解釋

你剛說過「語氣輕鬆一點」,它後面寫的文案就變得隨興了。這通常是因為這句話還在它目前的上下文裡,也就是這次處理任務時看得到的對話、資料和工具結果。

那隔幾天、換一段新對話,它還記得嗎?這就要看資訊有沒有被存下來,並在需要時重新讀到。

記憶可以想成留給以後用的筆記。有些 Agent 產品會依設定儲存偏好、回饋或專案知識,再在後續任務裡使用,例如 Claude Code 的記憶機制。具體記住什麼、放在哪裡、哪些對話用得到,要看各家產品。

就我們的邀請頁來說,一個好懂的做法是請 Agent 把已經確認的安排寫進專案筆記:活動適合新手、走累了可以休息、集合地點已經確定。下次繼續時,先讓它讀這份筆記,就省掉一輪重新交代。在 Agent.Space 裡,Workspace 的檔案會一直保存,換一段對話、換一個 Agent 也讀得到,所以「寫成檔案」是最可靠的記法。

經驗還可以再多走一步:把這次試出來的好做法留下來。比如,你發現集合時間埋在長段落裡很容易被漏看;移到標題下面以後,朋友一眼就找到了。這時可以把「關鍵資訊放前面,完成後用手機寬度檢查」記下來,給下一張活動頁參考。

這類累積靠的是儲存並再次使用資訊,不等於每聊一次就重新訓練了模型。筆記裡的決定也可能過時,重要的內容還是要確認;新的 Agent 也不會自動知道其他所有對話。

Skills:把好做法裝進一本小手冊

如果你常做活動頁,就沒必要每次從零交代整套流程。這時可以把穩定又好用的做法整理成一個 Skill,複數寫作 Skills,通常譯作「技能」。

把它想成一本給 Agent 看的做事手冊:什麼時候用、照什麼步驟做、怎麼檢查。假設有一本「活動邀請頁」手冊,裡面可能寫著:先確認時間地點,再安排內容,最後檢查手機排版和參加按鈕。它還可以附上範本、範例,或幫忙執行的小程式。

在支援 Skills 的產品裡,Agent 可以在適合的任務中讀這本手冊,你也可以明確指定要用哪個 Skill。常見的 Agent Skills 格式用 SKILL.md 檔案存放說明;第一次只要懂它的用途,不必馬上學會寫這個檔案。

在 Agent.Space,左側欄的「Plugin」就是放這類手冊和工具的地方:可以搜尋、安裝別人整理好的 Skills,也可以連接其他服務。裝一次,Workspace 裡的 Agent 都能用。做網頁用到的「網頁製作」能力,就是內建在裡面的一個 Plugin。

Agent 的工作台一側是記錄活動事實的筆記,另一側是寫有步驟和檢查項目的操作手冊。
專案筆記留下已確認的事,Skill 留下可重複使用的做法。需要時,Agent 再把它們讀回來。

用邀請頁把三個詞分開:工具負責把檔案改掉;記憶可以存下「這次活動適合新手」;Skill提供「做活動頁時先確認哪些資訊」的方法。Skill 裡的說明可能會指導工具操作,但實際能用哪些工具、能存取哪些檔案,還是由目前的環境和權限決定。

所以,Agent 搭配記憶和 Skills 可以愈來愈順手,但這些能力需要相應的支援。做你的第一個網頁,先把任務交代清楚就能開始。

第一次合作,你來拿主意

你仍然是那個知道「為什麼要辦這場活動」的人。Agent 可能把「隨便走走」寫得像體能測驗,你補一句「大家只是想散散心,不用管配速」,它就有了更明確的方向。

第一次交代任務,把三件事說清楚就好:想得到什麼、手邊有什麼資料、怎樣才算做好。比如:做一張邀請頁;用你給的時間和路線;存成檔案,手機上讀得清楚,按鈕點得動。

接著回到成果裡檢查:檔案打得開嗎?資訊對嗎?要改的地方改到了沒?這樣來回配合,會比尋找一句「萬用 Prompt」更有用。

下一章,我們再把背後的模型與 Harness分清楚。先知道這些部分怎麼分工合作,之後碰到新名字就不容易暈頭轉向。

想看更正式的解釋,可以接著讀 Hugging Face 的 Agent 入門,以及 Anthropic 對 Agent 工作循環的說明。這裡的散步案例和練習情節都由 Agent.Space 原創。