AI Agent 是什麼?從回答問題到執行工作,該怎麼驗收?

當 AI 不只產生文字,還會使用工具或推進任務,驗收就需要包含動作本身。看答案對不對之外,也要確認它改了什麼、能不能追查。
先定義可做與不可做的事
例如可以整理來信並產生回覆草稿,但不能自行答應折扣;可以列出待更新資料,但不能刪除正式紀錄。把界線寫成可檢查的規則,比只要求「小心」有用。
選擇合適的自主程度
從單步任務開始,再逐步增加範圍。Anthropic 的人機團隊課程強調角色、共同目標與資訊存取;本站建議將這些概念落實成任務負責人與明確交付條件。
驗收完整工作鏈
檢查輸入是否正確、工具回覆是否被採用、失敗是否被回報,以及最後成果是否真的寫入指定位置。只收到「已完成」一句話,不足以證明任務完成。
讓流程可以停止與接手
設定執行次數或成本邊界,保留操作紀錄;資料矛盾、權限不足或外部服務失敗時,應停在可理解的位置。讓人能接手,比讓工具無限嘗試更有實際價值。
現在可以做的小練習
設計一個只整理、不寄出的合作邀約助理,列出三項成功條件和三項必須停下來的情況。