測試中哪些條件必須保持一致?
任務目標、輸入資料、工具集合、權限、版本和成功判準必須一致。
如果 A 次允許人工提示、B 次更換模型或資料,路徑差異就不能歸因於自主性。隨機性可保留,但要記錄參數並進行足夠重跑,才能分辨偶然輸出和穩定行為。
如何留下證據: 保存環境快照、seed 或採樣設定、工具清單與人工訊息。
怎麼辨認一般聊天機器人?
它主要回傳文字,並不在環境中取得結果後自行推進任務。
即使回答包含完整步驟,也可能只是建議。檢查是否真的產生工具請求、讀取回傳、維持狀態,以及輸出失敗時是否能採取下一個行動。
如何留下證據: 區分自然語言建議、結構化提案與已執行動作。
腳本或 workflow 會留下什麼特徵?
同樣輸入通常走固定順序,分支由預先寫好的條件而非即時規劃決定。
固定流程不一定差,尤其金融動作常更安全。辨認重點是查看工具順序是否始終相同、未知情況是否直接失敗,以及所謂推理是否只填入既定欄位。
如何留下證據: 保存流程圖、分支條件和三次執行的工具序列。
哪些行為會增加代理性的證據?
根據新觀察選工具、修正計畫、提出關鍵澄清並自行停止,會增加證據。
還要確認這些行為不是人工或隱藏 orchestrator 完成。測試一個原 Demo 沒出現的變體,再故意讓首選工具失敗;若系統能說明替代路徑且結果一致,證據比順利案例更強。
如何留下證據: 保存觀察→決策→工具→結果的因果鏈與操作者。
如何分級而不製造虛假精確度?
使用描述性等級和任務範圍,不把有限樣本換算成看似精準的百分比。
可分為回答型、固定 workflow、具條件調整、有限自主和高自主,但每級都列已觀察行為與限制。安全性、品質和自主性分開報告;較自主不代表較可靠。
如何留下證據: 為每級列正面證據、反例、未知和適用任務。
驗證工作簿
以下檢查卡把研究變成可重做紀錄。它們不產生投資建議,而是要求保存證據、反例、版本、限制與會改變結論的條件。
檢查 01|測試中哪些條件必須保持一致 · 支持性測試
- 本輪做法
- 尋找最接近實際行為的支持證據,但不接受無法連回原始聲明的材料
- 應取得的證據
- 多次執行共享可比條件
- 會推翻判定的訊號
- 測試途中更換權限或補充未記錄提示
- 本題判定規則
- 不可比執行不納入同一判定
檢查 02|怎麼辨認一般聊天機器人 · 支持性測試
- 本輪做法
- 尋找最接近實際行為的支持證據,但不接受無法連回原始聲明的材料
- 應取得的證據
- 環境中有可核對的狀態改變
- 會推翻判定的訊號
- 把「我已完成」當完成證明
- 本題判定規則
- 沒有外部效果時只標示回答能力
檢查 03|腳本或 workflow 會留下什麼特徵 · 支持性測試
- 本輪做法
- 尋找最接近實際行為的支持證據,但不接受無法連回原始聲明的材料
- 應取得的證據
- 固定分支可由程式或設定重現
- 會推翻判定的訊號
- 因流程很長就稱為 Agent
- 本題判定規則
- 按實際可變決策範圍分類
檢查 04|哪些行為會增加代理性的證據 · 支持性測試
- 本輪做法
- 尋找最接近實際行為的支持證據,但不接受無法連回原始聲明的材料
- 應取得的證據
- 未預排變體中的適當改計畫
- 會推翻判定的訊號
- 把隨機改變誤認為有目的規劃
- 本題判定規則
- 行為須同時合理、可重做且可歸因
檢查 05|如何分級而不製造虛假精確度 · 支持性測試
- 本輪做法
- 尋找最接近實際行為的支持證據,但不接受無法連回原始聲明的材料
- 應取得的證據
- 等級可由讀者回到原始 trace
- 會推翻判定的訊號
- 用 87 分掩蓋樣本與權限差異
- 本題判定規則
- 採符合最弱關鍵條件的等級
常見問題
固定 workflow 是否一定比 Agent 差?
不是。可預測且易限制的流程在高風險任務中可能更合適。
一次工具失敗後重試算規劃嗎?
若只是固定重試規則不算;需看是否根據錯誤選擇新的可行路徑。
自主等級能跨任務沿用嗎?
不能。研究任務的表現不能直接推廣到交易、客服或程式開發。
本檔案使用的來源
- Building effective agents — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
- Measuring AI agent autonomy in practice — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
- Trustworthy agents in practice — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
- OpenAI Agents SDK — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
- OpenAI Evals — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
- NIST AI 600-1: Generative AI Profile — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
- OWASP LLM08: Excessive Agency — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
