真正需要證明的是什麼?
需要證明的是特定版本在特定任務中的可觀察能力,不是「AI Agent」這個名稱。
把聲明拆成感知狀態、制定或修改計畫、選用工具、處理例外及停止五種行為。每一種行為都要有能由他人重跑的輸入與輸出;若只能看到最終答案,最多只能確認介面曾產生該答案。
如何留下證據: 保存原始聲明、版本、任務、環境、成功條件與逐步 trace。
聊天機器人與代理的界線在哪裡?
界線在系統是否能根據環境結果改變下一步,而不只生成回答或沿固定腳本前進。
聊天機器人可提出建議;workflow 可依預設分支呼叫工具;Agent 的較強證據是遇到未預排的結果後重新規劃、選擇替代工具並在目標達成或限制觸發時停止。能呼叫 API 本身不跨過這條界線。
如何留下證據: 記錄每一步由誰選擇、可用工具、分支來源與停止原因。
如何把展示效果和實際營運能力分開?
Demo 證明一次展示發生;營運能力還需看重跑、失敗率、人工負擔與版本一致性。
用相同輸入重跑後,再加入逾時、空資料、工具拒絕和權限不足。若展示版使用不同模型、較寬權限或人工補步,就要分成另一個環境,不能把成功率併入正式產品。
如何留下證據: 保存每次重跑的版本、延遲、失敗點、人工分鐘數和是否被接受。
為什麼區塊鏈與代幣必要性要分開評分?
共享帳本可能有必要,但產品仍未必需要發行自己的 Token。
先問是否有多個互不信任的參與方需要共同寫入或驗證狀態,再把自有 Token 替換成穩定幣、網路原生資產或訂閱制。只有替換後核心協調或保證機制無法運作,才能支持 Token 必要性。
如何留下證據: 各寫一個不用區塊鏈和不用自有 Token 的最小替代方案。
運算成本如何影響產品真實性?
成本不能證明 Agent 是否存在,但能揭露展示能否長期以同樣能力運作。
把模型、工具、RPC、重試、監控和人工覆核換算到「一個被接受的任務」。若產品必須靠未披露的人工處理或補貼才能維持宣稱的價格,能力結論仍可成立,但營運結論必須降級。
如何留下證據: 按任務保存 token、呼叫次數、失敗重試、人工時間與實際費率日期。
哪一類證據應有較高權重?
能直接連到受測版本和行為的材料權重最高。
可控制輸入的重跑、工具 trace、交易收據及具版本的 release 通常比行銷頁接近事實;但程式碼只證明 artefact 存在,不能單獨證明部署正在使用它。來源獨立性、時間接近度與可重做性需要分欄評估。
如何留下證據: 為每項來源標示它能證明和不能證明的範圍。
如何證明代理真的執行鏈上動作?
要把模型決策、政策核准、簽章身分、廣播與收據連成同一次執行。
區塊瀏覽器只顯示某個地址送出交易。要歸因給 Agent,trace 必須包含交易意圖或 calldata 的識別值,並能對到簽章者、交易雜湊和鏈上結果;人工確認應明確標在鏈中。
如何留下證據: 保存 trace ID、策略結果、簽章地址、hash、區塊與失敗 receipt。
審慎結論應該怎麼寫?
結論要同時寫出能力、適用範圍、信心與仍會改變判定的證據。
使用「已確認、部分支持、未證實、相互矛盾」等狀態,並注明版本、任務與截止日期。不要把資料缺口寫成欺詐,也不要把一個任務的成功推廣到所有資產、網路或市場。
如何留下證據: 結尾列出已確認事項、未知事項、限制與下一個可重做測試。
驗證工作簿
以下檢查卡把研究變成可重做紀錄。它們不產生投資建議,而是要求保存證據、反例、版本、限制與會改變結論的條件。
檢查 01|真正需要證明的是什麼 · 支持性測試
- 本輪做法
- 尋找最接近實際行為的支持證據,但不接受無法連回原始聲明的材料
- 應取得的證據
- 同一任務至少兩次可比對的決策與工具紀錄
- 會推翻判定的訊號
- 用產品名稱或一段順利影片代替行為證據
- 本題判定規則
- 按已觀察到的最低完整能力定級
檢查 02|聊天機器人與代理的界線在哪裡 · 支持性測試
- 本輪做法
- 尋找最接近實際行為的支持證據,但不接受無法連回原始聲明的材料
- 應取得的證據
- 工具選擇和改計畫的 trace 可回到環境觀察
- 會推翻判定的訊號
- 把長流程或自動送單直接稱為自主
- 本題判定規則
- 只對受測任務標示自主程度
檢查 03|如何把展示效果和實際營運能力分開 · 支持性測試
- 本輪做法
- 尋找最接近實際行為的支持證據,但不接受無法連回原始聲明的材料
- 應取得的證據
- 正式或等價環境的多次執行紀錄
- 會推翻判定的訊號
- 只保留成功案例或隱藏後台操作
- 本題判定規則
- Demo 與營運結論分欄書寫
檢查 04|為什麼區塊鏈與代幣必要性要分開評分 · 支持性測試
- 本輪做法
- 尋找最接近實際行為的支持證據,但不接受無法連回原始聲明的材料
- 應取得的證據
- 多方狀態需求與 Token 不可替代功能分別有證據
- 會推翻判定的訊號
- 以支付加密貨幣或發放空投同時證明兩者
- 本題判定規則
- 產出兩個獨立結論
檢查 05|運算成本如何影響產品真實性 · 支持性測試
- 本輪做法
- 尋找最接近實際行為的支持證據,但不接受無法連回原始聲明的材料
- 應取得的證據
- 被接受任務的完整成本分解
- 會推翻判定的訊號
- 只引用每百萬 token 單價
- 本題判定規則
- 把能力真實性和經濟持續性分開判定
檢查 06|哪一類證據應有較高權重 · 支持性測試
- 本輪做法
- 尋找最接近實際行為的支持證據,但不接受無法連回原始聲明的材料
- 應取得的證據
- 版本、部署與觀察結果可互相對齊
- 會推翻判定的訊號
- 用 commit 數或社群聲量補齊缺失鏈條
- 本題判定規則
- 結論權重不得高於最弱的關鍵連結
檢查 07|如何證明代理真的執行鏈上動作 · 支持性測試
- 本輪做法
- 尋找最接近實際行為的支持證據,但不接受無法連回原始聲明的材料
- 應取得的證據
- 單一執行 ID 串起決策和鏈上收據
- 會推翻判定的訊號
- 看到 hash 就宣稱 AI 自主交易
- 本題判定規則
- 缺一關鍵連結時只確認交易存在
檢查 08|審慎結論應該怎麼寫 · 支持性測試
- 本輪做法
- 尋找最接近實際行為的支持證據,但不接受無法連回原始聲明的材料
- 應取得的證據
- 狀態可回溯到具日期的證據列
- 會推翻判定的訊號
- 用總分掩蓋重大缺口或推測動機
- 本題判定規則
- 在證據變更時可局部更新結論
檢查 01|真正需要證明的是什麼 · 反例測試
- 本輪做法
- 在關閉這一列之前,以變體、工具失敗或替代路徑嘗試推翻暫定結論
- 應取得的證據
- 同一任務至少兩次可比對的決策與工具紀錄
- 會推翻判定的訊號
- 用產品名稱或一段順利影片代替行為證據
- 本題判定規則
- 按已觀察到的最低完整能力定級
檢查 02|聊天機器人與代理的界線在哪裡 · 反例測試
- 本輪做法
- 在關閉這一列之前,以變體、工具失敗或替代路徑嘗試推翻暫定結論
- 應取得的證據
- 工具選擇和改計畫的 trace 可回到環境觀察
- 會推翻判定的訊號
- 把長流程或自動送單直接稱為自主
- 本題判定規則
- 只對受測任務標示自主程度
檢查 03|如何把展示效果和實際營運能力分開 · 反例測試
- 本輪做法
- 在關閉這一列之前,以變體、工具失敗或替代路徑嘗試推翻暫定結論
- 應取得的證據
- 正式或等價環境的多次執行紀錄
- 會推翻判定的訊號
- 只保留成功案例或隱藏後台操作
- 本題判定規則
- Demo 與營運結論分欄書寫
檢查 04|為什麼區塊鏈與代幣必要性要分開評分 · 反例測試
- 本輪做法
- 在關閉這一列之前,以變體、工具失敗或替代路徑嘗試推翻暫定結論
- 應取得的證據
- 多方狀態需求與 Token 不可替代功能分別有證據
- 會推翻判定的訊號
- 以支付加密貨幣或發放空投同時證明兩者
- 本題判定規則
- 產出兩個獨立結論
檢查 05|運算成本如何影響產品真實性 · 反例測試
- 本輪做法
- 在關閉這一列之前,以變體、工具失敗或替代路徑嘗試推翻暫定結論
- 應取得的證據
- 被接受任務的完整成本分解
- 會推翻判定的訊號
- 只引用每百萬 token 單價
- 本題判定規則
- 把能力真實性和經濟持續性分開判定
檢查 06|哪一類證據應有較高權重 · 反例測試
- 本輪做法
- 在關閉這一列之前,以變體、工具失敗或替代路徑嘗試推翻暫定結論
- 應取得的證據
- 版本、部署與觀察結果可互相對齊
- 會推翻判定的訊號
- 用 commit 數或社群聲量補齊缺失鏈條
- 本題判定規則
- 結論權重不得高於最弱的關鍵連結
檢查 07|如何證明代理真的執行鏈上動作 · 反例測試
- 本輪做法
- 在關閉這一列之前,以變體、工具失敗或替代路徑嘗試推翻暫定結論
- 應取得的證據
- 單一執行 ID 串起決策和鏈上收據
- 會推翻判定的訊號
- 看到 hash 就宣稱 AI 自主交易
- 本題判定規則
- 缺一關鍵連結時只確認交易存在
檢查 08|審慎結論應該怎麼寫 · 反例測試
- 本輪做法
- 在關閉這一列之前,以變體、工具失敗或替代路徑嘗試推翻暫定結論
- 應取得的證據
- 狀態可回溯到具日期的證據列
- 會推翻判定的訊號
- 用總分掩蓋重大缺口或推測動機
- 本題判定規則
- 在證據變更時可局部更新結論
常見問題
會使用大型語言模型就算 Agent 嗎?
不算。模型是元件;代理性仍要由任務中的選擇、工具、回饋、重試與停止行為證明。
沒有公開原始碼是否一定未證實?
不是。受控 Demo、具版本 trace 和外部可核對結果也能提供證據,只是可重做範圍會較窄。
何時需要重做整套驗證?
模型、工具、權限、合約或主要 workflow 改版時應重做;小改仍要確認受影響的鏈條。
本檔案使用的來源
- AI x Crypto: Exploring Use Cases and Possibilities — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
- Building effective agents — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
- Measuring AI agent autonomy in practice — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
- Trustworthy agents in practice — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
- OWASP Top 10 for Agentic Applications — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
- NIST AI 600-1: Generative AI Profile — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
- Ethereum JSON-RPC API — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
- AI agent quickstarts for Safe Smart Account — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
- Viewing activity and data for a repository — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
- OpenAI Evals — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
