真正需要證明的是什麼?

需要證明的是特定版本在特定任務中的可觀察能力,不是「AI Agent」這個名稱。

把聲明拆成感知狀態、制定或修改計畫、選用工具、處理例外及停止五種行為。每一種行為都要有能由他人重跑的輸入與輸出;若只能看到最終答案,最多只能確認介面曾產生該答案。

如何留下證據: 保存原始聲明、版本、任務、環境、成功條件與逐步 trace。

聊天機器人與代理的界線在哪裡?

界線在系統是否能根據環境結果改變下一步,而不只生成回答或沿固定腳本前進。

聊天機器人可提出建議;workflow 可依預設分支呼叫工具;Agent 的較強證據是遇到未預排的結果後重新規劃、選擇替代工具並在目標達成或限制觸發時停止。能呼叫 API 本身不跨過這條界線。

如何留下證據: 記錄每一步由誰選擇、可用工具、分支來源與停止原因。

如何把展示效果和實際營運能力分開?

Demo 證明一次展示發生;營運能力還需看重跑、失敗率、人工負擔與版本一致性。

用相同輸入重跑後,再加入逾時、空資料、工具拒絕和權限不足。若展示版使用不同模型、較寬權限或人工補步,就要分成另一個環境,不能把成功率併入正式產品。

如何留下證據: 保存每次重跑的版本、延遲、失敗點、人工分鐘數和是否被接受。

為什麼區塊鏈與代幣必要性要分開評分?

共享帳本可能有必要,但產品仍未必需要發行自己的 Token。

先問是否有多個互不信任的參與方需要共同寫入或驗證狀態,再把自有 Token 替換成穩定幣、網路原生資產或訂閱制。只有替換後核心協調或保證機制無法運作,才能支持 Token 必要性。

如何留下證據: 各寫一個不用區塊鏈和不用自有 Token 的最小替代方案。

運算成本如何影響產品真實性?

成本不能證明 Agent 是否存在,但能揭露展示能否長期以同樣能力運作。

把模型、工具、RPC、重試、監控和人工覆核換算到「一個被接受的任務」。若產品必須靠未披露的人工處理或補貼才能維持宣稱的價格,能力結論仍可成立,但營運結論必須降級。

如何留下證據: 按任務保存 token、呼叫次數、失敗重試、人工時間與實際費率日期。

哪一類證據應有較高權重?

能直接連到受測版本和行為的材料權重最高。

可控制輸入的重跑、工具 trace、交易收據及具版本的 release 通常比行銷頁接近事實;但程式碼只證明 artefact 存在,不能單獨證明部署正在使用它。來源獨立性、時間接近度與可重做性需要分欄評估。

如何留下證據: 為每項來源標示它能證明和不能證明的範圍。

如何證明代理真的執行鏈上動作?

要把模型決策、政策核准、簽章身分、廣播與收據連成同一次執行。

區塊瀏覽器只顯示某個地址送出交易。要歸因給 Agent,trace 必須包含交易意圖或 calldata 的識別值,並能對到簽章者、交易雜湊和鏈上結果;人工確認應明確標在鏈中。

如何留下證據: 保存 trace ID、策略結果、簽章地址、hash、區塊與失敗 receipt。

審慎結論應該怎麼寫?

結論要同時寫出能力、適用範圍、信心與仍會改變判定的證據。

使用「已確認、部分支持、未證實、相互矛盾」等狀態,並注明版本、任務與截止日期。不要把資料缺口寫成欺詐,也不要把一個任務的成功推廣到所有資產、網路或市場。

如何留下證據: 結尾列出已確認事項、未知事項、限制與下一個可重做測試。

驗證工作簿

以下檢查卡把研究變成可重做紀錄。它們不產生投資建議,而是要求保存證據、反例、版本、限制與會改變結論的條件。

01

檢查 01|真正需要證明的是什麼 · 支持性測試

本輪做法
尋找最接近實際行為的支持證據,但不接受無法連回原始聲明的材料
應取得的證據
同一任務至少兩次可比對的決策與工具紀錄
會推翻判定的訊號
用產品名稱或一段順利影片代替行為證據
本題判定規則
按已觀察到的最低完整能力定級
02

檢查 02|聊天機器人與代理的界線在哪裡 · 支持性測試

本輪做法
尋找最接近實際行為的支持證據,但不接受無法連回原始聲明的材料
應取得的證據
工具選擇和改計畫的 trace 可回到環境觀察
會推翻判定的訊號
把長流程或自動送單直接稱為自主
本題判定規則
只對受測任務標示自主程度
03

檢查 03|如何把展示效果和實際營運能力分開 · 支持性測試

本輪做法
尋找最接近實際行為的支持證據,但不接受無法連回原始聲明的材料
應取得的證據
正式或等價環境的多次執行紀錄
會推翻判定的訊號
只保留成功案例或隱藏後台操作
本題判定規則
Demo 與營運結論分欄書寫
04

檢查 04|為什麼區塊鏈與代幣必要性要分開評分 · 支持性測試

本輪做法
尋找最接近實際行為的支持證據,但不接受無法連回原始聲明的材料
應取得的證據
多方狀態需求與 Token 不可替代功能分別有證據
會推翻判定的訊號
以支付加密貨幣或發放空投同時證明兩者
本題判定規則
產出兩個獨立結論
05

檢查 05|運算成本如何影響產品真實性 · 支持性測試

本輪做法
尋找最接近實際行為的支持證據,但不接受無法連回原始聲明的材料
應取得的證據
被接受任務的完整成本分解
會推翻判定的訊號
只引用每百萬 token 單價
本題判定規則
把能力真實性和經濟持續性分開判定
06

檢查 06|哪一類證據應有較高權重 · 支持性測試

本輪做法
尋找最接近實際行為的支持證據,但不接受無法連回原始聲明的材料
應取得的證據
版本、部署與觀察結果可互相對齊
會推翻判定的訊號
用 commit 數或社群聲量補齊缺失鏈條
本題判定規則
結論權重不得高於最弱的關鍵連結
07

檢查 07|如何證明代理真的執行鏈上動作 · 支持性測試

本輪做法
尋找最接近實際行為的支持證據,但不接受無法連回原始聲明的材料
應取得的證據
單一執行 ID 串起決策和鏈上收據
會推翻判定的訊號
看到 hash 就宣稱 AI 自主交易
本題判定規則
缺一關鍵連結時只確認交易存在
08

檢查 08|審慎結論應該怎麼寫 · 支持性測試

本輪做法
尋找最接近實際行為的支持證據,但不接受無法連回原始聲明的材料
應取得的證據
狀態可回溯到具日期的證據列
會推翻判定的訊號
用總分掩蓋重大缺口或推測動機
本題判定規則
在證據變更時可局部更新結論
09

檢查 01|真正需要證明的是什麼 · 反例測試

本輪做法
在關閉這一列之前,以變體、工具失敗或替代路徑嘗試推翻暫定結論
應取得的證據
同一任務至少兩次可比對的決策與工具紀錄
會推翻判定的訊號
用產品名稱或一段順利影片代替行為證據
本題判定規則
按已觀察到的最低完整能力定級
10

檢查 02|聊天機器人與代理的界線在哪裡 · 反例測試

本輪做法
在關閉這一列之前,以變體、工具失敗或替代路徑嘗試推翻暫定結論
應取得的證據
工具選擇和改計畫的 trace 可回到環境觀察
會推翻判定的訊號
把長流程或自動送單直接稱為自主
本題判定規則
只對受測任務標示自主程度
11

檢查 03|如何把展示效果和實際營運能力分開 · 反例測試

本輪做法
在關閉這一列之前,以變體、工具失敗或替代路徑嘗試推翻暫定結論
應取得的證據
正式或等價環境的多次執行紀錄
會推翻判定的訊號
只保留成功案例或隱藏後台操作
本題判定規則
Demo 與營運結論分欄書寫
12

檢查 04|為什麼區塊鏈與代幣必要性要分開評分 · 反例測試

本輪做法
在關閉這一列之前,以變體、工具失敗或替代路徑嘗試推翻暫定結論
應取得的證據
多方狀態需求與 Token 不可替代功能分別有證據
會推翻判定的訊號
以支付加密貨幣或發放空投同時證明兩者
本題判定規則
產出兩個獨立結論
13

檢查 05|運算成本如何影響產品真實性 · 反例測試

本輪做法
在關閉這一列之前,以變體、工具失敗或替代路徑嘗試推翻暫定結論
應取得的證據
被接受任務的完整成本分解
會推翻判定的訊號
只引用每百萬 token 單價
本題判定規則
把能力真實性和經濟持續性分開判定
14

檢查 06|哪一類證據應有較高權重 · 反例測試

本輪做法
在關閉這一列之前,以變體、工具失敗或替代路徑嘗試推翻暫定結論
應取得的證據
版本、部署與觀察結果可互相對齊
會推翻判定的訊號
用 commit 數或社群聲量補齊缺失鏈條
本題判定規則
結論權重不得高於最弱的關鍵連結
15

檢查 07|如何證明代理真的執行鏈上動作 · 反例測試

本輪做法
在關閉這一列之前,以變體、工具失敗或替代路徑嘗試推翻暫定結論
應取得的證據
單一執行 ID 串起決策和鏈上收據
會推翻判定的訊號
看到 hash 就宣稱 AI 自主交易
本題判定規則
缺一關鍵連結時只確認交易存在
16

檢查 08|審慎結論應該怎麼寫 · 反例測試

本輪做法
在關閉這一列之前,以變體、工具失敗或替代路徑嘗試推翻暫定結論
應取得的證據
狀態可回溯到具日期的證據列
會推翻判定的訊號
用總分掩蓋重大缺口或推測動機
本題判定規則
在證據變更時可局部更新結論

常見問題

會使用大型語言模型就算 Agent 嗎?

不算。模型是元件;代理性仍要由任務中的選擇、工具、回饋、重試與停止行為證明。

沒有公開原始碼是否一定未證實?

不是。受控 Demo、具版本 trace 和外部可核對結果也能提供證據,只是可重做範圍會較窄。

何時需要重做整套驗證?

模型、工具、權限、合約或主要 workflow 改版時應重做;小改仍要確認受影響的鏈條。

本檔案使用的來源

  1. AI x Crypto: Exploring Use Cases and Possibilities — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
  2. Building effective agents — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
  3. Measuring AI agent autonomy in practice — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
  4. Trustworthy agents in practice — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
  5. OWASP Top 10 for Agentic Applications — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
  6. NIST AI 600-1: Generative AI Profile — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
  7. Ethereum JSON-RPC API — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
  8. AI agent quickstarts for Safe Smart Account — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
  9. Viewing activity and data for a repository — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
  10. OpenAI Evals — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。