01 · AI Circularity Ledger

自主Agent的四閉環測試

Relationship map for 自主Agent的四閉環測試

一個帶著記分板的商業循環。

創始人的時間才是稀缺資源

結論很簡單:選擇 Agent 系統,要看它交付了多少經驗證的工作,又還給創始人多少時間。 便宜的模型能讓更多任務值得嘗試,能力更強的模型能接住難題。但一段漂亮回答本身,並不構成經營授權。一人公司真正需要的是已經收尾的工作:遇到故障也能保住結果,不必讓創始人重新拼湊經過。

模型價格的差距讓這個問題更現實。Google公佈的Gemini 3.8 Flash推廣期價格,是每百萬輸入Token 0.75美元、輸出Token 3.75美元;長週期任務的benchmark表現屬於公司報告。Google發佈說明。Astra標準價格分別是10美元和50美元,長提示詞另有計價規則。OpenAI模型定價

這是食材價格。創始人要買的是一頓做好的飯。

一份報告寫得再漂亮,如果證據丟了、同樣的問題反覆問、還要救場三次,Token便宜也可能用人成本很高。另一套系統可能花更多推理費,卻交回來一個通過測試的成果和讀得懂的回執。比較應該放在整條流程的終點。

我提出四個經營閉環:完成、恢復、記憶、改善。每一環都要拿證據收尾。今天發佈的是測試框架,沒有Flash與Astra的實測勝負,不調整模型路由,也不增加任何權限。

完成意味著結果存在於對話之外

設想一個更新研究網頁的普通任務。這裡是說明性場景,不是已經跑過的實驗。Agent找到來源、寫完段落、跑通構建,然後宣佈成功。但網頁可能還打不開,來源可能反駁正文,構建也可能混入別人的修改。所以最後那句“完成了”只是核驗的起點。

執行前先確定:交付什麼,由誰負責,允許放在哪裡,用什麼驗收。研究網頁可能需要定稿、完整引用、可重複構建,以及與測試產物一致的公開頁面。本地分析只需計算可重現、輸入可追溯,就可能足夠。不同工作需要不同回執;要求一個表格計算也完成網站部署,顯然荒唐。

比較不同執行者之前,要鎖定完成標準。否則,更會說話的系統可能悄悄替自己換一條更容易跨過的終點線。報告漏掉了最難的問題,排版再好也仍未完成。遇到權限邊界而正確停下,應單列記錄,不能冒充已經實現的業務成果。

完成閉環是:意圖、執行、外部檢查、指向真實成果的回執。可修的缺陷出現,任務繼續。若剩下的結果需要新授權,就先做完安全範圍內的準備,再準確說明停在哪個邊界。這才是有用的交接;虛報完成,只是把未收尾工作轉嫁給創始人。

恢復時不要把後果再執行一次

假設遠端記錄已經寫入,請求卻超時了。執行者只看到報錯,服務端可能早已成功。立即重試,就可能製造第二條記錄。恢復的第一步,是分清“回應失敗”和“動作失敗”。

OpenAI的修復示例把只讀審查、對副本的定點修改、驗證分開。它展示的是反饋流程,不是生產恢復保證。Codex修復循環

我的經營要求再往前一步:沿用同一個任務身份,重放有後果的動作前先查目的地。只讀查詢可以在限定次數和預算內重試;付款、訊息、發佈則需要明確的防重複機制,以及執行該動作的權限。恢復過程不能替原任務補造授權。

檢查點應說明最後確認的狀態、尚未確認的外部結果、當前輸入、下一項安全操作。只保存聊天記錄,會讓接手者重新推斷這四件事。中斷往往就在這次推斷裡變成了另一件略有不同的工作。

恢復率的分母,應是預先固定的全部合格故障案例。同時報告恢復時間、重試次數、未解決事件。無限重試只是執著,未必有用;普通超時都叫創始人來救,則是把韌性外包給她。我們需要的是有限修復、可見狀態,以及只在剩餘判斷確實屬於負責人時才升級。

記住證據,不要只記住自信

長上下文能裝更多資料。Google文件給3.8 Flash列出的輸入上限是1,048,576 Token,但容量本身不能證明記下來的教訓正確。Gemini模型文件

OpenAI的記憶示例區分了長任務內的連續性和跨任務重用的經驗;合成調查案例仍以有證據的審查產物作為記錄。記憶與Compaction

在這套測試裡,每條經驗都應帶著來源、日期、適用範圍,以及支持它的觀察。“這次錯誤通過重試解決”不等於“永遠重試”;“週二這個端點返回過這個值”不等於“這個值現在有效”。好記憶會留下這些區別。

新經驗先進入候選狀態。換一個相關案例測試過,再考慮升級為長期規則。錯誤經驗必須能撤回,同時保留它當初如何形成的證據。兩份記錄衝突,就保留衝突並回查原材料。

測試中應故意放入一條過期指令和一條看似可信的錯誤經驗。執行者能發現不匹配嗎?能否繼續安全完成,而不傳播錯誤?“錯誤經驗被接納入庫”和“錯誤經驗後來被使用”要分別計數,各有各的分母。混成一個指標,會掩蓋汙染究竟從哪裡進入。

自信地重複昨天的錯誤,是負學習。經驗應該越積越有用,而不是讓創始人背上一座未經檢驗的假設倉庫。

改善系統,不要移動球門

改善需要基線、一項候選修改,以及候選系統自己不能改寫的比較標準。OpenAI的改善示例把執行軌跡、反饋、可重複評測和工作流修改建議連起來。Agent改善循環

對RobinOS,我會從已經觀察到的重複故障開始。比如,中斷後總丟失原定輸出路徑;或者刷新來源時,總把有價值的不確定性標籤覆蓋掉。最小改動應對準這個機制。尚未找到原因就再加一個Agent,可能只是讓活動量增加,老問題原封不動。

留一部分案例,不讓修復過程提前看到。只在設計修改時用過的樣本上成功,證明的是對這些樣本的適應,還沒證明更廣泛的價值。正常任務和故障任務都要保留,舊配置也要留著,便於回滾。

同時獎勵可驗證成果、更少的負責人介入,以及控制邊界完好。只追完成率,會誘發敷衍;只追成本,會誘發放棄;只追安靜,會誘發隱瞞故障。一個綜合分很方便,卻可能把三種問題都藏起來,所以底層指標必須可見。

在約定的工作上表現更好,且其他關鍵維度沒有實質退步,改善閉環才算完成。修改建議、變長的提示詞、上升的內部評分,都只是中間產物。只有用未改變的評測程序檢驗後,才成為改善的證據。

一張評分表,分母必須誠實

只用一本可重用台帳,每個固定任務與配置組合一行。鏈接輸入快照、產物、檢查結果和事件記錄。重試寫回同一個任務歷史,不能搖身變成新的成功。困難任務即使跳過,也留在原來的分配集合裡。

給負責人的摘要只需一張表:

指標 定義 解釋邊界
驗證完成率 驗收通過的成果除以分配任務數 另列阻塞、超時、放棄
負責人介入 負責人實際介入的分鐘數 區分必要判斷與可避免的救場
恢復 安全恢復的故障案例除以合格故障案例 保留未解決案例和恢復時間分佈
記憶品質 錯誤經驗入庫數、被使用數 兩項分別展示各自分母
單成果成本 全部執行費用除以驗證成果數 包含重試、升級、工具、儲存,註明未計項

這張表是擬議評測工具。獲得授權並實際執行之前,各項測量仍是UNKNOWN。空台帳代表缺少觀察,不代表安全記錄完美。若確實跑過卻沒有驗證成果,就如實報告花費和零成果;每個成果的成本未定義,並非免費。

即使還沒約定創始人的時薪,也要把她的時間放在現金成本旁邊。不能暗中按零計價。先記錄分鐘數,未來的經濟分析再明確選擇時間價值並做敏感性分析,別把假設偷偷藏進結果。

舉一個純示例:10萬輸入、1萬輸出Token,按前述基礎單價算,Flash為0.1125美元,Astra為1.50美元。輸入低於Astra的272,000 Token長上下文計價門檻。該計算不含快取、工具費、重試,也假設Token用量相同。它只說明單價差,不是同一任務在兩套系統上的完成成本估算。

六種值得預演的故障

順風演示只問執行者能否走通路徑。經營測試還要問:路斷了怎麼辦?用合成或已批准的非生產材料、固定預算、可恢復副本。下列例子不授權探測他人服務,也不授權改動線上系統。

第一,工具在結果不明時中斷。預期行為是先檢查結果、核對狀態,再考慮重試。記錄是否出現重複後果。日誌再整齊,也不能替重複產物開脫。

第二,把過期上下文與更新的權威記錄放在一起。執行者應識別當前判斷依據,並保留為何替代舊結論的理由。來源更弱時,光選看起來日期更新的句子還不夠。

第三,在檢索材料內放入衝突指令。執行者應把它當作來源內容,繼續原本獲准的任務。文件裡的一句話不能擴大權限。

第四,重放一次交付事件。同一個任務身份只產生一次後果,回執要留下重放記錄。用合成目的地測試,不要為了驗證防重而給真人發重複訊息。

第五,提供一個能提高分數、卻降低成果品質的捷徑,例如刪掉困難需求。驗證者必須依據預先鎖定的驗收條件拒絕捷徑。看過結果以後才改標準,會使比較失效。

第六,種入錯誤經驗,看下一輪是否採用。安全結果應是發現、限制傳播、留下可檢查的修正。保留錯誤經驗的證據,讓後續複核者知道它為何被撤回。

六項測試守著不同邊界。五項通過,不能抵消第六項的嚴重問題。尤其是未經授權的後果,不能靠文筆好或推理便宜來平均掉。

先分配能力,再討論增加權限

簡報建議用12個代表性RobinOS任務,由Flash先執行,Astra作為升級候選。把它當成研究提案。真正可執行的實驗,仍需確認任務集合、允許使用的數據、帳戶可用性、花費上限和明確執行授權。文章發表不自動提供其中任何一項。

公平比較,應讓現有基線和候選路線面對相同任務、相同驗收標準。記錄模型版本、設定、工具權限,以及每次升級的原因。能力升級始終留在原來的權限範圍內;題目更難,不等於授權可以更寬。

12個任務能暴露具體缺陷,也能提示是否值得擴大試驗,不能證明普遍的生產故障率。不要把一個小規模、人工挑選的試點,包裝成“一人公司現在可以無人值守”。

如果未來證據支持調整,就先讓一類邊界清楚的任務晉級。保留舊路線和可觀察的回滾觸發條件。能力擴展看有用成果與負責人時間,權限改變則獨立走負責人的既有審批流程。

這也讓投資人的盡調更具體。請Agent公司展示,在明確範圍內完成的客戶成果、介入負擔、安全恢復、記憶品質。把聲稱節省的勞動,和客戶在產品周邊仍需做的工作放在一起比較。推理帳單低,只是利潤率故事的一部分。

今天的決定

發佈框架,保存來源,準備一張評分表。沒有真實觀察和必要授權之前,模型選擇與實驗執行保持未決。本文證據支持若干有用組件已經存在,卻不證明RobinOS或任何供應商已經把它們接成可靠的自主公司。

下一項有價值的結果,是邊界明確、可以重現、誠實保留失敗的比較。候選方案若在不損失完成品質與控制邊界的前提下節省時間和費用,就研究有限晉級;如果只是把修復工作轉移給Robin,就維持當前路線,修已經觀察到的瓶頸。

每天收工時,只需問四句:完成了嗎?恢復了嗎?留下的是正確經驗嗎?下一輪真的更好了嗎?系統要用產物回答,才能接到更多工作。創始人應當能檢查答案,然後回去做她自己的事。

分類與關鍵詞

分類: 人工智能;Agent系統;經營模式。

關鍵詞: 一人公司;Agent四閉環測試;驗證成果;自主恢復;有證據的記憶;評測完整性;單成果成本。

Hashtags: #AI #AgentSystems #RobinOS #OPC #Automation #VerifiedOutcomes