01 · AI Circularity Ledger

三個Agent工作日,仍然需要創始人

Relationship map for 三個Agent工作日,仍然需要創始人

一個帶著記分板的商業循環。

三個工作日,首先只是產能主張

結論很簡單:每個人類工作日對應三個Agent工作日,只有在它交付可驗證成果、並減少創始人打擾時,才算經營槓桿。 OpenAI Research披露,截至8月中旬,團隊每個人類工作日使用約3.1個Agent工作日。代碼與實驗增加,內部技術支持需求下降;與此同時,高層規劃仍只佔Agent輸出的一小部分,而且超過一半成功的4–8小時任務仍需要人工介入。OpenAI研究證據

這兩組證據必須放在一起讀。勞動倍數是真實的,自主運行仍未完成。一人公司可以買到遠多於創始人時間的機器工時,創始人卻可能繼續擔任調度員、異常處理員、審校員和記憶維修工。

真正的問題不是“我能同時運行多少Agent”,而是系統每消耗一小時創始人注意力,究竟能交付多少通過驗收的成果,同時不犧牲證據、權限和恢復能力。

本文把問題收成一個十任務實驗。今天不填寫任何成績,記分表刻意保持空白。發佈本文不改變模型路由、付費API預算或生產權限。只有固定任務、固定檢查與真實憑證出現後,實驗才成為證據。

產出增加,協調成本也可能上升

Agent勞動容易統計:每個會話都有時長、Token和工具調用。協調負擔則藏在記錄之間。模型可以寫出更多代碼,也可以同時製造更多復核隊列、含糊交接和半成品。每次中斷後若仍要創始人重建意圖,機器產出雖然增加,經營槓桿並沒有增加。

OpenAI的數據提供了罕見的拆分。Agent使用與更多實驗、更少內部支持需求相關,支持真實生產率假設;長任務仍經常需要人工介入,說明“成功任務”內部也可能包含昂貴的創始人修復。完成與獨立是兩項指標。

一人公司最稀缺的是負責人不被打斷的判斷時間。五次短介入即使合計只有二十分鐘,也可能毀掉整個上午。因此實驗既要記錄主動介入分鐘,也要記錄打斷次數。前者衡量勞動,後者衡量注意力碎片化。

流暢的最終回復不是充分證明。證明對象應是通過驗收的產物,並與輸入、權限、檢查和目的地相連。對話消失後,這條鏈仍應可審計。

按邊際價值分配模型

Astra公開評測提示了合理角色。OpenAI報告OSWorld為72.6%,5.6 Sol為65.7%,耗時約少47%;Terminal-Bench為57.9%對37.3%;DeepSWE則接近得多,為74.1%對72.7%。Astra發佈與評測。標準Token價格是Sol的2.5倍。OpenAI API定價

這些數據支持一個路由假設,而不是全局替換。任務明確、檢查可確定時,Sol繼續做日常執行;工作跨文件、意圖模糊、工具失敗或首個執行者無法恢復時,再交給Astra。靜默錯誤的代價高於復核成本時,才增加最終復核。

十任務比較至少保留三條路線:Sol獨立完成;Sol先做、Astra接收有邊界的救援包;確定性檢查通過後,Astra僅做最終復核。三條路線必須使用相同驗收標準,並記錄誰完成任務、佔用了多少Robin注意力,以及所有嘗試的完整成本。只比Token單價,只能回答採購問題,回答不了經營問題。

執行前凍結終點

每個任務開始時,應有一個交付物、一個目的地、一份權限邊界和一組簡短驗收檢查。“優化網站”太有彈性;“修正四語canonical,通過SEO檢查並驗證公開路由,不修改DNS”才可驗證。

終點必須在模型看到任務前凍結,否則更會說話的執行者可以把成功重新定義成自己剛好做完的部分。憑證要指向具體產物、commit或不可變文件哈希、測試、公開或本地驗證,以及仍然超出權限的邊界。

在權限門口正確停下是合格行為,卻不等於業務成果已經完成。應單獨記錄安全邊界事件,並衡量執行者在升級前是否已完成全部安全準備。安全與價值因此保持在兩條坐標軸上。

OpenAI的迭代修復示例採用“檢查目標、在副本上做聚焦修改、驗證結果”的流程。Codex修復閉環。十任務實驗應把這種紀律用於每個任務,即使第一版看起來已經很有說服力。

恢復能力是產品的一部分

長任務會以普通方式失敗:遠程寫入後進程超時;編輯期間來源改變;本地構建通過、部署失敗;第二個Agent接手的摘要漏掉真正驗收條件。

恢復的第一步是確認最後一個已知狀態,以及哪一步不會重複後果。沒有收到回應,並不能證明動作失敗。再次發佈、發消息、付款或遙距寫入前,必須先檢查目的地,或依賴冪等記錄。只讀獲取可以有限重試;有後果的動作需要更強的防重複機制。

交給Astra的救援包應包含原任務身份、凍結的終點、允許範圍、已確認產物、實際故障、嘗試過的修復和下一項安全檢查。不要加入對首個模型為何失敗的故事。證據幫助救援,信心不會。

只在適用故障上計算恢復率,同時記錄安全恢復、未解決案例、恢復時間和重複後果。最終成功卻重複了遙距動作,不能算安全恢復;每個普通超時都交給Robin,則是把韌性外包給創始人。

驗證必須在模型之外

產出內容的模型可以解釋自己為何認為結果正確,這些解釋適合診斷,不能成為唯一驗收。

檢查應能跨模型復用:Schema驗證、測試、文件哈希、構建結果、路由狀態、內容canary、對賬總數,以及只有真正需要判斷時才引入的人類判斷。更強模型可以設計更好的修復,不能看過結果後改寫計分方法。

驗證還要檢查沒有發生未經授權的變化。頁面返回200,不代表可以改動secrets、無關文件或權限。憑證必須列明變更,並保留回滾所需的原狀態。

OpenAI的Agent改進示例連接了trace、反饋和可重複評測。Agent改進閉環。可借鑒的是程序:任何改進主張都要有穩定比較。RobinOS的表現,在自己的任務和檢查實際運行前仍為UNKNOWN。

記住證據,不記口號

閉環會保留能改善下一次路由的經驗,也必須阻止聽起來合理的錯誤變成政策。

每條候選記憶都要帶來源、日期、範圍和觀察結果。“這個只讀介面重試一次後從暫時超時恢復”是證據;“任何錯誤都要重試”是口號。下一次動作涉及發佈、發送、刪除或花錢時,兩者差別會迅速放大。

OpenAI的memory與compaction示例區分了單次長任務中的連續性,以及跨任務復用的記憶。Memory與壓縮。十任務實驗兩者都要測試:執行者能否從精簡狀態繼續同一個任務?後續任務能否取回舊經驗,又不帶入過時假設?

新經驗先進入試用狀態,在第二個相關案例中復核後才升級成長期規則。衝突及其底層記錄都要保留。錯誤經驗被寫入與錯誤經驗被實際調用要分別計數,前者衡量污染,後者衡量損害。

創始人要得到復利學習,不能得到一堆看不見的運營傳說。

重新路由才真正閉環

最後一步不是記憶,而是讓已驗證經驗改變下一次分配。

Sol若能便宜、乾淨地完成某類任務,下一項同類任務就繼續給Sol。某類故障若總需要Astra救援,可以更早升級。Astra復核在足夠多可比任務中沒有發現實質問題,可以減少該復核路線,同時保留隨機檢查。任何模型若製造錯誤記憶或靜默擴權,能力提升都不能抵消控制退化。

這是一人公司從“很多聊天窗口”變成操作系統的地方。route、execute、recover、verify、remember、reroute形成一個可測週期;每一環都留下一個小證據對象,供下一環使用。

本週擬運行十個任務,覆蓋日常編輯、跨文件診斷、一次中斷進程、一條過時指令、一次含糊交接和一個應在權限邊界正確停止的任務。結果出現前先凍結任務集合。優先復用RobinOS現有工作,讓比較衡量真實價值,而不是合成聰明。

創始人打擾賬本

每個任務佔一行;所有嘗試留在同一任務記錄內,重試不能變成新分母,被放棄的困難任務仍屬於已分配集合。

指標 定義 決策用途
驗證完成率 通過驗收的成果 ÷ 十個已分配任務 同時展示被阻塞與未解決任務
首次完成率 無需救援即通過的任務 ÷ 已分配任務 區分日常可靠性與最終成功
自動恢復率 安全恢復的適用故障案例 判斷故障返回機器還是返回創始人
創始人打擾 主動介入分鐘+打斷次數 衡量負責人勞動與注意力碎片
記憶質量 錯誤經驗寫入數+實際調用數 定位污染與下游傷害
單成果成本 全部模型與工具成本 ÷ 驗證成果 包括重試、救援與復核
總耗時 從開始到驗收憑證 防止低接觸任務掩蓋過長延遲

任何觀察都不預填。缺失數據保持UNKNOWN。若某個切片沒有驗證成果,照實記錄花費與零成果;此時單成果成本未定義。

前十個任務的決策規則

在出現相反證據前,保留現有路由。只有Astra救援提高驗證完成率,或減少Robin打擾的價值足以覆蓋全部增量成本,並且權限、來源、恢復與記憶質量沒有實質退化時,才擴大其範圍。

先逐項復核,再算匯總平均。簡單任務過多時,單一平均值會獎勵錯誤系統。日常路線、模糊路線和恢復路線要分別展示,再報告組合結果。總耗時與主動模型時間同時保留,因為一個模型任務即使便宜,若等待六小時人工重建,也可能比一次昂貴而迅速的救援更差。

每次介入都標記為判斷、缺失上下文、工具故障、證據修復或權限邊界。只有可避免類別代表自主性缺陷。還要記錄反事實:沒有這次介入,任務能否通過驗收?在可接受成果上增加偏好,與為了完成而必須救援,是兩回事。每項分類旁邊都保留原始憑證鏈接,供後續復核。

不要因一次精彩救援就全面晉升Astra,也不要因一個超出Sol定位的困難任務就降級Sol。按任務類別比較,披露小樣本,保留所有未解決案例。

首個有用結論也許只是“協調成本聚集在哪裡”。這已經足以改善任務設計。兩個模型都做不好的含糊任務,可能是規格問題;檢查全過、Robin仍失望的任務,可能是驗收標準錯誤。實驗既要改善路由,也要改善經營契約。

三個Agent工作日是有希望的產能。閉環決定它是否把時間還給創始人。

分類與關鍵詞

分類: 人工智能;Agent系統;經營模型;一人公司

關鍵詞: Agent工作日;創始人打擾;Astra;Sol;任務路由;自主恢復;確定性驗證;證據型記憶;單個驗證成果成本

Hashtags: #AI #AgentSystems #RobinOS #OnePersonCompany #VerifiedOutcomes