01 · AI Circularity Ledger

三个Agent工作日,仍然需要创始人

Relationship map for 三个Agent工作日,仍然需要创始人

一个带着记分板的商业循环。

三个工作日,首先只是产能主张

结论很简单:每个人类工作日对应三个Agent工作日,只有在它交付可验证成果、并减少创始人打扰时,才算经营杠杆。 OpenAI Research披露,截至8月中旬,团队每个人类工作日使用约3.1个Agent工作日。代码与实验增加,内部技术支持需求下降;与此同时,高层规划仍只占Agent输出的一小部分,而且超过一半成功的4–8小时任务仍需要人工介入。OpenAI研究证据

这两组证据必须放在一起读。劳动倍数是真实的,自主运行仍未完成。一人公司可以买到远多于创始人时间的机器工时,创始人却可能继续担任调度员、异常处理员、审校员和记忆维修工。

真正的问题不是“我能同时运行多少Agent”,而是系统每消耗一小时创始人注意力,究竟能交付多少通过验收的成果,同时不牺牲证据、权限和恢复能力。

本文把问题收成一个十任务实验。今天不填写任何成绩,记分表刻意保持空白。发布本文不改变模型路由、付费API预算或生产权限。只有固定任务、固定检查与真实凭证出现后,实验才成为证据。

产出增加,协调成本也可能上升

Agent劳动容易统计:每个会话都有时长、Token和工具调用。协调负担则藏在记录之间。模型可以写出更多代码,也可以同时制造更多复核队列、含糊交接和半成品。每次中断后若仍要创始人重建意图,机器产出虽然增加,经营杠杆并没有增加。

OpenAI的数据提供了罕见的拆分。Agent使用与更多实验、更少内部支持需求相关,支持真实生产率假设;长任务仍经常需要人工介入,说明“成功任务”内部也可能包含昂贵的创始人修复。完成与独立是两项指标。

一人公司最稀缺的是负责人不被打断的判断时间。五次短介入即使合计只有二十分钟,也可能毁掉整个上午。因此实验既要记录主动介入分钟,也要记录打断次数。前者衡量劳动,后者衡量注意力碎片化。

流畅的最终回复不是充分证明。证明对象应是通过验收的产物,并与输入、权限、检查和目的地相连。对话消失后,这条链仍应可审计。

按边际价值分配模型

Astra公开评测提示了合理角色。OpenAI报告OSWorld为72.6%,5.6 Sol为65.7%,耗时约少47%;Terminal-Bench为57.9%对37.3%;DeepSWE则接近得多,为74.1%对72.7%。Astra发布与评测。标准Token价格是Sol的2.5倍。OpenAI API定价

这些数据支持一个路由假设,而不是全局替换。任务明确、检查可确定时,Sol继续做日常执行;工作跨文件、意图模糊、工具失败或首个执行者无法恢复时,再交给Astra。静默错误的代价高于复核成本时,才增加最终复核。

十任务比较至少保留三条路线:Sol独立完成;Sol先做、Astra接收有边界的救援包;确定性检查通过后,Astra仅做最终复核。三条路线必须使用相同验收标准,并记录谁完成任务、占用了多少Robin注意力,以及所有尝试的完整成本。只比Token单价,只能回答采购问题,回答不了经营问题。

执行前冻结终点

每个任务开始时,应有一个交付物、一个目的地、一份权限边界和一组简短验收检查。“优化网站”太有弹性;“修正四语canonical,通过SEO检查并验证公开路由,不修改DNS”才可验证。

终点必须在模型看到任务前冻结,否则更会说话的执行者可以把成功重新定义成自己刚好做完的部分。凭证要指向具体产物、commit或不可变文件哈希、测试、公开或本地验证,以及仍然超出权限的边界。

在权限门口正确停下是合格行为,却不等于业务成果已经完成。应单独记录安全边界事件,并衡量执行者在升级前是否已完成全部安全准备。安全与价值因此保持在两条坐标轴上。

OpenAI的迭代修复示例采用“检查目标、在副本上做聚焦修改、验证结果”的流程。Codex修复闭环。十任务实验应把这种纪律用于每个任务,即使第一版看起来已经很有说服力。

恢复能力是产品的一部分

长任务会以普通方式失败:远程写入后进程超时;编辑期间来源改变;本地构建通过、部署失败;第二个Agent接手的摘要漏掉真正验收条件。

恢复的第一步是确认最后一个已知状态,以及哪一步不会重复后果。没有收到响应,并不能证明动作失败。再次发布、发消息、付款或远程写入前,必须先检查目的地,或依赖幂等记录。只读获取可以有限重试;有后果的动作需要更强的防重复机制。

交给Astra的救援包应包含原任务身份、冻结的终点、允许范围、已确认产物、实际故障、尝试过的修复和下一项安全检查。不要加入对首个模型为何失败的故事。证据帮助救援,信心不会。

只在适用故障上计算恢复率,同时记录安全恢复、未解决案例、恢复时间和重复后果。最终成功却重复了远程动作,不能算安全恢复;每个普通超时都交给Robin,则是把韧性外包给创始人。

验证必须在模型之外

产出内容的模型可以解释自己为何认为结果正确,这些解释适合诊断,不能成为唯一验收。

检查应能跨模型复用:Schema验证、测试、文件哈希、构建结果、路由状态、内容canary、对账总数,以及只有真正需要判断时才引入的人类判断。更强模型可以设计更好的修复,不能看过结果后改写计分方法。

验证还要检查没有发生未经授权的变化。页面返回200,不代表可以改动secrets、无关文件或权限。凭证必须列明变更,并保留回滚所需的原状态。

OpenAI的Agent改进示例连接了trace、反馈和可重复评测。Agent改进闭环。可借鉴的是程序:任何改进主张都要有稳定比较。RobinOS的表现,在自己的任务和检查实际运行前仍为UNKNOWN。

记住证据,不记口号

闭环会保留能改善下一次路由的经验,也必须阻止听起来合理的错误变成政策。

每条候选记忆都要带来源、日期、范围和观察结果。“这个只读接口重试一次后从暂时超时恢复”是证据;“任何错误都要重试”是口号。下一次动作涉及发布、发送、删除或花钱时,两者差别会迅速放大。

OpenAI的memory与compaction示例区分了单次长任务中的连续性,以及跨任务复用的记忆。Memory与压缩。十任务实验两者都要测试:执行者能否从精简状态继续同一个任务?后续任务能否取回旧经验,又不带入过时假设?

新经验先进入试用状态,在第二个相关案例中复核后才升级成长期规则。冲突及其底层记录都要保留。错误经验被写入与错误经验被实际调用要分别计数,前者衡量污染,后者衡量损害。

创始人要得到复利学习,不能得到一堆看不见的运营传说。

重新路由才真正闭环

最后一步不是记忆,而是让已验证经验改变下一次分配。

Sol若能便宜、干净地完成某类任务,下一项同类任务就继续给Sol。某类故障若总需要Astra救援,可以更早升级。Astra复核在足够多可比任务中没有发现实质问题,可以减少该复核路线,同时保留随机检查。任何模型若制造错误记忆或静默扩权,能力提升都不能抵消控制退化。

这是一人公司从“很多聊天窗口”变成操作系统的地方。route、execute、recover、verify、remember、reroute形成一个可测周期;每一环都留下一个小证据对象,供下一环使用。

本周拟运行十个任务,覆盖日常编辑、跨文件诊断、一次中断进程、一条过时指令、一次含糊交接和一个应在权限边界正确停止的任务。结果出现前先冻结任务集合。优先复用RobinOS现有工作,让比较衡量真实价值,而不是合成聪明。

创始人打扰账本

每个任务占一行;所有尝试留在同一任务记录内,重试不能变成新分母,被放弃的困难任务仍属于已分配集合。

指标 定义 决策用途
验证完成率 通过验收的成果 ÷ 十个已分配任务 同时展示被阻塞与未解决任务
首次完成率 无需救援即通过的任务 ÷ 已分配任务 区分日常可靠性与最终成功
自动恢复率 安全恢复的适用故障案例 判断故障返回机器还是返回创始人
创始人打扰 主动介入分钟+打断次数 衡量负责人劳动与注意力碎片
记忆质量 错误经验写入数+实际调用数 定位污染与下游伤害
单成果成本 全部模型与工具成本 ÷ 验证成果 包括重试、救援与复核
总耗时 从开始到验收凭证 防止低接触任务掩盖过长延迟

任何观察都不预填。缺失数据保持UNKNOWN。若某个切片没有验证成果,照实记录花费与零成果;此时单成果成本未定义。

前十个任务的决策规则

在出现相反证据前,保留现有路由。只有Astra救援提高验证完成率,或减少Robin打扰的价值足以覆盖全部增量成本,并且权限、来源、恢复与记忆质量没有实质退化时,才扩大其范围。

先逐项复核,再算汇总平均。简单任务过多时,单一平均值会奖励错误系统。日常路线、模糊路线和恢复路线要分别展示,再报告组合结果。总耗时与主动模型时间同时保留,因为一个模型任务即使便宜,若等待六小时人工重建,也可能比一次昂贵而迅速的救援更差。

每次介入都标记为判断、缺失上下文、工具故障、证据修复或权限边界。只有可避免类别代表自主性缺陷。还要记录反事实:没有这次介入,任务能否通过验收?在可接受成果上增加偏好,与为了完成而必须救援,是两回事。每项分类旁边都保留原始凭证链接,供后续复核。

不要因一次精彩救援就全面晋升Astra,也不要因一个超出Sol定位的困难任务就降级Sol。按任务类别比较,披露小样本,保留所有未解决案例。

首个有用结论也许只是“协调成本聚集在哪里”。这已经足以改善任务设计。两个模型都做不好的含糊任务,可能是规格问题;检查全过、Robin仍失望的任务,可能是验收标准错误。实验既要改善路由,也要改善经营契约。

三个Agent工作日是有希望的产能。闭环决定它是否把时间还给创始人。

分类与关键词

分类: 人工智能;Agent系统;经营模型;一人公司

关键词: Agent工作日;创始人打扰;Astra;Sol;任务路由;自主恢复;确定性验证;证据型记忆;单个验证成果成本

Hashtags: #AI #AgentSystems #RobinOS #OnePersonCompany #VerifiedOutcomes