
如果只看每天消耗多少Token,很容易把Codex的增长理解成“模型变贵了”。OpenAI 9月6日公布的内部数据给出了更完整的画面:到8月中旬,研究组织中Agent使用量处于中位的研究人员,每天推理用量按API价格折算已超过600美元;第90百分位用户则超过7000美元。与此同时,整个研究组织每个真人工作日对应3.1个Agent工作日。这也把“额度为何消耗更快”从体感问题,拉回到任务时长和并发强度。
3.1这个数字按标准8小时工作日换算,统计的是Agent累计运行时长,不是论文数量、实验质量或研究生产率。编码Agent可以在夜间持续运行,也能同时处理多个分支,因此它比“每天调用几次”更接近真实投入强度;但一段长时间运行也可能包含等待、失败、返工和重复探索,不能直接当成3.1倍成果。
OpenAI称,2026年每名活跃实验者的实验次数持续上升,8月达到自2025年1月开始跟踪以来的最高水平。增幅与Codex采用增加相关,但同期可用计算资源也明显增加。两条变量同时变化,意味着现有数据能证明“研究活动更密集”,还不能证明所有增量都由Agent单独带来。
研究团队给自己的阶段目标,是让系统在9月达到“自动化研究实习生”水平:在人类指导下接手边界清楚、熟练研究人员通常需要几天完成的工作。下一站则是2028年3月的自动化AI研究员。内部任务已经从研究代码、基础设施代码,扩展到技术支持、实验运行监控和结果整理。
真正难替代的仍是问题定义、方向取舍和高层计划。官方统计中,高层规划只占Agent输出Token的很小部分;从1月到7月,不同难度任务的成功率总体提高,但在过去半年成功完成的4至8小时任务里,超过一半至少需要一次人类干预。换句话说,Agent可以把一项工作拉得更长,却还没有把监督者从流程中拿掉。
高强度使用也暴露出运行风险。7月20日,Agent破坏研究基础设施后,相关容器服务一度暂停,恢复时增加了更严格的限制;面向部署模型的强化学习训练因此停了约两周。8月7日,Astra因初步证据显示可能触及关键网络能力,被移入更高安全环境。随后一周,Astra类GPU分配下降59.2%,其他模型的分配却上升17.2%,抵消了约85%的下降。
这个细节对企业尤其重要:限制一个模型,不等于限制一项业务需求。只要团队仍要完成任务,调用量就可能迁移到其他模型、工具或执行环境。治理不能只做模型黑名单,还要覆盖任务权限、容器隔离、网络边界、操作审计、异常告警和人工接管,并把迁移后的总算力与风险一起计算。
这组数据最有价值的地方,不是证明Codex已经替代研究员,而是把企业Agent的计量单位从“对话次数”推向“完整任务”。每天600美元、3.1个Agent工作日和更高实验频率都说明,Agent正在成为持续运行的计算劳动力;超过一半长任务仍需人工介入,则提醒管理者把监督时间算进真实成本。
ATYUN观点:企业上线类似系统时,应同时记录任务完成率、首次成功率、人工介入次数、端到端时长、失败后的恢复成本和最终业务结果。还要注意,这些数字来自OpenAI内部,研究人员口径包含基础设施、项目管理与支持岗位,使用统计覆盖大多数但非全部编码Agent活动。只有当更高的推理投入稳定换来更短研发周期、更少返工或更高实验命中率,Agent工时才真正转化成生产力。
