每天600美元,Codex在OpenAI研究团队跑出3.1倍工时

2026年09月07日 由 ATYUN编辑部 发表 631 0
研究人员在中央通道监督多组并行运行的AI实验工位
原创示意图:多路编码 Agent 并行运行,研究人员负责选择、监督和必要干预。

如果只看每天消耗多少Token,很容易把Codex的增长理解成“模型变贵了”。OpenAI 9月6日公布的内部数据给出了更完整的画面:到8月中旬,研究组织中Agent使用量处于中位的研究人员,每天推理用量按API价格折算已超过600美元;第90百分位用户则超过7000美元。与此同时,整个研究组织每个真人工作日对应3.1个Agent工作日。这也把“额度为何消耗更快”从体感问题,拉回到任务时长和并发强度。

使用强度:中位研究人员每天超过600美元,第90百分位用户超过7000美元,均为按API价格折算。
任务深度:Agent已能在人类指导下完成边界明确、熟练研究人员通常需要数天的任务。
人工边界:过去半年成功完成的4至8小时任务中,超过一半至少发生过一次人工介入。

3.1个Agent工作日,先别读成3.1倍产出

3.1这个数字按标准8小时工作日换算,统计的是Agent累计运行时长,不是论文数量、实验质量或研究生产率。编码Agent可以在夜间持续运行,也能同时处理多个分支,因此它比“每天调用几次”更接近真实投入强度;但一段长时间运行也可能包含等待、失败、返工和重复探索,不能直接当成3.1倍成果。

OpenAI称,2026年每名活跃实验者的实验次数持续上升,8月达到自2025年1月开始跟踪以来的最高水平。增幅与Codex采用增加相关,但同期可用计算资源也明显增加。两条变量同时变化,意味着现有数据能证明“研究活动更密集”,还不能证明所有增量都由Agent单独带来。

任务变长了,但高层规划仍在人手里

研究团队给自己的阶段目标,是让系统在9月达到“自动化研究实习生”水平:在人类指导下接手边界清楚、熟练研究人员通常需要几天完成的工作。下一站则是2028年3月的自动化AI研究员。内部任务已经从研究代码、基础设施代码,扩展到技术支持、实验运行监控和结果整理。

真正难替代的仍是问题定义、方向取舍和高层计划。官方统计中,高层规划只占Agent输出Token的很小部分;从1月到7月,不同难度任务的成功率总体提高,但在过去半年成功完成的4至8小时任务里,超过一半至少需要一次人类干预。换句话说,Agent可以把一项工作拉得更长,却还没有把监督者从流程中拿掉。

安全限制一落地,算力会自动寻找新出口

高强度使用也暴露出运行风险。7月20日,Agent破坏研究基础设施后,相关容器服务一度暂停,恢复时增加了更严格的限制;面向部署模型的强化学习训练因此停了约两周。8月7日,Astra因初步证据显示可能触及关键网络能力,被移入更高安全环境。随后一周,Astra类GPU分配下降59.2%,其他模型的分配却上升17.2%,抵消了约85%的下降。

这个细节对企业尤其重要:限制一个模型,不等于限制一项业务需求。只要团队仍要完成任务,调用量就可能迁移到其他模型、工具或执行环境。治理不能只做模型黑名单,还要覆盖任务权限、容器隔离、网络边界、操作审计、异常告警和人工接管,并把迁移后的总算力与风险一起计算。

小编判断:企业要量任务,不要只数Token

这组数据最有价值的地方,不是证明Codex已经替代研究员,而是把企业Agent的计量单位从“对话次数”推向“完整任务”。每天600美元、3.1个Agent工作日和更高实验频率都说明,Agent正在成为持续运行的计算劳动力;超过一半长任务仍需人工介入,则提醒管理者把监督时间算进真实成本。

ATYUN观点:企业上线类似系统时,应同时记录任务完成率、首次成功率、人工介入次数、端到端时长、失败后的恢复成本和最终业务结果。还要注意,这些数字来自OpenAI内部,研究人员口径包含基础设施、项目管理与支持岗位,使用统计覆盖大多数但非全部编码Agent活动。只有当更高的推理投入稳定换来更短研发周期、更少返工或更高实验命中率,Agent工时才真正转化成生产力。

文章来源:AI Agent
欢迎关注ATYUN官方公众号
商务合作及内容投稿请联系邮箱:bd@atyun.com
评论 登录
热门职位
Maluuba
20000~40000/月
Cisco
25000~30000/月 深圳市
PilotAILabs
30000~60000/年 深圳市
写评论取消
回复取消