
企业Agent落地最难的环节,往往不是选模型,而是把一句“帮我完成工作”改写成可交付岗位。OpenAI公布的三组具名案例给出了具体尺度:Basis把新员工配置从约2小时缩短到约30分钟;Clay称每名销售每天节省约1小时收件箱分拣;Exa让Agent持续寻找代码集成机会并生成实现和测试。共同点不是全自动,而是任务边界、负责人、证据和停止条件先被写清。
Basis没有让新员工从空白对话开始,而是制作公司专属的Codex onboarding skill。它包含何时触发、按什么顺序配置、需要调用哪些工具,以及怎样才算完成。员工获得的是一条可重复的入职路径,HR只处理异常。按Basis自述,配置时间由约2小时降到约30分钟。这个数字尚非独立审计,但方法具有明确可迁移性。
关键不在于把旧清单复制进提示词,而是把隐性判断外显:哪些账号必须本人确认,哪些权限需要经理批准,失败时保留什么证据,什么情况必须停止。这样一来,Agent交付的不只是“已完成”,而是可检查的步骤、结果和例外。流程变化时,团队更新的是共享技能,而不是让每名员工重新摸索。
这也要求技能有版本和负责人。设备标准、权限政策或组织结构改变后,旧步骤必须能够被定位、回滚和重新验收;否则一次成功的自动化会迅速变成大规模复制错误的通道。
Clay为每个客户账户保留持久工作区和子Agent,夜间更新外部材料,再由协调Agent生成当天优先级。销售醒来后不必先翻遍收件箱,而是检查已经整理的证据和建议。Clay估算每名销售每天节省约1小时分类时间,但仍要求人在行动前查看原始材料,防止旧信息或错误匹配直接触发客户沟通。
持久状态是企业Agent与一次性聊天的分水岭,也带来新的维护成本。账户背景需要过期规则,数据抓取需要权限和重试策略,优先级变化要能解释。如果工作区只会累积而不会清理,Agent会把过时信息带入下一轮判断。企业应把新鲜度、证据时间和人工修订一并保存,而不是只保存一段越来越长的上下文。
Exa的Agent持续监控代码库和生态,寻找新的集成机会,随后生成实现、测试和复审材料。人类仍负责最终审查,执行范围也被限制。相比“每天总结行业新闻”,这种任务更接近生产交付:它有明确对象、可运行产物、测试结果和代码评审,也能在错误进入生产前停下。
这类闭环最容易暴露权限设计问题。发现机会只需要读取,修改代码需要写入,运行测试可能访问密钥,合并发布又是更高等级动作。把所有能力交给同一个长期凭据很省事,却会扩大失败半径。更稳妥的做法是按阶段发放最小权限,用测试与人工评审作为晋级门槛,并让每次工具调用都留下证据。
OpenAI把实施路径归纳为六步:选择有后果的工作流;明确负责人、指标、基线与护栏;写出包含工具和停止点的岗位说明;设计人机决策权;把实验固化为技能、插件和共享工作区;再把模式迁移到下一流程。企业信号还显示,使用深度前10%的组织人均输出token是典型组织的8.3倍,1月时为2.6倍。输出量说明采用加深,却不是ROI。
因此,Basis的90分钟、Clay的1小时都不应被当作通用承诺。真正可复制的是测量方式:上线前记录耗时、错误、等待和人工介入;上线后同时追踪完成率、返工、延迟、成本与风险事件。企业Agent不是把人从流程图上删除,而是把重复搜集和执行交给机器,让人集中处理例外与决策。只有当责任人、证据链和退出机制都清楚,自动化才从演示变成交付。
