NVIDIA让小模型参与芯片分配,但最后一票仍交给人

2026年09月11日 由 ATYUN编辑部 发表 1009 0
半导体供应链规划员在实体化物料与工厂墙前审核分配方案的原创示意图
原创示意图:结构化优化、小模型判断和人工审批共同组成可追溯的供应链决策闭环。

供应链优化器能算出数学上的最佳分配,却可能不知道一封供应商邮件、一次天气变化或工厂例会刚刚改变了现实。NVIDIA与Palantir 9月10日披露一套内部供应链方案:先用cuOpt求解周度混合整数规划,再让经过后训练的Nemotron读取非结构化信号并提出修正,最终仍由人类规划员批准、编辑或否决。每次决定、理由和实际结果都会写回Foundry。

优化器打底:先在容量、交付、物料和承诺约束下生成可解释的周度方案。
小模型补现实:把邮件、天气与供应商说明转成风险、例外和替代建议。
人工握最后一票:没有自动上线或自我训练,所有覆盖决定和结果都保留审计轨迹。

先把物料、工厂和承诺变成同一套对象

方案的地基不是模型,而是Palantir Foundry中的供应链本体。材料、站点、容量、订单承诺、分配和产出被建成可关联对象,结构化数据与邮件、供应商复盘等非结构化信号进入同一上下文。cuOpt据此求解以Time of Ownership为目标的周度分配,并把约束项暴露出来,规划员可以看到方案为什么无法满足某项需求。

难点出现在优化器之外。经验丰富的规划员会根据天气、临时承诺和供应商语气调整结果,却常把理由留在个人邮件或会议里,下一轮系统无法复用。新流程要求每次接受、编辑或覆盖方案时同时记录依据和预期,再把实际结果回写。这些数据既能审计决策,也能为后续模型训练形成时间一致的样本。

30B总参数的小模型只负责边界明确的一步

团队选择Nemotron 3.5 Lightning作为执行层模型。它共有300亿参数、每次前向约激活30亿,部署在治理边界内。训练前先对供应链数据做匿名化,再用合成数据补充稀有场景,通过LoRA在两块B200上完成适配;材料称训练耗时以分钟计。回测采用时间点切分,避免未来信息泄漏到历史决策。

在内部开发集上,后训练Lightning的分配决策准确率为86.7%,高于Nemotron 3 Ultra的55.5%和基础Lightning的17.5%。但平衡准确率只有58.6%,Macro-F1为57.5%,说明类别不均衡仍然明显,单看总准确率会高估效果。Ultra对应两项指标为42.0%和39.5%,基础Lightning为29.0%和13.5%。这证明小模型能在狭窄任务里胜出,却没有证明它拥有更强的通用供应链推理。

最关键的设计,是模型不能自己改生产

模型先读取优化方案与外部信号,给出接受、调整或升级人工处理的建议,并附上理由和可查证证据。人类规划员审核后才形成最终分配;生产中的反馈不会直接触发自训练。Palantir Autopilot管理数据、模型和部署血缘,让团队能够还原某个建议使用了哪版数据、哪版适配器和哪套规则。

边界也被明确写出:对未来风险的预测依旧困难,供应链变化可能迅速超出训练分布;公开材料没有给出线上采用率、实际交付改善、误判成本或节省金额。86.7%来自供应商与客户共同披露的开发测试,外部团队不能直接把它当成生产SLA。更合理的验收还要按稀缺物料、工厂、风险等级和人工覆盖原因拆分,并长期观察错误方案是否集中在少数高损失场景。

小编判断:企业Agent应先学会进入决策链,而不是取代决策者

这套案例展示了FDE真正需要解决的五件事:统一对象、接入非结构化证据、把专家经验变成可记录理由、用时间一致回测验收、在不可逆动作前保留人工闸门。模型只是其中一个可替换部件,Foundry本体、优化约束、审批责任和结果反馈才让系统能够持续运行。

准备复制的企业不必先训练专用模型。可以从一个高频分配会议开始,让优化器输出基线,让Agent只整理例外与证据,让负责人明确接受或覆盖,并记录一个月后的结果。只有当人工覆盖率、错误成本和交付指标稳定改善,再逐步扩大自动建议范围。把最后一票交给谁,应由风险和可逆性决定,而不是由模型准确率决定。

文章来源:AI Agent
欢迎关注ATYUN官方公众号
商务合作及内容投稿请联系邮箱:bd@atyun.com
评论 登录
热门职位
Maluuba
20000~40000/月
Cisco
25000~30000/月 深圳市
PilotAILabs
30000~60000/年 深圳市
写评论取消
回复取消