
需要“思考”的模型正在从云端机房挪到设备旁。NVIDIA在9月4日公布Jetson部署方案,使用NVFP4量化与推测解码运行Nemotron 3.5 Lightning和Qwen3.8-27B,官方测试的解码吞吐相对BF16最高提升6.28倍。数字足够醒目,但不同模型、任务和优化组合的结果差异很大,不能直接等同于任何边缘应用都快六倍。
这次方案选择了两条不同路线。Nemotron 3.5 Lightning是混合专家模型,总参数约300亿,每个token激活约30亿参数;Qwen3.8-27B则是270亿参数的稠密模型。前者用稀疏激活减少每步计算,后者结构更直接,两者都通过低精度权重和专门推理内核压缩设备端负担。
边缘部署的价值不只是断网可用。相机、传感器和业务数据可以留在现场,减少持续上云带来的带宽、隐私和往返延迟;工厂检测、野外设备维护、零售终端和移动机器人也能在网络抖动时继续工作。但模型是否装得下、能否稳定散热,以及高并发时是否抢占其他任务,仍由具体硬件与系统设计决定。
NVIDIA给出的结果显示,Nemotron结合DSpark时,写作、推理、摘要和RAG四类任务的输出速度约为每秒123.01至138.02个token,最高相对BF16提升3.37倍。Qwen结合DFlash2时,输出速度约为每秒27.69至34.44个token,最高提升6.28倍。最快组合在同一模型的不同任务中保持稳定,但绝对速度仍随工作负载变化。
推测解码让较轻的草稿路径先生成候选token,再由目标模型批量验证;命中越高,一次验证能接受的token越多。NVFP4则降低权重和计算开销。两者叠加能显著增加解码吞吐,却可能受提示长度、输出风格、批量大小和草稿接受率影响,所以一条官方峰值不能替代应用自己的端到端测试。
官方配方要求Jetson AGX Thor或Orin、JetPack 7.2以及vLLM 0.28.0相关环境。团队首先要验证模型在目标显存和功耗模式下能够持续运行;其次要分别记录首token延迟、解码速度和任务完成总时长;再次要用真实提示检查量化与推测解码是否改变输出质量;最后还要模拟摄像头、控制程序和模型同时抢占资源的峰值场景。
这也是边缘AI最容易被基准数字遮住的部分。每秒token数高,并不保证告警更快抵达,也不代表长时间负载没有降频。生产项目还需要模型回滚、远程更新、离线日志、安全启动和故障降级;若设备在无人现场运行,维护成本甚至可能比一次推理成本更重要。
最高6.28倍说明软硬件协同仍能释放很大空间,也说明企业不应把“选择模型”和“选择部署方式”分开。不同模型需要不同草稿策略和内核,盲目套用同一量化方案,可能在吞吐提升的同时损失准确率、首token速度或稳定性。真正有价值的指标应落在任务完成时间、每瓦吞吐和现场可用率上。
ATYUN观点:适合先落地的是输入稳定、结果可核验、断网价值高且边界清晰的任务,例如设备巡检摘要、视觉告警解释和本地知识问答。企业可先用同一批真实请求对比BF16与NVFP4、普通解码与推测解码,再把输出质量、P95延迟、功耗、温升和失败恢复写进上线门槛。NVIDIA后续若提供更多独立设备测试和具名客户数据,才更容易判断这些峰值能否转化为长期运营收益。
