首Token最高快5倍,NVIDIA拆开多模态推理三阶段

2026年09月10日 由 ATYUN编辑部 发表 781 0
多模态请求依次通过视觉编码预填充和解码三组独立服务器
原创示意图:把视觉编码从大模型预填充与解码中拆出,可独立调度和选择硬件。

多模态推理慢,不一定慢在大语言模型。图片进入模型前还要下载、解码和运行视觉编码器;当这部分与文本预填充、逐Token解码挤在同一GPU队列里,一条重图像请求会让旁边的纯文本请求一起等待。9月9日,NVIDIA公布Dynamo的编码—预填充—解码拆分方案,称在合适负载中,首Token时间最高改善5倍,端到端响应最高改善7倍。

适合:多图或视频、短到中等输出、量化MoE模型和图文混合流量。
拓扑:可同卡分进程,也可把编码器放到更低成本的独立GPU层。
反例:轻图像加长输出时,传输和调度成本可能抵消收益。

把视觉编码从大模型队列里拿出来

聚合部署让同一Worker依次处理媒体预处理、视觉Transformer、投影、LLM预填充和解码,简单但难以独立扩缩。EPD拆分后,前端只把缺少嵌入的多模态请求送入编码池,纯文本请求直接进入预填充;编码结果再通过传输层交给后续GPU。

Dynamo提供三种放置方式:全部聚合;编码Worker与预填充/解码Worker共用GPU但独立调度;或者使用独立异构编码层。官方测试把Qwen3.5 122B A10B的NVFP4版本部署在4张GB200上,异构方案另用RTX 6000D承担编码,视觉嵌入通过峰值20Gbps的网络传输。轻负载并不一定值得多放一层硬件。

同卡拆分不需要为视觉模型永久占用整张GPU,适合同构集群;独立编码层则能把较轻的视觉任务放到较便宜硬件,让高端GPU专注预填充和解码。两者都增加新的队列和传输边界,编码层失衡时,瓶颈只会从一个Worker搬到另一个服务。

图文混合流量也能受益

在各占一半的文本与图像流量、输出长度128的测试中,文本请求平均首Token从92.3毫秒降到53.3毫秒,改善42.2%;图像请求从289.9毫秒降到200.6毫秒,改善30.8%。原因不是文本计算变快,而是文本不再被同批次的视觉编码挡在队列后面。

量化也会改变收益。语言模型权重从BF16换成NVFP4后,预填充和解码变快,视觉编码仍为BF16,于是编码占比上升,同卡EPD相对聚合部署的有效吞吐比从1.78倍增至2.64倍。优化某一阶段,会把瓶颈推向另一个阶段,这正是分阶段调度的价值。

在10张图片、输出长度1024的测试中,同卡与异构方案的首Token分别改善58%和50%,异构配置在相同交互延迟约束下可服务的负载高出约70%。这些结果说明“最高5倍”来自更重的媒体单元,不应直接套到只有单图问答的常规流量。

不是所有多模态服务都该拆

当输出序列很长,端到端时间主要花在解码,视觉编码节省就会被稀释。在5张低负载图片、输出长度2048的一个测试单元中,同卡拆分反而回退2.5%。模型规模同样重要:视觉编码开销相对固定,大型稠密模型的语言部分更重,拆分空间更小;官方给出的4B、9B、27B稠密模型相对有效吞吐分别为2.62、1.50和0.65倍。

此外,示例中有43%的首Token时间发生在视觉Transformer之前,EPD并不解决下载和媒体解码。Dynamo还建议把解码前移到前端、缓存重复媒体的嵌入,并按媒体内容做KV路由。团队需要同时测图片数量、分辨率、输出长度、缓存命中和网络拥塞,而不是照搬最高倍数。

小编判断:多模态推理进入分段算账阶段

EPD的重要性不是又多一种架构名词,而是让视觉编码首次成为可独立观察、扩缩和采购硬件的服务阶段。媒体重、输出短、模型量化明显的工作负载,更可能用较便宜GPU承接编码,把昂贵加速器留给语言模型。

上线前应以真实流量回放,比较首Token、端到端、P99、每秒有效请求和单请求成本,并把文本与图像SLA分开。若拆分后只是平均值变好,却增加尾延迟、网络故障域或闲置编码卡,系统总成本仍可能上升。最佳拓扑不是固定答案,而是随流量结构和硬件价格持续变化的调度决策过程。

文章来源:AI Agent
欢迎关注ATYUN官方公众号
商务合作及内容投稿请联系邮箱:bd@atyun.com
评论 登录
热门职位
Maluuba
20000~40000/月
Cisco
25000~30000/月 深圳市
PilotAILabs
30000~60000/年 深圳市
写评论取消
回复取消