快讯
英伟达详解多模态推理的编码-预填充-解码分离适用场景
英伟达技术博客介绍 Dynamo 的编码-预填充-解码(EPD)分离方案,称其可把视觉编码与 LLM 预填充、解码拆成独立阶段,并给出三种编码器部署拓扑及适用条件。
核心事实
英伟达开发者博客发布文章,介绍其开源推理框架 Dynamo 中的编码-预填充-解码(EPD)分离方案。该方案把多模态请求中的视觉编码阶段,与 LLM 的预填充、解码阶段拆分为可独立批处理、调度和扩缩的环节:编码工作节点产出视觉嵌入,经 NVIDIA Inference Transfer Library(NIXL)传给预填充-解码(PD)工作节点。文章称,在图像密集提示、短到中等长度输出以及量化 MoE 模型等场景下,EPD 可带来更快的首 token 时间与端到端响应。
背景与影响
多模态请求在 LLM 预填充前需先做媒体预处理并跑视觉 Transformer。聚合式部署下,编码、预填充、解码共用一个工作节点和调度域,媒体负载升高时可能拖慢自身预填充,也会让纯文本请求排队等待。文章给出三种编码器放置拓扑:聚合式;编码器与 PD 工作节点同卡共置;以及把编码器放到独立低价 GPU 层、通过 NIXL 传输嵌入的分离式。文章称收益取决于输入媒体负载、输出序列长度、模型规模与精度以及流量构成;当解码主导时延或大稠密模型摊薄视觉编码占比时,收益会缩小。文中还提到,在文本与多模态混合流量下,EPD 可减少队头阻塞。
限制与来源
上述性能表述来自英伟达官方博客的测试环境与自述结果,具体数值、硬件配置与适用条件以原文及官网当前信息为准,尚未见独立第三方验证。文章同时指出,编码分离只有在被隔离的编码工作量足以抵消工作节点协调与嵌入传输开销时才有效;高输出长度、低图像负载的场景下分离反而可能损害性能。本文仅作技术信息转述,不构成任何采购或投资建议。