一、NVIDIA Dynamo是什么
NVIDIA Dynamo是NVIDIA于2025年GTC大会上发布的开源分布式推理服务框架,被黄仁勋称为AI工厂的超级操作系统。它专为在数据中心规模的多节点环境中高效部署生成式AI和推理模型而设计,支持TensorRT-LLM、vLLM、SGLang等主流推理引擎,提供高吞吐量、低延迟的推理服务能力。
随着大语言模型参数规模持续增长,单个GPU甚至单节点已无法承载完整模型,分布式多节点部署成为刚需。Dynamo通过将推理的预填充和解码阶段分离到不同GPU、智能路由请求避免冗余计算、将KV缓存卸载至成本更低的存储层等手段,解决了大规模推理面临的核心挑战。
二、核心架构与技术特性
PD分离架构:Dynamo将大模型推理拆分为预填充和解码两个独立阶段,分别部署到不同的GPU资源上。预填充阶段属于计算密集型,需高算力并行处理输入提示;解码阶段属于内存密集型,依赖高带宽显存频繁读取KV缓存。通过分离部署,两个阶段可以独立优化资源配比,消除资源竞争,最大化GPU利用率。
LLM感知路由器:传统负载均衡策略忽视LLM推理的有状态特性,导致KV缓存被频繁清空并重新计算。Dynamo的KV缓存感知路由将请求导向缓存命中率最高的GPU节点,同时保持全局负载均衡。实测数据显示,在十万次请求中,首Token时间缩短至原来的三分之一,平均延迟降低一半。
NIXL通信库:NVIDIA推理传输库专为分布式推理场景设计,支持动态扩缩容和实时负载均衡,统一抽象GPU、CPU、网络和存储间的异构数据传输,显著加速多节点间KV缓存搬运效率。
Grove Kubernetes编排:Grove是Dynamo内置的Kubernetes原生编排方案,利用统一的CRD实现相互依赖的AI推理组件的高效调度和声明式启动顺序,简化多节点环境下的服务编排复杂度。
AIConfigurator自动配置:根据模型类型、GPU预算和服务等级目标,自动推荐最优的预填充与解码配置及模型并行策略,消除分布式服务部署中的人工调参猜测。
三、性能表现
基于三个H20节点(每节点八GPU)部署DeepSeek-R1-Distill-Llama-70B模型的实测显示,使用Dynamo的PD分离架构与直接使用vLLM 0.7.2版本相比:首Token时间在P90请求中仅需基准方案的百分之三十到四十;平均每Token生成时间在P90和P99中提升约三成;整体吞吐量为基准方案的一点三至一点五倍。此外,Dynamo的KV缓存管理器通过将缓存卸载至CPU内存,在多轮对话场景中首Token时间提升四成。
NVIDIA官方基准测试表明,GB300 NVL72搭配Dynamo的组合在混合专家模型推理中,吞吐量最高可提升十五倍。
四、部署架构与硬件选型建议
硬件要求:Dynamo目前不支持T4、V100等较老架构GPU,推荐使用H20及以上规格的NVIDIA GPU。因NIXL通信库限制,张量并行数最大为八,当前版本暂不适合部署DeepSeek-R1 671B满血版等超大模型,需等待社区后续支持流水线并行。
PD配比策略:确定预填充Worker与解码Worker的GPU数量比例需综合考虑GPU算力、关键性能指标SLO和真实请求特征(输入与输出Token比例)。一般建议先将预填充Worker的张量并行设为最小值以保证模型加载,解码Worker的张量并行设为其四至八倍,再以二比一的GPU配比作为起点进行压测调优。
依赖组件:Dynamo依赖NATS和etcd进行服务发现和组件间通信,需在Kubernetes集群中预先部署。监控方面,Dynamo内置metrics组件,可采集KV块使用率、请求槽位、缓存命中率、负载分布等关键指标。
五、选型与采购考量
Dynamo采用完全开源的Apache 2.0协议,可从GitHub直接获取,适合具备自建推理基础设施能力的技术团队。对于需要企业级支持的用户,NVIDIA AI Enterprise平台提供Dynamo的商业支持版本,集成NIM微服务,涵盖安全性、API稳定性与企业级技术保障。
选型时应重点评估:团队是否具备Kubernetes运维能力和分布式推理调优经验;现有GPU集群型号是否满足H20以上要求;业务场景的首Token时间和吞吐量SLO是否需要PD分离带来的性能增益;是否愿意接受开源社区迭代节奏——当前Dynamo为v0.x版本,KV缓存管理器V2、Kubernetes Operator等关键特性仍在开发中。
六、总结
NVIDIA Dynamo作为新一代开源分布式推理框架,通过PD分离、KV感知路由和NIXL高速通信等创新技术,为大规模LLM推理服务提供了显著的性能提升和资源效率优化。对于正在评估AI推理基础设施方案的企业而言,Dynamo在吞吐量、延迟控制和GPU利用率方面的表现值得重点关注,尤其适合对推理性能有较高要求、且具备Kubernetes运维能力的技术团队。如需进一步了解NVIDIA Dynamo的详细技术参数、版本路线图及采购方案,欢迎联系软服之家获取专业选型咨询服务。