10月13日,蚂蚁集团正式开源业界首个高性能扩散语言模型推理框架dInfer。
在基准测试中,dInfer将扩散语言模型的推理速度相比英伟达扩散模型框架Fast-dLLM提升了10.7倍。在代码生成任务HumanEval上,dInfer在单批次推理中创造了1011Tokens/秒的速度,首次实现扩散语言模型单批次推理速度显著超越自回归模型。
在配备8块NVIDIA H800 GPU的节点上,dInfer平均推理速度达到681 TPS,是Fast-dLLM的10.7倍。与参数量相当的AR模型Qwen2.5-3B相比,dInfer的平均推理速度是其2.5倍。
蚂蚁集团表示,dInfer标志着扩散语言模型从理论迈向实践的关键一步,并邀请全球开发者共同探索扩散语言模型的潜能。

粤公网安备 44010602000162号
网友评论