北大与DeepSeek联合开源DSpark 提升大模型推理效率
北大与DeepSeek联合开源DSpark 提升大模型推理效率。今日,DeepSeek 联合北京大学发布了DSpark推理加速框架,旨在解决大语言模型在高并发生产环境中的推理效率问题。该框架已应用于DeepSeek-V4-Flash与DeepSeek-V4-Pro的预览版服务引擎中,相比之前的单token推测解码基线,在同等吞吐量水平下单用户生成速度提升了60%至85%。相关论文、训练代码等已在GitHub上开源。
大语言模型生成文本时采用自回归方式,每生成一个新token都需要一次完整的前向传播,导致推理延迟随输出长度线性增长,这是AI对话系统响应慢的主要原因之一。推测解码技术通过一个小模型快速生成候选token,再由大模型进行批量验证,从而提升生成速度。但实际效果受制于候选生成质量和验证阶段对计算资源的占用。
当前主流方案分为两派:自回归式草稿模型和并行式草稿模型。自回归式草稿模型如Eagle3逐token串行生成候选序列,依赖关系建模能力强,接受率高,但生成延迟随候选长度线性增长。并行式草稿模型如DFlash在一个前向传播内一次性产出所有候选token,生成延迟几乎与候选长度无关,理论上支持更长的候选块。然而,并行生成每个位置时无法依赖先前已采样的token,导致不同语义路径冲突,接受率迅速下降,造成目标模型计算资源浪费。此外,在并发请求较多的环境中,固定长度的验证策略会降低整体吞吐量。