橘猫新闻 综合报道 梁文锋署名的DeepSeek新论文DSpark近日引发行业关注。据新浪财经报道,该方案在单用户场景下实现速度提升85%,高并发场景下有效吞吐量提升4倍。Fireworks AI联合创始人兼CTO、PyTorch核心维护者Dmytro Dzhulgakov将论文核心梳理为10个概念,从GPU访存特性到在线自适应调度,系统阐释了这项技术的工程精髓。

DSpark的核心创新在于系统工程与模型协同设计。其基础思路虽前人已有提出,但DeepSeek将各类技术融合为一套自适应完整系统,实现了端到端的显著性能优化。
理解DSpark需从GPU运行特性切入。大模型推理瓶颈并非浮点运算,而是显存带宽。GPU同时解码10个token仅比解码1个token慢一点点,因为权重加载至缓存后可一次性处理多个请求。批处理解码(Batching)即利用这一特性,将多个请求的token打包进同一batch,最大化显存读取效率。
推测解码(Speculative Decoding)是DSpark的另一基石。其通过“猜+验”替代逐字生成:用小模型快速生成候选序列,再用大模型批量验证。验证采用拒绝采样,保证输出分布与原模型一致,无质量损失。草稿模型(Draft Model)负责猜测环节,例如用Qwen 0.8B为Qwen 397B探路,小模型生成候选序列,大模型只需一次前向传播验证。
但推测并非免费。草稿模型引入额外开销,若猜测效率低或接受率低,则得不偿失。DSpark通过三条路径优化:降低草稿耗时、提高接受率、减少验证浪费。
为优化草稿模型,DSpark复用目标模型内部理解。Eagle与MTP思路将目标模型最后一层隐藏状态加1-2层Transformer头作为草稿器,计算量极低且准确率高。DeepSeek-V3已采用MTP-1,DSpark的加速数据均以此基线对比,即60%-85%的速度提升是在已优化基础上叠加的。
DSpark创新性地融合并行与串行方案。其核心结构DSpark≈Eagle+DFlash:先用DFlash并行骨干网络生成所有位置基础logits,保证速度;再用轻量级顺序头注入前缀依赖偏置,修正后缀衰减。离线测试显示,DSpark平均接受长度比Eagle3高26%-31%,比DFlash高16%-18%,两层DSpark甚至超越五层DFlash。
为控制成本,DSpark采用马尔可夫头作为串行模块,仅看前一个token决定修正方向,通过低秩分解(rank 256)实现极低计算成本。草稿长度从4扩展到16,每轮额外延迟仅0.2%-1.3%,但接受长度提升最高30%。
DSpark还引入可变长度草稿与硬件感知调度。系统通过置信度头预估每个草稿位置存活概率,并依据GPU吞吐曲线为每条请求动态匹配最优验证长度。整套调度在GPU内部执行,无需CPU参与。
在线草稿器校准解决神经网络过度自信问题。DSpark采用顺序温度缩放做后处理校准,将预期校准误差从3%-8%压至约1%,并根据工作负载动态修正阈值。
这10个概念单独看并非全新,但DSpark完成了算法、调度、硬件适配三位一体的端到端工程闭环。DeepSpec全栈训练库已开源,支持Eagle3、DFlash、DSpark三种草稿模型训练,兼容Qwen3和Gemma等外部模型。目前DeepSpec库在GitHub获1.4k Star,海外开发者已开始实操部署。


