| 事件: 2025 年2 月12 日,字节跳动豆包大模型团队提出了全新的稀疏模型架构UltraMem,该架构有效解决了MoE 推理时高额的访存问题,推理速度较MoE架构提升2-6 倍,推理成本最高可降低83%。该研究还揭示了新架构的Scaling Law,证明其不仅具备优异的Scaling 特性,更在性能上超越了MoE。 投资要点: 豆包大模型团队提出全新超稀疏架构,推理速度提升了2-6 倍。 在Transformer 架构下,模型的性能与其参数数量和计算复杂度呈对数关系。 随着LLM 规模不断增大,推理成本会急剧增加,速度变慢。尽管MoE 架构已经成功将计算和参数解耦,但在推理时,较小的batch size 就会激活全部专家,导致访存急剧上升,进而使推理延迟大幅增加。豆包大模型Foundation 团队提出UltraMem,一种同样将计算和参数解耦的稀疏模型架构,在保证模型效果的前提下解决了推理的访存问题。实验结果表明,在参数和激活条件相同的情况下,UltraMem 在模型效果上超越了MoE,并将推理速度提升了2-6 倍。 此外,在常见batch size 规模下,UltraMem 的访存成本几乎与同计算量的Dense 模型相当。 LLM 的能力增长需要指数级增长的计算资源,先前解决方案MOE 和PKM 都存在局限性。 LLM 的能力增长需要指数级增长的计算资源,这在实时应用等资源有限的环境中颇具挑战。为了解决计算问题,先前的研究者提出了MoE 和Product KeyMemory(PKM)方案,但它们都有各自的局限性。MoE 通过稀疏激活expert解耦了计算和参数,但在推理场景中,速度其实很慢。原因在于,模型在推理时只能一个字一个字的生成,因此batch size 和sequence length 都很小,在这个场景下,MoE 的所有专家通常会被全部访问到,极其容易遇到访存瓶颈,导致推理延迟激增。PKM 最早提出large memory layer,其中包含了数量庞大的稀疏参数value,这里value 其实就是一个向量,每个token 会根据一个「行路由」和一个「列路由」定位到得分最高的几个value,激活这些value 后做weighted sum pooling 作为memory layer 的输出。这种方法因为每个token在推理时仅仅只激活极少数的value,所以推理时不会遇到访存瓶颈,但其效果很差,且scaling 能力差。 UltraMem 参考了PKM 的设计,但针对PKM 的3 个缺陷予以补充。 UltraMem 参考了PKM 的设计,但针对PKM 的3 个缺陷予以补充,以实现更高效的访存、更优质的value 检索;同时,降低了显存和部署成本。具体方法包括:1) 优化模型结构;2)优化value 检索方式;3)隐式扩展稀疏参数。 实验结果表明,UltraMem 具有极小的访存,相比MoE 实现了最高达6 倍的速度提升,推理成本最高可降低83%;此外,在性能方面,随着模型容量的增加,在相同的参数和计算量情况下,UltraMem 超过了MoE,表明其具有更强的扩展能力。 投资建议:我们持续看好ai agent 产业发展,提示重点关注汉得信息、鼎捷数智、创业黑马、值得买等。 风险提示:AI 产业政策风险、ai agent 行业发展不及预期风险、相关标的业绩不及预期风险等。 |