股票之声

 找回密码
 注册

QQ登录

只需一步,快速开始

股票之声 首页 研究报告 查看内容

传媒行业:豆包大模型团队提出全新超稀疏架构 推理成本大

2025-2-14 10:33| 发布者: 神童股手| 查看: 195| 评论: 0

摘要:   事件:   2025 年2 月12 日,字节跳动豆包大模型团队提出了全新的稀疏模型架构UltraMem,该架构有效解决了MoE 推理时高额的访存问题,推理速度较 ...
  事件:

      2025 年2 月12 日,字节跳动豆包大模型团队提出了全新的稀疏模型架构UltraMem,该架构有效解决了MoE 推理时高额的访存问题,推理速度较MoE架构提升2-6 倍,推理成本最高可降低83%。该研究还揭示了新架构的Scaling Law,证明其不仅具备优异的Scaling 特性,更在性能上超越了MoE。

      投资要点:

      豆包大模型团队提出全新超稀疏架构,推理速度提升了2-6 倍。

      在Transformer 架构下,模型的性能与其参数数量和计算复杂度呈对数关系。

      随着LLM 规模不断增大,推理成本会急剧增加,速度变慢。尽管MoE 架构已经成功将计算和参数解耦,但在推理时,较小的batch size 就会激活全部专家,导致访存急剧上升,进而使推理延迟大幅增加。豆包大模型Foundation 团队提出UltraMem,一种同样将计算和参数解耦的稀疏模型架构,在保证模型效果的前提下解决了推理的访存问题。实验结果表明,在参数和激活条件相同的情况下,UltraMem 在模型效果上超越了MoE,并将推理速度提升了2-6 倍。

      此外,在常见batch size 规模下,UltraMem 的访存成本几乎与同计算量的Dense 模型相当。

      LLM 的能力增长需要指数级增长的计算资源,先前解决方案MOE 和PKM 都存在局限性。

      LLM 的能力增长需要指数级增长的计算资源,这在实时应用等资源有限的环境中颇具挑战。为了解决计算问题,先前的研究者提出了MoE 和Product KeyMemory(PKM)方案,但它们都有各自的局限性。MoE 通过稀疏激活expert解耦了计算和参数,但在推理场景中,速度其实很慢。原因在于,模型在推理时只能一个字一个字的生成,因此batch size 和sequence length 都很小,在这个场景下,MoE 的所有专家通常会被全部访问到,极其容易遇到访存瓶颈,导致推理延迟激增。PKM 最早提出large memory layer,其中包含了数量庞大的稀疏参数value,这里value 其实就是一个向量,每个token 会根据一个「行路由」和一个「列路由」定位到得分最高的几个value,激活这些value 后做weighted sum pooling 作为memory layer 的输出。这种方法因为每个token在推理时仅仅只激活极少数的value,所以推理时不会遇到访存瓶颈,但其效果很差,且scaling 能力差。

      UltraMem 参考了PKM 的设计,但针对PKM 的3 个缺陷予以补充。

      UltraMem 参考了PKM 的设计,但针对PKM 的3 个缺陷予以补充,以实现更高效的访存、更优质的value 检索;同时,降低了显存和部署成本。具体方法包括:1) 优化模型结构;2)优化value 检索方式;3)隐式扩展稀疏参数。

      实验结果表明,UltraMem 具有极小的访存,相比MoE 实现了最高达6 倍的速度提升,推理成本最高可降低83%;此外,在性能方面,随着模型容量的增加,在相同的参数和计算量情况下,UltraMem 超过了MoE,表明其具有更强的扩展能力。

      投资建议:我们持续看好ai agent 产业发展,提示重点关注汉得信息、鼎捷数智、创业黑马、值得买等。

      风险提示:AI 产业政策风险、ai agent 行业发展不及预期风险、相关标的业绩不及预期风险等。

鲜花

握手

雷人

路过

鸡蛋
【2024年5月31日最新敬告:文明发帖】

Archiver|手机版|小黑屋|股票之声 ( 京ICP备09051785号 )

GMT+8, 2026-7-29 22:24 , Processed in 0.036765 second(s), 7 queries , MemCache On.

Powered by Discuz! X3.4

Copyright © 2001-2021, Tencent Cloud.

返回顶部