股票之声

 找回密码
 注册

QQ登录

只需一步,快速开始

股票之声 首页 行业分析 查看内容

计算机行业 :DEEPSEEK提出ENGRAM模块 通过条件记忆提升模型效

2026-1-14 11:29| 发布者: 神童股手| 查看: 101| 评论: 0

摘要:   2026 年1 月12 日,DeepSeek 在 GitHub 上发布了一项代号为“Engram”的最新研究成果,并同步上传了题为Conditional Memory via Scalable Lookup: A New Axis ofSparsity for ...
  2026 年1 月12 日,DeepSeek 在 GitHub 上发布了一项代号为“Engram”的最新研究成果,并同步上传了题为Conditional Memory via Scalable Lookup: A New Axis ofSparsity for Large Language Models(基于可扩展查找的条件记忆:大语言模型稀疏性的新维度)的学术论文。

      该论文提出了一种全新的Engram 模块, 试图解决“如何高效存储与提取知识”的难题。查询速度更快了,计算成本降低了,还因为效率提升而增加了智能程度。

      1. 查询速度更快。Engram 模块是一个巨大的、可扩展的嵌入表(EmbeddingTable),专门负责存储静态知识(Conditional Memory 条件记忆)。Engram 模块被嵌入到 Transformer 的主干网络中,与 MoE 层并行或交替工作,举例当模型读到“张仲景”或者“四大发明”这种固定搭配时,直接通过哈希索引,在内存表中“查”出对应的向量,并且速度很快。

      2. 计算成本降低。该论文也研究了高效分配算力资源,可以把千亿参数的Engram词表,直接在便宜、量大、易扩展的“CPU 内存(DRAM)”里进行查询。

      DeepSeek 实测数据显示:即使挂载了100B(千亿)参数的Engram 表到CPU 内存,相比于纯GPU 推理,吞吐量的下降不到3%。

      3. 通过以上两点重大改变,模型的智能程度增加了,因为将更多的计算资源用于推理,让大脑专注于更高维度的思考。另外,Engram 在长文本领域的表现同样证明了“分工”的价值,模型可以将“局部记忆”外包给Engram,Transformer原本的注意力机制就能更高效地捕捉全文信息。

      该论文为大语言模型的架构优化提供了新思路,我们可以期待集成了Engram 技术的DeepSeek V4 模型带来更强竞争力:拥有更大的知识库(低成本内存扩展)、更强的逻辑推理(网络深度解放)以及更低的推理成本(存算分离)。

      该论文中公布了Engram 模型效果:知识类任务霸榜。逻辑、代码、数学能力全面提升。在MMLU(综合知识)上,Engram 模型提升了3.4 分;在CMMLU(中文知识)上,提升了4.0 分。在BBH(综合推理)上,Engram-27B 竟然比同参数的纯MoE 基线提升了整整5.0 分;MATH(数学):提升2.4 分;HumanEval(代码生成):提升3.0 分。ARC-Challenge(复杂推理):提升3.7 分。

      建议关注标的:

      互联网大厂合作伙伴:亚信科技、星环科技、泛微网络、新点软件、博思软件、长亮科技、东华软件、启明星辰、深信服、云赛智联、微盟、有赞等;应用厂商:合合信息、万兴科技、京北方、宇信科技、华宇软件、卫宁健康、创业慧康、嘉和美康、用友网络、金蝶国际等;

      算力基础设施:寒武纪、海光信息、弘信电子、首都在线、光环新网、优刻得、万国数据、科华数据、浪潮信息等。

      风险提示:技术不及预期、产业需求不及预期

鲜花

握手

雷人

路过

鸡蛋
【2024年5月31日最新敬告:文明发帖】

Archiver|手机版|小黑屋|股票之声 ( 京ICP备09051785号 )

GMT+8, 2026-7-28 19:44 , Processed in 0.035854 second(s), 7 queries , MemCache On.

Powered by Discuz! X3.4

Copyright © 2001-2021, Tencent Cloud.

返回顶部