找回密码
 注册

QQ登录

只需一步,快速开始

股票之声 › 首页 ›行业分析 › 查看内容

半导体行业 :DS V4.1 Flash释放硬件潜能 国产卡迈向10T模型时

2026-9-22 11:21| 发布者: 神童股手| 查看: 80| 评论: 0

摘要:   观点聚焦   投资建议   我们认为,DeepSeek V4.1 Flash的核心意义,是通过架构和推理系统优化,以更低的计算、存储和访存成本,实现更高的任
  观点聚焦

      投资建议

      我们认为,DeepSeek V4.1 Flash的核心意义,是通过架构和推理系统优化,以更低的计算、存储和访存成本,实现更高的任务完成效率与单位GPU产出。更直观地看,新模型为当下NVIDIAHopper系列GPU及类似产品“续命一代”:Global/Persistent KVCache压缩约75%/87.5%,打破模型规模与硬件需求同步膨胀的线性关系;同时以更小动态计算量,改善系统吞吐,增大用户并发。以V4.1 Flash的优化逻辑推演,我们看到原本需在NVIDIABlackwell系列64 卡系统承载的10T模型,有望在64 卡Hopper系列系统完成部署,即2026-2027 年主流性能的国产算力芯片(如昇腾960 系列)有望支持国产模型向10T-20T参数量**台持续扩张,国产算力需求的逻辑闭环再一次被印证。

      理由

      降本:V4.1 Flash并非简单缩小模型,而是系统性减少长上下文推理中的重复计算、存储和数据搬运。CED将40 层Transformer拆分为20 层Encoder与20 层Decoder,使长Prompt无需完整经过后20 层Decoder,从而降低Prefill计算量。CSA2 通过Full、Reindex、Reuse三类层分工复用Global KV与Top-K;叠加FP4Main KV和SWA Bounded Replay后,Global KV Cache降至V4Flash的约1/4,Persistent KV Cache降至约1/8。同时,Single-Pass mHC通过Kernel Fusion减少Activation重复读写,进一步缓解HBM带宽压力。

      增效:V4.1 Flash通过更小动态计算、外置记忆和更高Decode吞吐,以更低单位资源消耗获得更高任务完成效率。其Prefill和Decode阶段每Token分别仅激活约8B和16B参数;Engram将部分静态知识从主干动态计算中剥离并按需检索;DSpark则通过轻量Draft、置信度预测和动态调度提升Decode效率。

      盈利预测与估值

      维持所覆盖公司盈利预测和目标价不变。我们看好国产算力芯片及产业链公司成长,建议关注壁仞科技等标的。

      风险

      模型价格竞争风险,硬件供应链风险,AI商业化风险。

鲜花

握手

雷人

路过

鸡蛋

Archiver|手机版|小黑屋|股票之声 ( 京ICP备09051785号 )

GMT+8, 2026-10-5 20:21 , Processed in 0.049515 second(s), 8 queries , MemCache On.

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

返回顶部