| 观点聚焦 投资建议 我们认为,DeepSeek V4.1 Flash的核心意义,是通过架构和推理系统优化,以更低的计算、存储和访存成本,实现更高的任务完成效率与单位GPU产出。更直观地看,新模型为当下NVIDIAHopper系列GPU及类似产品“续命一代”:Global/Persistent KVCache压缩约75%/87.5%,打破模型规模与硬件需求同步膨胀的线性关系;同时以更小动态计算量,改善系统吞吐,增大用户并发。以V4.1 Flash的优化逻辑推演,我们看到原本需在NVIDIABlackwell系列64 卡系统承载的10T模型,有望在64 卡Hopper系列系统完成部署,即2026-2027 年主流性能的国产算力芯片(如昇腾960 系列)有望支持国产模型向10T-20T参数量**台持续扩张,国产算力需求的逻辑闭环再一次被印证。 理由 降本:V4.1 Flash并非简单缩小模型,而是系统性减少长上下文推理中的重复计算、存储和数据搬运。CED将40 层Transformer拆分为20 层Encoder与20 层Decoder,使长Prompt无需完整经过后20 层Decoder,从而降低Prefill计算量。CSA2 通过Full、Reindex、Reuse三类层分工复用Global KV与Top-K;叠加FP4Main KV和SWA Bounded Replay后,Global KV Cache降至V4Flash的约1/4,Persistent KV Cache降至约1/8。同时,Single-Pass mHC通过Kernel Fusion减少Activation重复读写,进一步缓解HBM带宽压力。 增效:V4.1 Flash通过更小动态计算、外置记忆和更高Decode吞吐,以更低单位资源消耗获得更高任务完成效率。其Prefill和Decode阶段每Token分别仅激活约8B和16B参数;Engram将部分静态知识从主干动态计算中剥离并按需检索;DSpark则通过轻量Draft、置信度预测和动态调度提升Decode效率。 盈利预测与估值 维持所覆盖公司盈利预测和目标价不变。我们看好国产算力芯片及产业链公司成长,建议关注壁仞科技等标的。 风险 模型价格竞争风险,硬件供应链风险,AI商业化风险。 |
Archiver|手机版|小黑屋|股票之声 ( 京ICP备09051785号 )
GMT+8, 2026-10-5 20:21 , Processed in 0.049515 second(s), 8 queries , MemCache On.
Powered by Discuz! X3.5
© 2001-2026 Discuz! Team.