AB
AiBoss
News

DeepSeek V4.1 Flash 架构解读:CED 与 CSA2 如何压缩长上下文显存

雷峰网发布深度解读文章,称 DeepSeek V4.1-Flash 采用因果编码器-解码器架构 CED 与第二代压缩稀疏注意力 CSA2,通过跨层 KV 复用、分层量化等方式压缩长上下文场景下的显存与缓存占用。文章给出的具体倍数与评测成绩均来自该报道,尚未获官方确认。

核心事实

据雷峰网发布的深度解读文章,DeepSeek V4.1-Flash 已上线,其最受关注之处是面向长上下文场景的全新架构。文章称该模型采用因果编码器-解码器架构 Causal-Encoder-Decoder(CED)、第二代压缩稀疏注意力 Compressed Sparse Attention 2(CSA2),并提供 low / high / max 三档可调推理力度旋钮。

报道称,CED 将 40 层网络分为前后两段:前 20 层以因果编码器通读上下文并输出浓缩摘要,后 20 层通过投影矩阵从摘要生成全局 KV 缓存,从而减少预填充计算量;CSA2 则实现跨层 KV 复用与跨层 Top-K 索引复用,并配合 FP4 量化压缩单份 KV 体积。

背景与影响

文章认为,长文本 Agent 场景中最耗资源的是预填充环节,而此前的混合注意力架构只提升了读取速度,未减少读取容量。报道称,在上述架构组合下,全局 KV 缓存被压缩至上一代 V4-Flash 的四分之一,落盘持久 KV 缓存降至八分之一,上下文从 4K 扩展到百万 Token 时解码计算量仅上涨约 25%。

报道还提到,该模型主干参数为 552B,外挂 196B Engram 记忆模块,预填充阶段仅激活 8B 参数、解码阶段激活 16B,并称其在部分内部评测中追平或反超上一代旗舰 V4-Pro,在 DeepSWE v1.1 与 CyberGym 等公开基准上取得成绩。文章同时提及唐杰团队《Trace as State》一文在思路上有相通之处,但实现路径不同。

限制与来源

需要说明的是,上述架构细节、压缩倍数、参数规模与评测成绩均来自雷峰网该篇报道及其引述的技术报告链接,尚未获 DeepSeek 官方独立确认,也未在本快讯中做任何实测验证。文中涉及的成本对比与价格描述为报道原文表述,不代表实际定价;模型能力、可用地区、账号与语言支持等,请以官网当前信息为准。本文不构成任何投资或采购建议。

来源:雷峰网《深度解读 DeepSeek V4.1 Flash 全新架构,如何成为显存杀手》。