导语:DeepSeek V4.1 Flash正式上线后引发广泛关注,著名测试机构Artificial Analysis给出40分指数评分,超过参数量大得多的V4 Pro。Sebastian Raschka甚至认为其创新之大应该叫DeepSeek V5。这篇技术报告揭示了552B参数如何干掉1.6T参数的秘密。

DeepSeek V4.1 Flash正式上线,又快又强,引发了广泛关注和测试热潮。著名测试机构Artificial Analysis对V4.1 Flash进行了非常充分的测试后,给出了40分的指数评分,超过了DeepSeek家参数量大得多的V4 Pro。DeepSeek自己也得出了这一结论,并表示会让V4 Pro下线。

图注

先看技术报告的标题:「DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression」。翻完架构章节,几乎每一处设计都能回溯到同一个目标:把KV缓存压下去。V4.1-Flash的全局KV缓存被压到每token 890字节,约为V4-Flash的1/4;与V1的389,120字节相比,这是437倍的差距。

图注

模型本身是552B主干参数外加196B Engram参数的多模态MoE,原生支持100万token上下文。这套数字组合起来才是"552B干掉1.6T"的真正含义:比较的核心是同样一次agent调用里,模型要占多少显存、要从SSD搬多少数据、要重算多少次prefill。

图注

CED架构是关键创新之一。V4.1-Flash的语言主干40层被切成两半:前20层是因果编码器,后20层是解码器。解码器各层的KV条目直接由第20层的隐藏状态映射得到,prefill阶段只需跑前20层。序列长度远大于窗口时,prefill的复杂度从O(NL)降到约O(NL/2),接近对半砍。

图注

CSA2管的是存储。报告把KV缓存的压缩空间归纳成三个互相相乘的维度:条目大小、序列维度、层维度。CSA2的做法是给每个层静态分配三种模式之一:Full模式自己算KV,Reindex模式复用前面某层的KV但用自己的索引器重新打分,Reuse模式全部沿用直接做稀疏注意力。

图注

架构之外还有两刀。第一刀在精度上,V4.1-Flash把FP4推进到了main KV缓存。第二刀在部署上,SWA Bounded Replay只回放最近的n_win个token,把SWA KV整个移出持久化缓存,改放进分布式内存池。这把一次灾难性的缓存未命中变成了一次廉价的优雅降级。

图注

所有这些加在一起的效果:上下文从4K拉到1M、放大256倍,V4.1-Flash的单token decode FLOPs只增加了1/4。报告坦率地表示这一版没有引入新的后训练算法,流程就是标准的SFT加RL加on-policy蒸馏,所有的改动都在数据管线上。

图注

后训练引入了一个对使用者直接可见的设计:reasoning effort。训练时把一个1到100的标量effort显式写进系统提示,同一effort下的多个采样构成子组做奖励中心化。DeepSeek API暴露的max、high、low三档对应的正是effort 100、75、50。

图注

把这份报告读完,会发现它最值得注意的是三个层次被拧在同一个方向上:架构层用CED砍掉一半prefill、用CSA2把跨层复用做到三个维度全覆盖,精度层把main KV压到FP4,部署层则用bounded replay把SWA KV整个赶出持久化缓存。任何单独一项都只能带来百分之几十的改善,叠在一起才效果显著。

图注

DeepSeek还开源了deepseek-recipe、DeepJIT、DeepSelect等代码仓库,方便部署V4.1 Flash及后续开源模型。DeepSelect是稀疏注意力中TopK内核以及采样器的高性能实现,与原生torch.topk相比实现了2到20倍的加速。

图注

Artificial Analysis的系统评测还显示,V4.1 Flash在智能体能力和长上下文推理方面进步明显,以69%在AutomationBench-AA上排名第一,与GPT-6 Astra持平。尽管是冗长度最高的模型之一,每个任务仍仅花费0.27美元,得益于其低定价策略。

图注

V4.1-Flash里Engram第一次进了正式版模型:196B参数平均分给两个模块,放在第1层和第14层,采用{2,3,4}阶N-gram、8个哈希头。投机解码模块DSpark由三个Transformer block组成,一次前向并行给出五个草稿位置的base logits,加速线上服务和RL的rollout生成。

图注

Single-Pass mHC把混合系数错开一个block,三步融进一个叫Mega-mHC的kernel里,激活访存从(4n+4)d降到(2n+2)d正好减半。优化器层面,Q、K权重用head-wise Muon处理注意力头之间的异质性,Engram嵌入表用动量更新配Sinkhorn平衡替代Adam,省下大量优化器状态显存。

图注

effort从25提到100,八个推理密集型基准的平均Pass@1从67.1%升到76.3%,DeepSWE从66.0%到74.2%,Terminal-Bench从82.4%到90.6%,代价是约2.5倍的输出token。60到80档已经能用不到一半的token预算拿到接近满档的准确率,报告建议把max留给最难的任务。

图注

值得注意的是,DeepSeek已经开始灰度语音交互功能。这份技术报告展现的不仅是单个模型的突破,更是DeepSeek在架构、精度、部署三个层面系统性优化的思路,为大模型的高效推理提供了新的范式参考。

图注

免责声明:本文基于公开报道的事实信息整理,仅供参考。AI新纪元聚焦人工智能前沿动态,内容来源于公开渠道,如有不实请联系我们删除。

点赞(0)

评论列表 共有 0 条评论

暂无评论
立即
投稿
发表
评论
返回
顶部