摘要

DeepSeek-V4 并不是一次单纯的“参数继续变大”。它真正试图解决的问题是:

当上下文从 128K 继续扩展到 1M Token 后,如何让注意力计算、KV Cache、训练、RL、Agent 状态和在线服务仍然具有可接受的成本?

DeepSeek-V4 系列包含两个 MoE 模型:

模型总参数每 Token 激活参数上下文
DeepSeek-V4-Flash284B13B1M
DeepSeek-V4-Pro1.6T49B1M

论文给出的核心结果是:在 1M Token 场景中,V4-Pro 的单 Token 推理 FLOPs 约为 DeepSeek-V3.2 的 27%,KV Cache 约为后者的 10%。这意味着百万上下文第一次不再只是“模型理论上能塞进去”,而是被当成一个需要系统性优化的常规工作区间。

DeepSeek-V4 的技术主线可以概括为:

DeepSeek-V3 / V3.2

更大的 MoE 容量
        +
mHC:重构残差路径
        +
CSA:压缩后再稀疏检索
        +
HCA:更激进的 KV 压缩
        +
Sliding Window:补回局部细节
        +
Muon:提升大规模训练效率
        +
1M Context Training / RL
        +
Interleaved Thinking / Agent
        +
KV Cache / Sandbox / Serving Infrastructure

DeepSeek-V4

它最值得关注的地方不是某一个独立模块,而是 Architecture + Optimizer + Training + Inference + Agent Infrastructure 的联合设计


一、核心结论

DeepSeek-V4 最重要的技术价值可以归纳为六点。

1. 百万上下文从“能力指标”变成“系统设计目标”

过去很多模型虽然声明支持 1M Token,但真正运行到百万级上下文时,会同时遇到:

  • Attention FLOPs 快速增长;
  • KV Cache 占用巨大;
  • Prefill 延迟过高;
  • 长轨迹 RL 成本失控;
  • Agent 多轮状态难以长期保存;
  • 在线服务难以复用超长 Prefix。

V4 从注意力架构、KV 表示、缓存、训练并行和 RL 基础设施多个层面一起解决这些问题。

2. CSA + HCA 是 V4 最核心的架构变化

DeepSeek-V4 不再把所有历史 Token 以同等粒度保存和计算,而是建立两种不同程度的压缩路径:

  • CSA(Compressed Sparse Attention):先压缩 KV,再用索引器选 Top-k;
  • HCA(Heavily Compressed Attention):以更高压缩率形成全局记忆;
  • Sliding Window Attention:保留最近局部 Token 的高分辨率信息。

本质上,它把长上下文表示变成:

Recent Tokens
→ High Resolution

Medium / Important History
→ Compressed + Sparse Retrieval

Very Long History
→ Heavily Compressed Global Memory

3. DeepSeek 继续扩大 MoE,而不是扩大每 Token 计算量

V4-Pro 达到 1.6T 总参数,但每 Token 激活约 49B;V4-Flash 总参数 284B,每 Token 激活仅 13B。

模型规模和单 Token 计算成本继续解耦:

Model Capacity≉Per-token Compute\text{Model Capacity} \not\approx \text{Per-token Compute}

这仍然是 DeepSeek 从 V2/V3 延续下来的核心 scaling 路线。

4. mHC 表明 Residual Path 本身正在成为可学习结构

mHC(Manifold-Constrained Hyper-Connections)不再把残差连接视为固定的:

xl+1=xl+F(xl)x_{l+1}=x_l+F(x_l)

而是维护多条 residual streams,并动态学习输入、残差混合和输出映射,同时使用双随机矩阵约束保证深层网络中的数值稳定性。

5. Post-training 的重点从传统 RL 转向 On-Policy Distillation

V4 将此前 mixed RL 阶段替换为 On-Policy Distillation(OPD)。统一模型作为 student,在自身分布产生的轨迹上向 specialist teacher 学习。

这代表一个重要趋势:

Frontier model 的 post-training 不一定继续依赖越来越复杂的单一 reward,而可能转向“专家模型 → 统一模型”的在线知识迁移。

6. Agent 能力已经与 Context Architecture 深度耦合

1M Token 不只是为了读一本书或一个超长 PDF。

它更重要的用途是:

  • 保存长期 reasoning state;
  • 保存 Tool Call / Tool Result;
  • 保存代码仓库上下文;
  • 保存多阶段任务历史;
  • 支持数百步 Agent 交互。

因此 V4 的“Long Context”实际上已经与 Agent Runtime 融合。


二、模型整体规格

项目DeepSeek-V4-FlashDeepSeek-V4-Pro
总参数量284B1.6T
每 Token 激活参数13B49B
Transformer 层数4361
Hidden Size40967168
Routed Experts256384
Shared Expert11
每 Token 激活 Routed Experts66
CSA Compression
HCA Compression128×128×
CSA Top-k5121024
Sliding Window128128
mHC Expansion44
上下文长度1M1M
预训练 Token32T32T+ 级训练体系
OptimizerMuon + AdamWMuon + AdamW
架构MoEMoE

这里最值得注意的是 V4-Flash。

13B activated parameters 意味着它在单 Token 计算量上更接近一个中型 dense model,但背后拥有 284B 的专家容量。论文实验也显示:在给予更多 test-time reasoning budget 后,Flash 在部分 reasoning 任务上可以接近 Pro。

这意味着未来推理系统可以进一步把:

Model Size
Reasoning Budget
Latency
Cost

作为四个独立旋钮,而不是简单用“更大的模型一定更贵”描述。


三、整体架构

DeepSeek-V4 仍然以 Transformer 为主体,同时继承:

  • DeepSeekMoE;
  • Multi-Token Prediction;
  • RMSNorm 等既有设计。

新增核心结构是:

Input Tokens

Embedding

┌─────────────────────────────┐
│ Transformer Block × L       │
│                             │
│  Pre-Block mHC Mixing       │
│          ↓                  │
│  CSA / HCA Hybrid Attention │
│          ↓                  │
│  DeepSeekMoE                │
│          ↓                  │
│  Residual mHC Mixing        │
│          ↓                  │
│  Post-Block mHC Mixing      │
└─────────────────────────────┘

Prediction Head

LM Loss + MTP Loss

V4 的设计实际上同时优化了三个维度:

维度技术
参数容量DeepSeekMoE
序列长度CSA + HCA + SWA
网络深度信息流mHC

因此它不是只在“横向 Token 维度”优化 Attention,也在“纵向 Layer 维度”重构信息传播。


四、mHC:重新设计 Residual Connection

4.1 为什么传统残差连接开始成为限制

标准 Transformer 使用:

xl+1=xl+Fl(xl)x_{l+1}=x_l+F_l(x_l)

这个设计极其成功,但随着模型不断加深,它存在一个基本限制:

每层只有一条主 residual stream,信息进入 block 后只能通过固定加法回到主干。

Hyper-Connections 的思路是把单一 residual stream 扩展为多个 stream,使不同层可以动态混合信息。

但如果动态混合矩阵完全自由,深层堆叠后容易出现:

  • 激活放大;
  • 梯度不稳定;
  • 信号抵消;
  • loss spike。

4.2 mHC 的关键:把残差混合限制在稳定流形上

V4 使用三组动态映射:

A_l : Pre-Block Input Mixing
B_l : Residual Stream Mixing
C_l : Post-Block Output Mixing

其中最关键的是 BlB_l

DeepSeek 将它投影为 doubly stochastic matrix(双随机矩阵)

  • 每个元素非负;
  • 每行和为 1;
  • 每列和为 1。

实现上使用 Sinkhorn-Knopp 迭代。

直观理解:

普通 Residual
stream → stream

Hyper-Connection
stream1 ─┐
stream2 ─┼→ arbitrary mixing
stream3 ─┤
stream4 ─┘

mHC
stream1 ─┐
stream2 ─┼→ constrained stable mixing
stream3 ─┤
stream4 ─┘

这种约束使信息可以重新路由,但整体信号规模不会轻易爆炸。

4.3 为什么 mHC 值得长期关注

Transformer 过去的 scaling 主要集中在:

  • Width;
  • Depth;
  • Attention;
  • FFN;
  • MoE。

Residual connection 很少被当成核心 scaling 维度。

mHC 说明:

未来网络的 Layer-to-Layer 信息流本身也可能成为可学习的 routing system。

这一方向与 Kimi K3 中 Attention Residuals 所体现的趋势高度一致:下一代模型开始重新审视“层之间应该如何传递信息”。


五、CSA:Compressed Sparse Attention

CSA 是 V4 长上下文能力的第一条主线。

5.1 传统 Sparse Attention 的问题

Sparse Attention 通常试图从 NN 个历史 Token 中选出少量相关 Token:

NK,KNN \rightarrow K,\quad K \ll N

但在 1M Token 场景中,即使最终只选择 Top-k,索引和 KV 存储本身仍然可能很重。

CSA 进一步增加一个步骤:

Original KV

Block Compression

Compressed KV

Lightning Indexer

Top-k Compressed Blocks

Core Attention

即:

先降低搜索空间分辨率,再做稀疏检索。

5.2 4× KV Compression

V4 的 CSA compression ratio 为:

m=4m=4

也就是大约每 4 个原始 Token 形成一个压缩 KV entry。

压缩不是简单 average pooling,而是学习每个 Token 对压缩表示的贡献权重。

因此:

Token 1 ─┐
Token 2 ─┤
Token 3 ─┼→ Learned Compression → Compressed KV
Token 4 ─┘

5.3 Lightning Indexer

压缩之后仍然可能存在数十万 KV blocks,因此 V4 再使用轻量 indexer 为 Query 计算相关度,然后选择 Top-k。

V4-Flash:

Compressed History

Top-512

Core Attention

V4-Pro:

Compressed History

Top-1024

Core Attention

因此主 Attention 不需要访问整个 1M 上下文。

5.4 CSA 的本质

CSA 可以理解成一种内置于 Transformer Layer 中的 learned retrieval:

Long Context

Compression

Learned Index

Relevant Memory Blocks

Attention

它和外部 RAG 的差异是:

RAGCSA
检索外部文档检索模型当前 Context
通常基于 embedding与 Attention 联合训练
文档/Chunk 粒度Token Block 粒度
Runtime 外部系统Model Architecture 内部

因此 V4 已经开始模糊:

Attention 与 Retrieval 的边界。


六、HCA:Heavily Compressed Attention

如果 CSA 是“压缩后精确检索”,HCA 更接近“低分辨率全局记忆”。

V4 设置:

m=128m'=128

即大约每 128 个 Token 压缩为一个 KV entry。

对于 1M Token:

1,000,000/1287,8121,000,000 / 128 \approx 7,812

百万 Token 的全局历史因此可以被压缩为不到一万个高层表示。

6.1 HCA 为什么不需要 Top-k

当历史已经压缩 128 倍后,完整访问这些压缩 entry 的成本已经大幅下降。

因此可以理解为:

1M Tokens
   ↓ 128× Compression
~7.8K Global Memory Entries

Global Attention

它提供的是一种 coarse-grained global awareness。

6.2 HCA 的代价

高压缩必然丢失细节。

例如:

128 tokens
→ 1 vector

不可能完整保存其中每一个数字、变量名、代码符号或事实。

因此 HCA 不能单独承担长上下文。

这正是为什么 V4 采用 Hybrid Attention。


七、Hybrid Attention:多分辨率记忆系统

V4 真正重要的不是 CSA 或 HCA 单独存在,而是二者与 Sliding Window 组合。

可以把它理解成三层 Memory Hierarchy:

┌───────────────────────────────┐
│ Sliding Window                │
│ 最近 128 Tokens               │
│ 高精度 / 低延迟                │
├───────────────────────────────┤
│ CSA                           │
│ 4× Compression + Top-k       │
│ 中高精度稀疏历史               │
├───────────────────────────────┤
│ HCA                           │
│ 128× Compression             │
│ 低分辨率全局历史               │
└───────────────────────────────┘

这与计算机存储层次非常相似:

Registers / L1

Memory

Storage

在 LLM 中变成:

Local Exact Context

Sparse Relevant Context

Compressed Global Context

这是 V4 最值得关注的设计思想。


八、为什么 1M Token 的 KV Cache 能显著下降

论文指出,在 1M Token 场景下,V4-Pro 相比 V3.2:

  • Single-token inference FLOPs 约降低到 27%
  • KV Cache 约降低到 10%

同时,相比常见 BF16 GQA8、head dimension 128 的 Attention 配置,V4 的 KV Cache 可以下降到约 2% 的量级。

主要来自四个因素。

8.1 KV Compression

CSA:

NN/4N \rightarrow N/4

HCA:

NN/128N \rightarrow N/128

8.2 FP8 KV Storage

V4 对 KV 使用混合精度:

  • RoPE 相关维度:BF16;
  • 其他维度:FP8。

仅这一项就接近把 KV storage 减半。

8.3 FP4 Indexer

Lightning Indexer 的 Attention 使用 FP4 计算。

由于 Indexer 的目标只是选出候选,而不是直接生成最终 representation,因此更适合低精度。

8.4 Sparse Core Attention

CSA 最终只对 Top-k compressed KV 执行主 Attention。

因此计算复杂度不再直接跟完整 NN 成比例增长。


九、Muon:Optimizer 也成为 Scaling 的一部分

DeepSeek-V4 大部分参数不再使用传统 AdamW,而采用 Muon optimizer

AdamW 仍用于:

  • Embedding;
  • Prediction Head;
  • RMSNorm 参数。

其余主要矩阵参数使用 Muon。

9.1 为什么 Muon 值得关注

Adam 类优化器主要在 parameter-wise 维度维护统计量,而 Muon 更强调矩阵更新的几何结构。

对于 Transformer 中大量二维权重矩阵,这种方法可能带来:

  • 更高 sample efficiency;
  • 更快 convergence;
  • 更好的大模型训练稳定性。

DeepSeek 采用 Muon 说明它已经从研究型 optimizer 进入 trillion-parameter frontier model 的生产训练。

9.2 Optimizer 与 Infrastructure 必须联合设计

Muon 的问题不是公式本身,而是:

  • optimizer state;
  • distributed sharding;
  • matrix orthogonalization;
  • communication;
  • memory;
  • kernel efficiency。

因此 V4 专门实现高效 Muon training infrastructure。

这再次说明 frontier model 的创新单位已经不是单一算法,而是:

Algorithm
   +
Kernel
   +
Distributed Runtime
   +
Memory Layout

十、32T Token 预训练

DeepSeek-V4 使用超过 32T 的多样化高质量 Token。

数据包含:

  • Web;
  • 数学;
  • Code;
  • 长文档;
  • 科学论文;
  • 技术报告;
  • 多语言数据;
  • Agentic data。

与普通“增加更多网页”不同,V4 明确加强:

Long-document data curation

这是百万上下文模型经常被忽略的一点。

拥有 1M context architecture 并不意味着模型自然学会利用 1M context。

如果训练数据仍然主要是:

2K / 4K / 8K independent documents

模型不会自动获得稳定的长程信息组织能力。

因此真正的 long-context scaling 是:

Architecture
+
Training Sequence Construction
+
Long Document Data
+
Position Extrapolation / Training
+
Post-training
+
Serving

十一、训练稳定性:Anticipatory Routing

大规模 MoE 的一个典型问题是 routing 与 backbone 同时变化。

当 Router 根据不断变化的 hidden representation 重新分配 expert 时,可能产生 feedback loop:

Backbone Changes

Routing Changes

Expert Distribution Changes

Gradient Distribution Changes

Backbone Changes Again

极端情况下会触发 loss spike。

V4 提出 Anticipatory Routing

Current Backbone θ_t

Feature Computation

Historical θ_(t-Δ)

Precomputed Routing

也就是让 routing 暂时滞后于 backbone 更新。

论文报告其完整启用会增加约 20% wall-clock overhead,因此实际系统会:

  1. 自动检测 loss spike;
  2. 发生异常时 rollback;
  3. 临时启用 Anticipatory Routing;
  4. 稳定后恢复正常训练。

这个设计很有工程味道。

它不是追求“任何时候都使用更稳定算法”,而是:

把昂贵的稳定机制做成异常恢复路径。


十二、SwiGLU Clamping

V4 训练还使用 SwiGLU clamping:

  • linear component 限制在 [-10, 10]
  • gate component 上界限制为 10

目的不是提升表达能力,而是控制 activation outlier。

随着:

  • FP8 / FP4;
  • 超大 MoE;
  • 超长序列;
  • 大 batch;

数值 outlier 的破坏性会越来越明显。

因此现代大模型训练开始越来越像数值系统工程:

Model Architecture
+
Optimizer
+
Precision
+
Clamping
+
Normalization
+
Routing Stability

缺一项都可能导致 trillion-scale training run 失败。


十三、Post-training:为什么用 On-Policy Distillation

DeepSeek-V4 最值得关注的 post-training 改动之一,是把此前 mixed RL 阶段替换为 On-Policy Distillation(OPD)

基本结构可以抽象为:

Specialist Teachers

Unified Student generates its own trajectories

Teacher evaluates / provides target distribution

Reverse-KL Optimization

Unified DeepSeek-V4

13.1 为什么强调 On-Policy

普通 distillation 常见问题是 teacher 生成的数据与 student 自己推理时遇到的状态分布不同。

On-policy 的关键是:

Student 在自己的行为分布上产生 trajectory,再学习 teacher 在这些状态下会如何决策。

这对 Agent 尤其重要。

因为 Agent 的第 20 步输入通常取决于前 19 步自己的行为。

如果只训练 teacher 的理想 trajectory:

Teacher State → Teacher Action

部署时 student 一旦前面犯错,就可能进入训练数据从未覆盖的状态。

On-policy distillation 更接近:

Student State

Teacher Guidance

Student Improvement

十四、Thinking 与 Agent Context Management

DeepSeek-V4 使用新的 DSML tool-call schema,并采用 XML 风格 Tool Call。

更重要的是它继续演进 thinking state management。

V3.2 会:

  • 在 tool-result round 之间保留 reasoning;
  • 新 user message 到来后丢弃历史 reasoning。

V4 借助 1M context,进一步强化 interleaved thinking。

可以把 Agent state 理解成:

User Goal

Reasoning

Tool Call

Tool Result

Reasoning

Tool Call

...

过去为了节省 Context,系统经常主动删除 reasoning history。

但这会造成:

State Loss
→ Re-planning
→ Repeated Work
→ Goal Drift

百万上下文允许模型保留更多连续执行状态。

因此 V4 的 1M Token 对 Agent 的意义可能大于对普通 Chat 的意义。


十五、百万 Token Agent 的真正瓶颈

即使 Attention 已经足够便宜,Agent 仍然存在其他瓶颈。

15.1 Context Pollution

更多 Token 并不一定更好。

长期任务中会积累:

  • 过期计划;
  • 无关日志;
  • 重复 Tool Result;
  • 错误推理;
  • 大量代码输出。

因此:

Useful ContextAll Historical Context\text{Useful Context} \neq \text{All Historical Context}

15.2 Retrieval Accuracy

CSA/HCA 可以降低计算量,但压缩和 sparse selection 仍可能漏掉关键细节。

例如一个 800K Token 之前出现的:

port = 18473

如果它被 128× HCA 压缩,精确数字可能无法恢复。

因此百万上下文并不能完全替代:

  • structured memory;
  • semantic retrieval;
  • database;
  • code index;
  • artifact store。

15.3 Long-Horizon Planning

Context 解决的是“能不能看到历史”。

它并不自动解决:

  • Goal decomposition;
  • Verification;
  • Error recovery;
  • Planning;
  • Memory consolidation。

因此:

1M Context ≠ 1M Token Reliable Agent

十六、推理基础设施:KV Cache 开始进入磁盘

V4 在 serving 中引入 On-Disk KV Cache,用于复用 shared-prefix request。

对于 CSA/HCA:

  • 压缩后的 KV 可以直接写入磁盘;
  • Prefix 命中后读取并恢复;
  • 未完整 compression block 的尾部需要重新计算。

对于 SWA,由于未压缩 KV 更大,论文讨论三种策略:

Full SWA Caching

优点:

  • 几乎不需要重算。

缺点:

  • 磁盘写入量巨大;
  • 实际读取只用最后一个窗口,I/O 利用率差。

Periodic Checkpointing

每隔一定 Token 保存一个 SWA checkpoint。

这是:

Storage ↔ Recompute

之间的折中。

Zero SWA Caching

不保存 SWA KV,仅利用 CSA/HCA cache 重建最近窗口。

它增加计算,但显著减少存储。

这意味着 KV Cache 已经从 GPU memory management 问题演化为:

GPU HBM

CPU Memory

SSD

Distributed Prefix Cache

一种新的模型 Serving Storage Hierarchy。


十七、Batch-Invariant Deterministic Kernel

大规模在线推理和 RL 中,一个经常被忽略的问题是:

同一个 request 因为 batch composition 不同,是否会产生不同输出?

浮点计算顺序、kernel implementation、并行 reduction 都可能导致微小差异。

在普通 Chat 中这通常可以接受。

但在:

  • RL rollout;
  • preemption;
  • fault recovery;
  • reproducibility;

场景中,它会变成系统问题。

DeepSeek 因此建设 batch-invariant 和 deterministic kernel library。

这类基础设施的重要性会随着 Agent 和 RL 规模增长持续上升。


十八、百万 Token RL

1M Token rollout 会制造非常大的训练样本。

如果每条轨迹包含:

Prompt
+ Reasoning
+ Tool Calls
+ Tool Results
+ Generated Tokens
+ LogProbs
+ Rewards
+ Masks

单条 trajectory 就可能非常庞大。

V4 将 rollout data 拆成:

Lightweight Metadata
        +
Heavy Per-token Fields

然后:

  • metadata 用于全局 shuffle / packing;
  • per-token 数据通过 shared memory 按需加载;
  • mini-batch 消费后立即释放;
  • 根据 workload 动态决定 device mini-batch 数量。

这说明百万 Token 不只是模型架构问题,也是 DataLoader 和训练数据格式问题。


十九、DSec:Agent Sandbox 成为训练基础设施

DeepSeek 构建了 DeepSeek Elastic Compute(DSec) 作为 Agent sandbox 平台。

论文描述其核心由三个 Rust 组件组成:

Apiserver

Edge Agent

Watcher

3FS

生产集群可以管理数十万并发 sandbox。

这是非常重要的信号。

训练 Agent 已经不再是:

Prompt → Model → Reward

而是:

Task

Model

Sandbox

Shell / Code / Files / Tools

Environment State

Reward / Verification

Training

因此未来 frontier Agent model 的核心基础设施不仅是 GPU Cluster,还包括大规模隔离执行环境。


二十、Benchmark 如何解读

20.1 Base Model

论文中 V4-Pro-Base 相比 V3.2-Base 有明显提升。

部分结果:

BenchmarkV3.2 BaseV4-Flash BaseV4-Pro Base
MMLU-Pro65.568.373.5
SimpleQA Verified28.330.155.2
FACTS Parametric27.133.962.6
HumanEval62.869.576.8
LongBench-V240.244.751.5

最明显的提升来自:

  • World Knowledge;
  • Long Context;
  • HumanEval 等代码任务。

20.2 Frontier Comparison

DeepSeek-V4-Pro-Max 与论文同期 frontier model 的部分结果:

BenchmarkOpus 4.6 MaxGPT-5.4 xHighGemini 3.1 Pro HighDS-V4-Pro Max
MMLU-Pro89.187.591.087.5
SimpleQA Verified46.245.375.657.9
GPQA Diamond91.393.094.390.1
HLE40.039.844.437.7
LiveCodeBench88.8-91.793.5
Codeforces Rating-316830523206
Apex Shortlist85.978.189.190.2
TerminalBench 2.065.475.168.567.9
SWE Verified80.8-80.680.6
BrowseComp83.782.785.983.4
Toolathlon47.254.648.851.8

20.3 更合理的结论

V4-Pro-Max 不能简单描述为“全面超过闭源模型”。

更准确的判断是:

  • Coding / competitive programming 已进入最前沿区间;
  • Knowledge 与 Gemini 3.1 Pro 仍有明显差距;
  • Agent benchmark 整体进入 frontier cluster,但并非稳定领先;
  • Long-context 是 V4 最具差异化的能力之一;
  • Max reasoning mode 的成绩依赖显著 test-time compute。

因此:

DeepSeek-V4 的突破重点不是“所有 benchmark 第一”,而是在开放模型中同时实现 frontier capability 与显著更高的百万上下文效率。


二十一、DeepSeek-V4-Pro 与 V4-Flash 如何理解

V4-Flash 不是简单的“缩水 Pro”。

它更像是另一条 scaling 路线:

V4-Pro
Large Activated Model
49B active
→ Strong Knowledge / Hard Tasks

V4-Flash
Small Activated Model
13B active
+ More Test-Time Compute
→ Cost-efficient Reasoning

这反映一个越来越重要的趋势:

Capability=f(Model Capacity,Activated Params,Context,Test-Time Compute)\text{Capability} = f( \text{Model Capacity}, \text{Activated Params}, \text{Context}, \text{Test-Time Compute} )

未来模型产品可能不再只提供:

Small / Medium / Large

而是:

Small Active Model + High Reasoning Budget
Large Active Model + Low Reasoning Budget
Large Active Model + Max Reasoning Budget

根据任务动态选择。


二十二、与 DeepSeek-V3 / V3.2 的关系

DeepSeek-V4 并没有推翻 V3,而是继续沿着 V3 的工程路线演进。

V3 的重点

DeepSeekMoE
+
MLA
+
FP8 Training
+
MTP
+
Large-scale Training Infrastructure

V3.2 的重点

进一步强化:

  • Sparse Attention;
  • Reasoning;
  • Agent;
  • Tool use。

V4 的重点

MoE Scaling
+
Compressed Attention
+
Hybrid Memory Resolution
+
mHC
+
Muon
+
1M Context
+
Long-Horizon Agent
+
Million-Token RL / Serving

因此 V4 可以理解为:

DeepSeek 把 V3 的高效 MoE 路线扩展到 million-token agentic computing。


二十三、与 Kimi K3 的技术路线对比

DeepSeek-V4 和 Kimi K3 都在解决同一个核心问题:

Frontier model 如何在 1M Token 和长程 Agent 场景下继续扩展?

但路线不同。

维度DeepSeek-V4Kimi K3
长上下文核心CSA + HCAKimi Delta Attention + Gated MLA
思路压缩 + Sparse Softmax AttentionLinear / Delta Attention + Attention
深度信息流mHCAttention Residuals
MoEDeepSeekMoEStable LatentMoE
OptimizerMuonPer-Head Muon 等
Context1M1M
Agent强化 long-horizon tool use强化 long-horizon production tasks
主要方向高效百万上下文超大规模 Agent / multimodal work

两者共同释放出一个信号:

2024:
Transformer + Dense Attention

2025:
MoE + MLA / Sparse Attention

2026:
Hybrid Attention
+ Learnable Residual Routing
+ Million-token Context
+ Agent Infrastructure

下一代模型越来越不像一个单纯的 Transformer,而像一个层级化计算与记忆系统。


二十四、CSA/HCA 与 Linear Attention:谁更可能胜出

V4 没有选择完全替换 Softmax Attention。

这是一个重要判断。

Linear Attention 的优势

  • 理论复杂度低;
  • Streaming 友好;
  • recurrent state 小;
  • 超长序列成本稳定。

Linear Attention 的问题

  • 精确 recall 较弱;
  • associative memory 容量受限;
  • 复杂 retrieval 容易退化。

V4 的选择

V4 保留 Softmax Attention 的精确匹配能力,但通过:

Compression
+
Sparse Selection
+
Low Precision

控制成本。

因此未来更可能不是:

Softmax Attention
VS
Linear Attention

而是:

Local Exact Attention
+
Sparse Retrieval Attention
+
Compressed Global Memory
+
Optional Recurrent / Linear State

混合架构。


二十五、百万上下文是否会替代 RAG

不会。

V4 反而说明模型内部也开始采用类似 retrieval 的结构。

Context Window 适合

  • 当前任务轨迹;
  • 当前代码仓库工作集;
  • 当前文档集合;
  • Tool Result;
  • 临时状态;
  • 多轮 reasoning。

RAG / External Memory 适合

  • 超大知识库;
  • 长期知识;
  • 可更新数据;
  • 权限控制;
  • 精确来源;
  • 跨 Session memory。

更合理的 Agent Memory Architecture 是:

Immediate Context

1M Working Memory

Internal Sparse Attention

External Retrieval

Structured Long-Term Memory

百万上下文扩大的是 Working Memory,不是无限知识库。


二十六、对 Agent Runtime 的启示

DeepSeek-V4 对 Agent 系统设计有几个直接启示。

26.1 Reasoning State 应成为一等状态

传统 Chat Runtime 主要保存:

messages[]

长程 Agent 更需要:

Conversation State
Reasoning State
Tool State
Artifact State
Execution State
Memory State

如果 Runtime 只保存 visible messages,模型每次都需要重新构建计划。

26.2 Context 不应该只有“保留/删除”两个选项

V4 的 CSA/HCA 本身就是多分辨率 Context。

Agent Runtime 也可以采用类似策略:

Recent History
→ Full Fidelity

Important Historical Steps
→ Structured Summary

Old Tool Outputs
→ Artifact Reference

Long-Term Knowledge
→ Vector / Database Retrieval

26.3 Prefix Cache 会成为 Agent 成本优化重点

Agent 经常拥有巨大稳定 Prefix:

System Prompt
+ Tool Schemas
+ Repository Context
+ Project Instructions
+ Historical State

如果每次 Tool Round 都重新 Prefill,成本极高。

因此未来 Agent Runtime 必须原生考虑:

  • Prefix cache;
  • Cache persistence;
  • Cache invalidation;
  • Cross-request reuse;
  • SSD-backed cache。

26.4 Sandbox 是 Agent Model 的基础设施,而不是插件

V4 的 DSec 说明 frontier Agent 训练需要海量真实 execution environment。

Agent Runtime 设计中,Sandbox 不应只是:

optional tool

而应成为:

Model

Policy / Permission

Sandbox Runtime

Tools

Artifacts

的核心层。


二十七、对本地模型的启示

DeepSeek-V4-Pro 本身不适合个人设备本地运行。

即使假设 4-bit 权重:

1.6T×0.5 byte800 GB1.6T \times 0.5\text{ byte} \approx 800\text{ GB}

还没有计算:

  • scale metadata;
  • runtime workspace;
  • expert buffers;
  • KV cache;
  • activation;
  • routing / communication buffers。

V4-Flash:

284B×0.5 byte142 GB284B \times 0.5\text{ byte} \approx 142\text{ GB}

仍然超过普通消费级 Mac 的合理部署范围。

但 V4 对本地推理最重要的价值不是权重,而是架构思想:

  • KV compression;
  • mixed-precision KV cache;
  • sliding window + compressed memory;
  • SSD prefix cache;
  • low-precision indexer;
  • context-aware cache hierarchy。

这些技术未来完全可能下沉到 2B–30B 级本地模型。


二十八、论文最值得关注的创新

如果只选择最重要的技术点,我会按以下顺序排序。

第一梯队

  1. CSA + HCA Hybrid Attention
  2. 百万 Token 场景下 KV Cache / FLOPs 系统性下降
  3. mHC
  4. On-Policy Distillation

第二梯队

  1. Muon 在超大规模模型中的生产化;
  2. On-disk KV Cache;
  3. Million-token RL infrastructure;
  4. Batch-invariant deterministic kernels;
  5. Anticipatory Routing;
  6. DSec Agent Sandbox。

真正的突破不是某个公式,而是这些模块组合后形成:

Million-token Model
       +
Million-token Training
       +
Million-token RL
       +
Million-token Serving
       +
Long-horizon Agent

完整闭环。


二十九、论文的局限性

29.1 很多结果仍来自官方 Evaluation

部分:

  • Real-world task;
  • Chinese writing;
  • Search;
  • White-collar task;

使用 DeepSeek 内部 evaluation framework。

这些结果具有参考价值,但独立第三方复现仍然重要。

29.2 1M Context Benchmark 仍不能完全代表真实 Agent

LongMRCR、CorpusQA 等 benchmark 可以验证长上下文 retrieval,但真实 Agent 更复杂:

Read
→ Plan
→ Act
→ Observe
→ Modify Environment
→ Recover from Error
→ Continue

单纯 long-context QA 无法覆盖这种动态过程。

29.3 Compression 的信息损失需要更多分析

HCA 128× compression 非常激进。

论文展示了整体 benchmark,但对:

  • exact retrieval failure;
  • numeric detail loss;
  • code symbol loss;
  • adversarial long-context placement;

仍值得更细粒度研究。

29.4 系统复杂度显著提高

V4 的效率不是“免费”的。

它依赖:

  • 专用 sparse kernel;
  • FP4 indexer;
  • mixed KV precision;
  • custom cache layout;
  • mHC;
  • Muon;
  • expert parallelism;
  • deterministic kernels;
  • SSD KV cache。

因此模型 checkpoint 开放并不意味着第三方可以轻松复现官方 serving efficiency。


三十、长期影响

DeepSeek-V4 最重要的长期意义可能不是 1.6T 参数,而是它展示了一种新的模型形态。

过去 Transformer 的基本假设是:

All Context
→ Token-level KV
→ Attention

V4 开始变成:

Context
  ├─ Local Exact Memory
  ├─ Sparse Compressed Memory
  └─ Global Heavily Compressed Memory

Dynamic Retrieval

Transformer Computation

也就是说,模型内部开始出现明确的 Memory Hierarchy

这可能是百万乃至千万 Token Context 真正可持续的方向。


三十一、综合评价

维度评价
架构创新9.5/10
长上下文设计10/10
MoE Scaling9/10
训练系统9.5/10
Agent 基础设施9.5/10
推理效率10/10
Benchmark 领先程度9/10
第三方部署难度很高
对未来模型架构影响很高

最终判断

DeepSeek-V4 的本质不是“DeepSeek 做了一个 1.6T 参数模型”,而是:

DeepSeek 正在把 Transformer 从统一分辨率的 Token Attention 系统,改造成具有多级压缩、稀疏检索、动态残差路由和持久化缓存的层级记忆计算系统。

CSA 负责在压缩历史中进行精确稀疏检索,HCA 提供低成本全局记忆,Sliding Window 保留局部细节,mHC 重构跨层信息流,MoE 扩展参数容量,Muon 提升训练效率,而 1M Context RL、On-Disk KV Cache、deterministic kernel 和 DSec 又把这些模型能力真正延伸到了长程 Agent。

如果说 DeepSeek-V3 的代表性贡献是:

高效 MoE + MLA + FP8

那么 DeepSeek-V4 更接近:

MoE
+
Hierarchical Context Memory
+
Learned Residual Routing
+
Million-token Infrastructure
+
Long-horizon Agent

它代表的不是一次普通模型升级,而是 2026 年大模型架构从“更大的 Transformer”向 高效长上下文计算系统 转型的一个重要节点。


参考资料

  1. DeepSeek-AI. DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence. arXiv:2606.19348, 2026.
  2. DeepSeek-AI. DeepSeek-V3 Technical Report. arXiv:2412.19437, 2025.
  3. DeepSeek-AI. DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models. arXiv:2512.02556, 2025.
  4. Vaswani, A. et al. Attention Is All You Need. NeurIPS 2017.
  5. Shazeer, N. Fast Transformer Decoding: One Write-Head is All You Need. 2019.
  6. Ainslie, J. et al. GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints. EMNLP 2023.
  7. Xiao, G. et al. Efficient Streaming Language Models with Attention Sinks. ICLR 2024.
  8. Jordan, K. et al. Muon: An optimizer for hidden layers in neural networks. 2024;Liu, J. et al. Muon is Scalable for LLM Training. arXiv:2502.16982, 2025.