摘要
DeepSeek-V4 并不是一次单纯的“参数继续变大”。它真正试图解决的问题是:
当上下文从 128K 继续扩展到 1M Token 后,如何让注意力计算、KV Cache、训练、RL、Agent 状态和在线服务仍然具有可接受的成本?
DeepSeek-V4 系列包含两个 MoE 模型:
| 模型 | 总参数 | 每 Token 激活参数 | 上下文 |
|---|---|---|---|
| DeepSeek-V4-Flash | 284B | 13B | 1M |
| DeepSeek-V4-Pro | 1.6T | 49B | 1M |
论文给出的核心结果是:在 1M Token 场景中,V4-Pro 的单 Token 推理 FLOPs 约为 DeepSeek-V3.2 的 27%,KV Cache 约为后者的 10%。这意味着百万上下文第一次不再只是“模型理论上能塞进去”,而是被当成一个需要系统性优化的常规工作区间。
DeepSeek-V4 的技术主线可以概括为:
DeepSeek-V3 / V3.2
↓
更大的 MoE 容量
+
mHC:重构残差路径
+
CSA:压缩后再稀疏检索
+
HCA:更激进的 KV 压缩
+
Sliding Window:补回局部细节
+
Muon:提升大规模训练效率
+
1M Context Training / RL
+
Interleaved Thinking / Agent
+
KV Cache / Sandbox / Serving Infrastructure
↓
DeepSeek-V4
它最值得关注的地方不是某一个独立模块,而是 Architecture + Optimizer + Training + Inference + Agent Infrastructure 的联合设计。
一、核心结论
DeepSeek-V4 最重要的技术价值可以归纳为六点。
1. 百万上下文从“能力指标”变成“系统设计目标”
过去很多模型虽然声明支持 1M Token,但真正运行到百万级上下文时,会同时遇到:
- Attention FLOPs 快速增长;
- KV Cache 占用巨大;
- Prefill 延迟过高;
- 长轨迹 RL 成本失控;
- Agent 多轮状态难以长期保存;
- 在线服务难以复用超长 Prefix。
V4 从注意力架构、KV 表示、缓存、训练并行和 RL 基础设施多个层面一起解决这些问题。
2. CSA + HCA 是 V4 最核心的架构变化
DeepSeek-V4 不再把所有历史 Token 以同等粒度保存和计算,而是建立两种不同程度的压缩路径:
- CSA(Compressed Sparse Attention):先压缩 KV,再用索引器选 Top-k;
- HCA(Heavily Compressed Attention):以更高压缩率形成全局记忆;
- Sliding Window Attention:保留最近局部 Token 的高分辨率信息。
本质上,它把长上下文表示变成:
Recent Tokens
→ High Resolution
Medium / Important History
→ Compressed + Sparse Retrieval
Very Long History
→ Heavily Compressed Global Memory
3. DeepSeek 继续扩大 MoE,而不是扩大每 Token 计算量
V4-Pro 达到 1.6T 总参数,但每 Token 激活约 49B;V4-Flash 总参数 284B,每 Token 激活仅 13B。
模型规模和单 Token 计算成本继续解耦:
这仍然是 DeepSeek 从 V2/V3 延续下来的核心 scaling 路线。
4. mHC 表明 Residual Path 本身正在成为可学习结构
mHC(Manifold-Constrained Hyper-Connections)不再把残差连接视为固定的:
而是维护多条 residual streams,并动态学习输入、残差混合和输出映射,同时使用双随机矩阵约束保证深层网络中的数值稳定性。
5. Post-training 的重点从传统 RL 转向 On-Policy Distillation
V4 将此前 mixed RL 阶段替换为 On-Policy Distillation(OPD)。统一模型作为 student,在自身分布产生的轨迹上向 specialist teacher 学习。
这代表一个重要趋势:
Frontier model 的 post-training 不一定继续依赖越来越复杂的单一 reward,而可能转向“专家模型 → 统一模型”的在线知识迁移。
6. Agent 能力已经与 Context Architecture 深度耦合
1M Token 不只是为了读一本书或一个超长 PDF。
它更重要的用途是:
- 保存长期 reasoning state;
- 保存 Tool Call / Tool Result;
- 保存代码仓库上下文;
- 保存多阶段任务历史;
- 支持数百步 Agent 交互。
因此 V4 的“Long Context”实际上已经与 Agent Runtime 融合。
二、模型整体规格
| 项目 | DeepSeek-V4-Flash | DeepSeek-V4-Pro |
|---|---|---|
| 总参数量 | 284B | 1.6T |
| 每 Token 激活参数 | 13B | 49B |
| Transformer 层数 | 43 | 61 |
| Hidden Size | 4096 | 7168 |
| Routed Experts | 256 | 384 |
| Shared Expert | 1 | 1 |
| 每 Token 激活 Routed Experts | 6 | 6 |
| CSA Compression | 4× | 4× |
| HCA Compression | 128× | 128× |
| CSA Top-k | 512 | 1024 |
| Sliding Window | 128 | 128 |
| mHC Expansion | 4 | 4 |
| 上下文长度 | 1M | 1M |
| 预训练 Token | 32T | 32T+ 级训练体系 |
| Optimizer | Muon + AdamW | Muon + AdamW |
| 架构 | MoE | MoE |
这里最值得注意的是 V4-Flash。
13B activated parameters 意味着它在单 Token 计算量上更接近一个中型 dense model,但背后拥有 284B 的专家容量。论文实验也显示:在给予更多 test-time reasoning budget 后,Flash 在部分 reasoning 任务上可以接近 Pro。
这意味着未来推理系统可以进一步把:
Model Size
Reasoning Budget
Latency
Cost
作为四个独立旋钮,而不是简单用“更大的模型一定更贵”描述。
三、整体架构
DeepSeek-V4 仍然以 Transformer 为主体,同时继承:
- DeepSeekMoE;
- Multi-Token Prediction;
- RMSNorm 等既有设计。
新增核心结构是:
Input Tokens
↓
Embedding
↓
┌─────────────────────────────┐
│ Transformer Block × L │
│ │
│ Pre-Block mHC Mixing │
│ ↓ │
│ CSA / HCA Hybrid Attention │
│ ↓ │
│ DeepSeekMoE │
│ ↓ │
│ Residual mHC Mixing │
│ ↓ │
│ Post-Block mHC Mixing │
└─────────────────────────────┘
↓
Prediction Head
↓
LM Loss + MTP Loss
V4 的设计实际上同时优化了三个维度:
| 维度 | 技术 |
|---|---|
| 参数容量 | DeepSeekMoE |
| 序列长度 | CSA + HCA + SWA |
| 网络深度信息流 | mHC |
因此它不是只在“横向 Token 维度”优化 Attention,也在“纵向 Layer 维度”重构信息传播。
四、mHC:重新设计 Residual Connection
4.1 为什么传统残差连接开始成为限制
标准 Transformer 使用:
这个设计极其成功,但随着模型不断加深,它存在一个基本限制:
每层只有一条主 residual stream,信息进入 block 后只能通过固定加法回到主干。
Hyper-Connections 的思路是把单一 residual stream 扩展为多个 stream,使不同层可以动态混合信息。
但如果动态混合矩阵完全自由,深层堆叠后容易出现:
- 激活放大;
- 梯度不稳定;
- 信号抵消;
- loss spike。
4.2 mHC 的关键:把残差混合限制在稳定流形上
V4 使用三组动态映射:
A_l : Pre-Block Input Mixing
B_l : Residual Stream Mixing
C_l : Post-Block Output Mixing
其中最关键的是 。
DeepSeek 将它投影为 doubly stochastic matrix(双随机矩阵):
- 每个元素非负;
- 每行和为 1;
- 每列和为 1。
实现上使用 Sinkhorn-Knopp 迭代。
直观理解:
普通 Residual
stream → stream
Hyper-Connection
stream1 ─┐
stream2 ─┼→ arbitrary mixing
stream3 ─┤
stream4 ─┘
mHC
stream1 ─┐
stream2 ─┼→ constrained stable mixing
stream3 ─┤
stream4 ─┘
这种约束使信息可以重新路由,但整体信号规模不会轻易爆炸。
4.3 为什么 mHC 值得长期关注
Transformer 过去的 scaling 主要集中在:
- Width;
- Depth;
- Attention;
- FFN;
- MoE。
Residual connection 很少被当成核心 scaling 维度。
mHC 说明:
未来网络的 Layer-to-Layer 信息流本身也可能成为可学习的 routing system。
这一方向与 Kimi K3 中 Attention Residuals 所体现的趋势高度一致:下一代模型开始重新审视“层之间应该如何传递信息”。
五、CSA:Compressed Sparse Attention
CSA 是 V4 长上下文能力的第一条主线。
5.1 传统 Sparse Attention 的问题
Sparse Attention 通常试图从 个历史 Token 中选出少量相关 Token:
但在 1M Token 场景中,即使最终只选择 Top-k,索引和 KV 存储本身仍然可能很重。
CSA 进一步增加一个步骤:
Original KV
↓
Block Compression
↓
Compressed KV
↓
Lightning Indexer
↓
Top-k Compressed Blocks
↓
Core Attention
即:
先降低搜索空间分辨率,再做稀疏检索。
5.2 4× KV Compression
V4 的 CSA compression ratio 为:
也就是大约每 4 个原始 Token 形成一个压缩 KV entry。
压缩不是简单 average pooling,而是学习每个 Token 对压缩表示的贡献权重。
因此:
Token 1 ─┐
Token 2 ─┤
Token 3 ─┼→ Learned Compression → Compressed KV
Token 4 ─┘
5.3 Lightning Indexer
压缩之后仍然可能存在数十万 KV blocks,因此 V4 再使用轻量 indexer 为 Query 计算相关度,然后选择 Top-k。
V4-Flash:
Compressed History
↓
Top-512
↓
Core Attention
V4-Pro:
Compressed History
↓
Top-1024
↓
Core Attention
因此主 Attention 不需要访问整个 1M 上下文。
5.4 CSA 的本质
CSA 可以理解成一种内置于 Transformer Layer 中的 learned retrieval:
Long Context
↓
Compression
↓
Learned Index
↓
Relevant Memory Blocks
↓
Attention
它和外部 RAG 的差异是:
| RAG | CSA |
|---|---|
| 检索外部文档 | 检索模型当前 Context |
| 通常基于 embedding | 与 Attention 联合训练 |
| 文档/Chunk 粒度 | Token Block 粒度 |
| Runtime 外部系统 | Model Architecture 内部 |
因此 V4 已经开始模糊:
Attention 与 Retrieval 的边界。
六、HCA:Heavily Compressed Attention
如果 CSA 是“压缩后精确检索”,HCA 更接近“低分辨率全局记忆”。
V4 设置:
即大约每 128 个 Token 压缩为一个 KV entry。
对于 1M Token:
百万 Token 的全局历史因此可以被压缩为不到一万个高层表示。
6.1 HCA 为什么不需要 Top-k
当历史已经压缩 128 倍后,完整访问这些压缩 entry 的成本已经大幅下降。
因此可以理解为:
1M Tokens
↓ 128× Compression
~7.8K Global Memory Entries
↓
Global Attention
它提供的是一种 coarse-grained global awareness。
6.2 HCA 的代价
高压缩必然丢失细节。
例如:
128 tokens
→ 1 vector
不可能完整保存其中每一个数字、变量名、代码符号或事实。
因此 HCA 不能单独承担长上下文。
这正是为什么 V4 采用 Hybrid Attention。
七、Hybrid Attention:多分辨率记忆系统
V4 真正重要的不是 CSA 或 HCA 单独存在,而是二者与 Sliding Window 组合。
可以把它理解成三层 Memory Hierarchy:
┌───────────────────────────────┐
│ Sliding Window │
│ 最近 128 Tokens │
│ 高精度 / 低延迟 │
├───────────────────────────────┤
│ CSA │
│ 4× Compression + Top-k │
│ 中高精度稀疏历史 │
├───────────────────────────────┤
│ HCA │
│ 128× Compression │
│ 低分辨率全局历史 │
└───────────────────────────────┘
这与计算机存储层次非常相似:
Registers / L1
↓
Memory
↓
Storage
在 LLM 中变成:
Local Exact Context
↓
Sparse Relevant Context
↓
Compressed Global Context
这是 V4 最值得关注的设计思想。
八、为什么 1M Token 的 KV Cache 能显著下降
论文指出,在 1M Token 场景下,V4-Pro 相比 V3.2:
- Single-token inference FLOPs 约降低到 27%;
- KV Cache 约降低到 10%。
同时,相比常见 BF16 GQA8、head dimension 128 的 Attention 配置,V4 的 KV Cache 可以下降到约 2% 的量级。
主要来自四个因素。
8.1 KV Compression
CSA:
HCA:
8.2 FP8 KV Storage
V4 对 KV 使用混合精度:
- RoPE 相关维度:BF16;
- 其他维度:FP8。
仅这一项就接近把 KV storage 减半。
8.3 FP4 Indexer
Lightning Indexer 的 Attention 使用 FP4 计算。
由于 Indexer 的目标只是选出候选,而不是直接生成最终 representation,因此更适合低精度。
8.4 Sparse Core Attention
CSA 最终只对 Top-k compressed KV 执行主 Attention。
因此计算复杂度不再直接跟完整 成比例增长。
九、Muon:Optimizer 也成为 Scaling 的一部分
DeepSeek-V4 大部分参数不再使用传统 AdamW,而采用 Muon optimizer。
AdamW 仍用于:
- Embedding;
- Prediction Head;
- RMSNorm 参数。
其余主要矩阵参数使用 Muon。
9.1 为什么 Muon 值得关注
Adam 类优化器主要在 parameter-wise 维度维护统计量,而 Muon 更强调矩阵更新的几何结构。
对于 Transformer 中大量二维权重矩阵,这种方法可能带来:
- 更高 sample efficiency;
- 更快 convergence;
- 更好的大模型训练稳定性。
DeepSeek 采用 Muon 说明它已经从研究型 optimizer 进入 trillion-parameter frontier model 的生产训练。
9.2 Optimizer 与 Infrastructure 必须联合设计
Muon 的问题不是公式本身,而是:
- optimizer state;
- distributed sharding;
- matrix orthogonalization;
- communication;
- memory;
- kernel efficiency。
因此 V4 专门实现高效 Muon training infrastructure。
这再次说明 frontier model 的创新单位已经不是单一算法,而是:
Algorithm
+
Kernel
+
Distributed Runtime
+
Memory Layout
十、32T Token 预训练
DeepSeek-V4 使用超过 32T 的多样化高质量 Token。
数据包含:
- Web;
- 数学;
- Code;
- 长文档;
- 科学论文;
- 技术报告;
- 多语言数据;
- Agentic data。
与普通“增加更多网页”不同,V4 明确加强:
Long-document data curation
这是百万上下文模型经常被忽略的一点。
拥有 1M context architecture 并不意味着模型自然学会利用 1M context。
如果训练数据仍然主要是:
2K / 4K / 8K independent documents
模型不会自动获得稳定的长程信息组织能力。
因此真正的 long-context scaling 是:
Architecture
+
Training Sequence Construction
+
Long Document Data
+
Position Extrapolation / Training
+
Post-training
+
Serving
十一、训练稳定性:Anticipatory Routing
大规模 MoE 的一个典型问题是 routing 与 backbone 同时变化。
当 Router 根据不断变化的 hidden representation 重新分配 expert 时,可能产生 feedback loop:
Backbone Changes
↓
Routing Changes
↓
Expert Distribution Changes
↓
Gradient Distribution Changes
↓
Backbone Changes Again
极端情况下会触发 loss spike。
V4 提出 Anticipatory Routing:
Current Backbone θ_t
↓
Feature Computation
Historical θ_(t-Δ)
↓
Precomputed Routing
也就是让 routing 暂时滞后于 backbone 更新。
论文报告其完整启用会增加约 20% wall-clock overhead,因此实际系统会:
- 自动检测 loss spike;
- 发生异常时 rollback;
- 临时启用 Anticipatory Routing;
- 稳定后恢复正常训练。
这个设计很有工程味道。
它不是追求“任何时候都使用更稳定算法”,而是:
把昂贵的稳定机制做成异常恢复路径。
十二、SwiGLU Clamping
V4 训练还使用 SwiGLU clamping:
- linear component 限制在
[-10, 10]; - gate component 上界限制为
10。
目的不是提升表达能力,而是控制 activation outlier。
随着:
- FP8 / FP4;
- 超大 MoE;
- 超长序列;
- 大 batch;
数值 outlier 的破坏性会越来越明显。
因此现代大模型训练开始越来越像数值系统工程:
Model Architecture
+
Optimizer
+
Precision
+
Clamping
+
Normalization
+
Routing Stability
缺一项都可能导致 trillion-scale training run 失败。
十三、Post-training:为什么用 On-Policy Distillation
DeepSeek-V4 最值得关注的 post-training 改动之一,是把此前 mixed RL 阶段替换为 On-Policy Distillation(OPD)。
基本结构可以抽象为:
Specialist Teachers
↓
Unified Student generates its own trajectories
↓
Teacher evaluates / provides target distribution
↓
Reverse-KL Optimization
↓
Unified DeepSeek-V4
13.1 为什么强调 On-Policy
普通 distillation 常见问题是 teacher 生成的数据与 student 自己推理时遇到的状态分布不同。
On-policy 的关键是:
Student 在自己的行为分布上产生 trajectory,再学习 teacher 在这些状态下会如何决策。
这对 Agent 尤其重要。
因为 Agent 的第 20 步输入通常取决于前 19 步自己的行为。
如果只训练 teacher 的理想 trajectory:
Teacher State → Teacher Action
部署时 student 一旦前面犯错,就可能进入训练数据从未覆盖的状态。
On-policy distillation 更接近:
Student State
↓
Teacher Guidance
↓
Student Improvement
十四、Thinking 与 Agent Context Management
DeepSeek-V4 使用新的 DSML tool-call schema,并采用 XML 风格 Tool Call。
更重要的是它继续演进 thinking state management。
V3.2 会:
- 在 tool-result round 之间保留 reasoning;
- 新 user message 到来后丢弃历史 reasoning。
V4 借助 1M context,进一步强化 interleaved thinking。
可以把 Agent state 理解成:
User Goal
↓
Reasoning
↓
Tool Call
↓
Tool Result
↓
Reasoning
↓
Tool Call
↓
...
过去为了节省 Context,系统经常主动删除 reasoning history。
但这会造成:
State Loss
→ Re-planning
→ Repeated Work
→ Goal Drift
百万上下文允许模型保留更多连续执行状态。
因此 V4 的 1M Token 对 Agent 的意义可能大于对普通 Chat 的意义。
十五、百万 Token Agent 的真正瓶颈
即使 Attention 已经足够便宜,Agent 仍然存在其他瓶颈。
15.1 Context Pollution
更多 Token 并不一定更好。
长期任务中会积累:
- 过期计划;
- 无关日志;
- 重复 Tool Result;
- 错误推理;
- 大量代码输出。
因此:
15.2 Retrieval Accuracy
CSA/HCA 可以降低计算量,但压缩和 sparse selection 仍可能漏掉关键细节。
例如一个 800K Token 之前出现的:
port = 18473
如果它被 128× HCA 压缩,精确数字可能无法恢复。
因此百万上下文并不能完全替代:
- structured memory;
- semantic retrieval;
- database;
- code index;
- artifact store。
15.3 Long-Horizon Planning
Context 解决的是“能不能看到历史”。
它并不自动解决:
- Goal decomposition;
- Verification;
- Error recovery;
- Planning;
- Memory consolidation。
因此:
1M Context ≠ 1M Token Reliable Agent
十六、推理基础设施:KV Cache 开始进入磁盘
V4 在 serving 中引入 On-Disk KV Cache,用于复用 shared-prefix request。
对于 CSA/HCA:
- 压缩后的 KV 可以直接写入磁盘;
- Prefix 命中后读取并恢复;
- 未完整 compression block 的尾部需要重新计算。
对于 SWA,由于未压缩 KV 更大,论文讨论三种策略:
Full SWA Caching
优点:
- 几乎不需要重算。
缺点:
- 磁盘写入量巨大;
- 实际读取只用最后一个窗口,I/O 利用率差。
Periodic Checkpointing
每隔一定 Token 保存一个 SWA checkpoint。
这是:
Storage ↔ Recompute
之间的折中。
Zero SWA Caching
不保存 SWA KV,仅利用 CSA/HCA cache 重建最近窗口。
它增加计算,但显著减少存储。
这意味着 KV Cache 已经从 GPU memory management 问题演化为:
GPU HBM
↓
CPU Memory
↓
SSD
↓
Distributed Prefix Cache
一种新的模型 Serving Storage Hierarchy。
十七、Batch-Invariant Deterministic Kernel
大规模在线推理和 RL 中,一个经常被忽略的问题是:
同一个 request 因为 batch composition 不同,是否会产生不同输出?
浮点计算顺序、kernel implementation、并行 reduction 都可能导致微小差异。
在普通 Chat 中这通常可以接受。
但在:
- RL rollout;
- preemption;
- fault recovery;
- reproducibility;
场景中,它会变成系统问题。
DeepSeek 因此建设 batch-invariant 和 deterministic kernel library。
这类基础设施的重要性会随着 Agent 和 RL 规模增长持续上升。
十八、百万 Token RL
1M Token rollout 会制造非常大的训练样本。
如果每条轨迹包含:
Prompt
+ Reasoning
+ Tool Calls
+ Tool Results
+ Generated Tokens
+ LogProbs
+ Rewards
+ Masks
单条 trajectory 就可能非常庞大。
V4 将 rollout data 拆成:
Lightweight Metadata
+
Heavy Per-token Fields
然后:
- metadata 用于全局 shuffle / packing;
- per-token 数据通过 shared memory 按需加载;
- mini-batch 消费后立即释放;
- 根据 workload 动态决定 device mini-batch 数量。
这说明百万 Token 不只是模型架构问题,也是 DataLoader 和训练数据格式问题。
十九、DSec:Agent Sandbox 成为训练基础设施
DeepSeek 构建了 DeepSeek Elastic Compute(DSec) 作为 Agent sandbox 平台。
论文描述其核心由三个 Rust 组件组成:
Apiserver
↓
Edge Agent
↓
Watcher
↓
3FS
生产集群可以管理数十万并发 sandbox。
这是非常重要的信号。
训练 Agent 已经不再是:
Prompt → Model → Reward
而是:
Task
↓
Model
↓
Sandbox
↓
Shell / Code / Files / Tools
↓
Environment State
↓
Reward / Verification
↓
Training
因此未来 frontier Agent model 的核心基础设施不仅是 GPU Cluster,还包括大规模隔离执行环境。
二十、Benchmark 如何解读
20.1 Base Model
论文中 V4-Pro-Base 相比 V3.2-Base 有明显提升。
部分结果:
| Benchmark | V3.2 Base | V4-Flash Base | V4-Pro Base |
|---|---|---|---|
| MMLU-Pro | 65.5 | 68.3 | 73.5 |
| SimpleQA Verified | 28.3 | 30.1 | 55.2 |
| FACTS Parametric | 27.1 | 33.9 | 62.6 |
| HumanEval | 62.8 | 69.5 | 76.8 |
| LongBench-V2 | 40.2 | 44.7 | 51.5 |
最明显的提升来自:
- World Knowledge;
- Long Context;
- HumanEval 等代码任务。
20.2 Frontier Comparison
DeepSeek-V4-Pro-Max 与论文同期 frontier model 的部分结果:
| Benchmark | Opus 4.6 Max | GPT-5.4 xHigh | Gemini 3.1 Pro High | DS-V4-Pro Max |
|---|---|---|---|---|
| MMLU-Pro | 89.1 | 87.5 | 91.0 | 87.5 |
| SimpleQA Verified | 46.2 | 45.3 | 75.6 | 57.9 |
| GPQA Diamond | 91.3 | 93.0 | 94.3 | 90.1 |
| HLE | 40.0 | 39.8 | 44.4 | 37.7 |
| LiveCodeBench | 88.8 | - | 91.7 | 93.5 |
| Codeforces Rating | - | 3168 | 3052 | 3206 |
| Apex Shortlist | 85.9 | 78.1 | 89.1 | 90.2 |
| TerminalBench 2.0 | 65.4 | 75.1 | 68.5 | 67.9 |
| SWE Verified | 80.8 | - | 80.6 | 80.6 |
| BrowseComp | 83.7 | 82.7 | 85.9 | 83.4 |
| Toolathlon | 47.2 | 54.6 | 48.8 | 51.8 |
20.3 更合理的结论
V4-Pro-Max 不能简单描述为“全面超过闭源模型”。
更准确的判断是:
- Coding / competitive programming 已进入最前沿区间;
- Knowledge 与 Gemini 3.1 Pro 仍有明显差距;
- Agent benchmark 整体进入 frontier cluster,但并非稳定领先;
- Long-context 是 V4 最具差异化的能力之一;
- Max reasoning mode 的成绩依赖显著 test-time compute。
因此:
DeepSeek-V4 的突破重点不是“所有 benchmark 第一”,而是在开放模型中同时实现 frontier capability 与显著更高的百万上下文效率。
二十一、DeepSeek-V4-Pro 与 V4-Flash 如何理解
V4-Flash 不是简单的“缩水 Pro”。
它更像是另一条 scaling 路线:
V4-Pro
Large Activated Model
49B active
→ Strong Knowledge / Hard Tasks
V4-Flash
Small Activated Model
13B active
+ More Test-Time Compute
→ Cost-efficient Reasoning
这反映一个越来越重要的趋势:
未来模型产品可能不再只提供:
Small / Medium / Large
而是:
Small Active Model + High Reasoning Budget
Large Active Model + Low Reasoning Budget
Large Active Model + Max Reasoning Budget
根据任务动态选择。
二十二、与 DeepSeek-V3 / V3.2 的关系
DeepSeek-V4 并没有推翻 V3,而是继续沿着 V3 的工程路线演进。
V3 的重点
DeepSeekMoE
+
MLA
+
FP8 Training
+
MTP
+
Large-scale Training Infrastructure
V3.2 的重点
进一步强化:
- Sparse Attention;
- Reasoning;
- Agent;
- Tool use。
V4 的重点
MoE Scaling
+
Compressed Attention
+
Hybrid Memory Resolution
+
mHC
+
Muon
+
1M Context
+
Long-Horizon Agent
+
Million-Token RL / Serving
因此 V4 可以理解为:
DeepSeek 把 V3 的高效 MoE 路线扩展到 million-token agentic computing。
二十三、与 Kimi K3 的技术路线对比
DeepSeek-V4 和 Kimi K3 都在解决同一个核心问题:
Frontier model 如何在 1M Token 和长程 Agent 场景下继续扩展?
但路线不同。
| 维度 | DeepSeek-V4 | Kimi K3 |
|---|---|---|
| 长上下文核心 | CSA + HCA | Kimi Delta Attention + Gated MLA |
| 思路 | 压缩 + Sparse Softmax Attention | Linear / Delta Attention + Attention |
| 深度信息流 | mHC | Attention Residuals |
| MoE | DeepSeekMoE | Stable LatentMoE |
| Optimizer | Muon | Per-Head Muon 等 |
| Context | 1M | 1M |
| Agent | 强化 long-horizon tool use | 强化 long-horizon production tasks |
| 主要方向 | 高效百万上下文 | 超大规模 Agent / multimodal work |
两者共同释放出一个信号:
2024:
Transformer + Dense Attention
2025:
MoE + MLA / Sparse Attention
2026:
Hybrid Attention
+ Learnable Residual Routing
+ Million-token Context
+ Agent Infrastructure
下一代模型越来越不像一个单纯的 Transformer,而像一个层级化计算与记忆系统。
二十四、CSA/HCA 与 Linear Attention:谁更可能胜出
V4 没有选择完全替换 Softmax Attention。
这是一个重要判断。
Linear Attention 的优势
- 理论复杂度低;
- Streaming 友好;
- recurrent state 小;
- 超长序列成本稳定。
Linear Attention 的问题
- 精确 recall 较弱;
- associative memory 容量受限;
- 复杂 retrieval 容易退化。
V4 的选择
V4 保留 Softmax Attention 的精确匹配能力,但通过:
Compression
+
Sparse Selection
+
Low Precision
控制成本。
因此未来更可能不是:
Softmax Attention
VS
Linear Attention
而是:
Local Exact Attention
+
Sparse Retrieval Attention
+
Compressed Global Memory
+
Optional Recurrent / Linear State
混合架构。
二十五、百万上下文是否会替代 RAG
不会。
V4 反而说明模型内部也开始采用类似 retrieval 的结构。
Context Window 适合
- 当前任务轨迹;
- 当前代码仓库工作集;
- 当前文档集合;
- Tool Result;
- 临时状态;
- 多轮 reasoning。
RAG / External Memory 适合
- 超大知识库;
- 长期知识;
- 可更新数据;
- 权限控制;
- 精确来源;
- 跨 Session memory。
更合理的 Agent Memory Architecture 是:
Immediate Context
↓
1M Working Memory
↓
Internal Sparse Attention
↓
External Retrieval
↓
Structured Long-Term Memory
百万上下文扩大的是 Working Memory,不是无限知识库。
二十六、对 Agent Runtime 的启示
DeepSeek-V4 对 Agent 系统设计有几个直接启示。
26.1 Reasoning State 应成为一等状态
传统 Chat Runtime 主要保存:
messages[]
长程 Agent 更需要:
Conversation State
Reasoning State
Tool State
Artifact State
Execution State
Memory State
如果 Runtime 只保存 visible messages,模型每次都需要重新构建计划。
26.2 Context 不应该只有“保留/删除”两个选项
V4 的 CSA/HCA 本身就是多分辨率 Context。
Agent Runtime 也可以采用类似策略:
Recent History
→ Full Fidelity
Important Historical Steps
→ Structured Summary
Old Tool Outputs
→ Artifact Reference
Long-Term Knowledge
→ Vector / Database Retrieval
26.3 Prefix Cache 会成为 Agent 成本优化重点
Agent 经常拥有巨大稳定 Prefix:
System Prompt
+ Tool Schemas
+ Repository Context
+ Project Instructions
+ Historical State
如果每次 Tool Round 都重新 Prefill,成本极高。
因此未来 Agent Runtime 必须原生考虑:
- Prefix cache;
- Cache persistence;
- Cache invalidation;
- Cross-request reuse;
- SSD-backed cache。
26.4 Sandbox 是 Agent Model 的基础设施,而不是插件
V4 的 DSec 说明 frontier Agent 训练需要海量真实 execution environment。
Agent Runtime 设计中,Sandbox 不应只是:
optional tool
而应成为:
Model
↓
Policy / Permission
↓
Sandbox Runtime
↓
Tools
↓
Artifacts
的核心层。
二十七、对本地模型的启示
DeepSeek-V4-Pro 本身不适合个人设备本地运行。
即使假设 4-bit 权重:
还没有计算:
- scale metadata;
- runtime workspace;
- expert buffers;
- KV cache;
- activation;
- routing / communication buffers。
V4-Flash:
仍然超过普通消费级 Mac 的合理部署范围。
但 V4 对本地推理最重要的价值不是权重,而是架构思想:
- KV compression;
- mixed-precision KV cache;
- sliding window + compressed memory;
- SSD prefix cache;
- low-precision indexer;
- context-aware cache hierarchy。
这些技术未来完全可能下沉到 2B–30B 级本地模型。
二十八、论文最值得关注的创新
如果只选择最重要的技术点,我会按以下顺序排序。
第一梯队
- CSA + HCA Hybrid Attention
- 百万 Token 场景下 KV Cache / FLOPs 系统性下降
- mHC
- On-Policy Distillation
第二梯队
- Muon 在超大规模模型中的生产化;
- On-disk KV Cache;
- Million-token RL infrastructure;
- Batch-invariant deterministic kernels;
- Anticipatory Routing;
- DSec Agent Sandbox。
真正的突破不是某个公式,而是这些模块组合后形成:
Million-token Model
+
Million-token Training
+
Million-token RL
+
Million-token Serving
+
Long-horizon Agent
完整闭环。
二十九、论文的局限性
29.1 很多结果仍来自官方 Evaluation
部分:
- Real-world task;
- Chinese writing;
- Search;
- White-collar task;
使用 DeepSeek 内部 evaluation framework。
这些结果具有参考价值,但独立第三方复现仍然重要。
29.2 1M Context Benchmark 仍不能完全代表真实 Agent
LongMRCR、CorpusQA 等 benchmark 可以验证长上下文 retrieval,但真实 Agent 更复杂:
Read
→ Plan
→ Act
→ Observe
→ Modify Environment
→ Recover from Error
→ Continue
单纯 long-context QA 无法覆盖这种动态过程。
29.3 Compression 的信息损失需要更多分析
HCA 128× compression 非常激进。
论文展示了整体 benchmark,但对:
- exact retrieval failure;
- numeric detail loss;
- code symbol loss;
- adversarial long-context placement;
仍值得更细粒度研究。
29.4 系统复杂度显著提高
V4 的效率不是“免费”的。
它依赖:
- 专用 sparse kernel;
- FP4 indexer;
- mixed KV precision;
- custom cache layout;
- mHC;
- Muon;
- expert parallelism;
- deterministic kernels;
- SSD KV cache。
因此模型 checkpoint 开放并不意味着第三方可以轻松复现官方 serving efficiency。
三十、长期影响
DeepSeek-V4 最重要的长期意义可能不是 1.6T 参数,而是它展示了一种新的模型形态。
过去 Transformer 的基本假设是:
All Context
→ Token-level KV
→ Attention
V4 开始变成:
Context
├─ Local Exact Memory
├─ Sparse Compressed Memory
└─ Global Heavily Compressed Memory
↓
Dynamic Retrieval
↓
Transformer Computation
也就是说,模型内部开始出现明确的 Memory Hierarchy。
这可能是百万乃至千万 Token Context 真正可持续的方向。
三十一、综合评价
| 维度 | 评价 |
|---|---|
| 架构创新 | 9.5/10 |
| 长上下文设计 | 10/10 |
| MoE Scaling | 9/10 |
| 训练系统 | 9.5/10 |
| Agent 基础设施 | 9.5/10 |
| 推理效率 | 10/10 |
| Benchmark 领先程度 | 9/10 |
| 第三方部署难度 | 很高 |
| 对未来模型架构影响 | 很高 |
最终判断
DeepSeek-V4 的本质不是“DeepSeek 做了一个 1.6T 参数模型”,而是:
DeepSeek 正在把 Transformer 从统一分辨率的 Token Attention 系统,改造成具有多级压缩、稀疏检索、动态残差路由和持久化缓存的层级记忆计算系统。
CSA 负责在压缩历史中进行精确稀疏检索,HCA 提供低成本全局记忆,Sliding Window 保留局部细节,mHC 重构跨层信息流,MoE 扩展参数容量,Muon 提升训练效率,而 1M Context RL、On-Disk KV Cache、deterministic kernel 和 DSec 又把这些模型能力真正延伸到了长程 Agent。
如果说 DeepSeek-V3 的代表性贡献是:
高效 MoE + MLA + FP8
那么 DeepSeek-V4 更接近:
MoE
+
Hierarchical Context Memory
+
Learned Residual Routing
+
Million-token Infrastructure
+
Long-horizon Agent
它代表的不是一次普通模型升级,而是 2026 年大模型架构从“更大的 Transformer”向 高效长上下文计算系统 转型的一个重要节点。
参考资料
- DeepSeek-AI. DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence. arXiv:2606.19348, 2026.
- DeepSeek-AI. DeepSeek-V3 Technical Report. arXiv:2412.19437, 2025.
- DeepSeek-AI. DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models. arXiv:2512.02556, 2025.
- Vaswani, A. et al. Attention Is All You Need. NeurIPS 2017.
- Shazeer, N. Fast Transformer Decoding: One Write-Head is All You Need. 2019.
- Ainslie, J. et al. GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints. EMNLP 2023.
- Xiao, G. et al. Efficient Streaming Language Models with Attention Sinks. ICLR 2024.
- Jordan, K. et al. Muon: An optimizer for hidden layers in neural networks. 2024;Liu, J. et al. Muon is Scalable for LLM Training. arXiv:2502.16982, 2025.
Loading discussion…