Kimi K3 并不是简单地把 Kimi K2 从约 1T 参数扩大到约 2.8T 参数,而是围绕 超稀疏 MoE、百万上下文、超深网络、低精度训练和长程 Agent 重新设计的一代基础模型。
核心判断 Kimi K3 的真正创新不在于“2.8T”这一参数数字,而在于 Moonshot 尝试建立一套能够继续扩展到更大规模的稀疏模型架构、训练方法和推理基础设施。它更接近一个开放权重的前沿 Agent 基础模型,而不是传统意义上的聊天模型。
一、核心结论
Kimi K3 最重要的技术价值可以概括为四点:
- 总参数扩展到约 2.8T,但每个 token 只激活约 104B 参数,依靠 16/896 的超稀疏专家路由控制计算成本。
- 同时解决序列方向和深度方向的信息流问题:Kimi Delta Attention 负责长序列,Attention Residuals 负责深层网络。
- 从 SFT 阶段开始进行 MXFP4/MXFP8 量化感知训练,低精度推理不是发布后的补丁,而是模型训练目标的一部分。
- 模型目标从“回答问题”转向“持续执行工作”,重点覆盖长时间编码、终端操作、Office、搜索、科研和多模态生产任务。
二、模型整体规格
| 项目 | Kimi K3 |
|---|---|
| 总参数量 | 约 2.78T–2.8T |
| 每 token 激活参数 | 约 104B |
| Routed Experts | 896 |
| 每 token 激活专家 | 16 |
| 专家激活比例 | 约 1.79% |
| 稀疏比例 | 约 56:1 |
| 上下文长度 | 1M tokens |
| 模态 | 原生文本、图像,并支持视频理解 |
| 注意力架构 | KDA 与 Gated MLA 混合 |
| 深度信息流 | Attention Residuals |
| MoE 架构 | Stable LatentMoE |
| 权重格式 | MXFP4 |
| 激活格式 | MXFP8 |
| 推理模式 | 默认持续 reasoning / thinking |
| 推荐部署规模 | 64 张或更多加速卡的 Supernode |
从规模上看,Kimi K3 并不是“小激活参数的大容量 MoE”。约 104B 的激活参数意味着,它本身已经是一个 100B 级计算规模模型,只是在外围增加了接近 3T 的专家知识容量。
三、整体架构
Kimi K3 可以抽象为以下数据流:
Multimodal Input
↓
Tokenizer / Vision Encoder
↓
Hybrid Sequence Mixer
├─ Kimi Delta Attention
└─ Gated MLA
↓
Stable LatentMoE
├─ Shared / Latent Components
└─ 896 Routed Experts, Top-16
↓
Block Attention Residuals
↓
Reasoning / Tool Use / Agent Output
K3 实际上处理了两条相互垂直的信息通道:
- 横向,即序列维度:一个 token 如何访问百万 token 上下文中的信息;
- 纵向,即网络深度维度:当前层如何访问前面各层产生的表示。
传统 Transformer 的主要创新集中在第一条;Kimi K3 则同时改造了序列信息流和深度信息流。
四、Kimi Delta Attention:百万上下文的核心
4.1 为什么不能全部使用普通 Attention
标准 Self-Attention 的序列计算复杂度近似为:
当上下文达到 1M token 时,完整 Attention 的计算、显存和 KV Cache 成本都极高。常见替代方案包括:
- Sliding Window Attention;
- Sparse Attention;
- Linear Attention;
- State Space Model;
- MLA;
- KV Cache 压缩。
Kimi K3 采用的是 KDA 与 MLA 混合架构,而不是完全放弃 Softmax Attention。
4.2 KDA 的基本机制
传统线性注意力通常维护一个有限状态:
查询时:
这种方式的问题在于,固定大小的状态会持续写入新信息:
- 旧信息可能被覆盖;
- 错误内容难以移除;
- 状态容量有限;
- 记忆更新缺少精确控制。
Delta Rule 会根据当前预测误差更新状态:
它不是简单地把新的 Key-Value 加入状态,而是:
- 读取当前状态对 Key 的预测;
- 计算预测与新 Value 的差异;
- 根据差异修正状态。
因此,KDA 更接近一个在线学习的 associative memory。
4.3 为什么仍然保留 MLA
纯线性注意力虽然高效,但状态容量有限,精确检索通常不如 Softmax Attention。因此 K3 采用混合结构:
若干 KDA 层
↓
一个 MLA 层
↓
若干 KDA 层
↓
一个 MLA 层
| 组件 | 主要作用 |
|---|---|
| KDA | 低成本持续处理长上下文 |
| MLA | 精确 token-to-token 检索 |
| Gated MLA | 根据 token 动态控制 MLA 输出 |
| 混合架构 | 在效率和精确检索之间平衡 |
4.4 Gated MLA
MLA 通过低维 latent 表示压缩 Key/Value,降低 KV Cache。K3 又在 MLA 输出上增加门控:
其作用包括:
- 对强依赖完整注意力的 token 保留 MLA 输出;
- 对可以由 KDA 或局部信息解决的 token 抑制不必要的注意力输出;
- 降低噪声;
- 提升 attention selectivity;
- 改善低精度训练下的激活稳定性。
五、Attention Residuals:从序列注意力扩展到深度注意力
5.1 标准 Residual 的问题
标准 PreNorm Transformer 中:
递归展开后:
这意味着当前层接收到的是前面所有层输出的等权累加。随着网络变深,会出现几个问题:
- 每一层的权重固定为 1;
- 无法按 token 选择某个早期层;
- hidden-state magnitude 逐层增大;
- 单层新增信息在累计残差流中不断被稀释;
- 前层信息虽然仍存在,但难以精确取回。
5.2 AttnRes 的核心思想
Attention Residuals 将固定求和:
替换为:
其中:
也就是说,当前层不再机械累加前面所有层,而是对不同深度的表示做 Attention。
| 维度 | 传统机制 | K3 改进 |
|---|---|---|
| 序列维度 | Attention over tokens | KDA / MLA |
| 深度维度 | 固定 residual sum | Attention over layers |
Attention Residuals 相当于为模型增加了一套跨层可寻址记忆。
5.3 Full AttnRes 与 Block AttnRes
Full AttnRes 让每一层关注此前所有层:
Layer 1 ───────┐
Layer 2 ───────┤
Layer 3 ───────┼── Attention → Layer L
... │
Layer L-1 ─────┘
但在大模型训练中,这会显著增加激活保存、Pipeline Parallel 和跨机通信成本。因此 Moonshot 提出 Block AttnRes:
Block 1: 普通 Residual
Block 2: 普通 Residual
Block 3: 普通 Residual
↓
对 Block 表示进行 Depth Attention
其存储和通信复杂度从:
降为:
其中 是总层数, 是 block 数量,且 。
研究价值 AttnRes 表明,Residual Connection 本身可能是尚未被充分开发的 scaling dimension。过去模型主要优化 Attention、FFN、MoE 和优化器,但在数百层、数万亿参数模型中,“所有层等权相加”未必仍是最佳方案。
六、Stable LatentMoE:2.8T 参数如何只激活约 104B
6.1 极端稀疏 MoE
Kimi K3 有 896 个 routed experts,每个 token 只激活 16 个:
也就是约 56 倍的专家稀疏度。
这种设计使得模型可以同时获得:
- 接近 3T 的参数容量;
- 约 104B 的单 token 激活参数规模;
- 不同 token 调用不同专业专家的能力。
但它也带来显著的训练与推理挑战:
- Router 轻微偏差就会造成负载不均;
- 某些专家过热,某些专家长期闲置;
- All-to-All 通信量巨大;
- 实际 batch shape 不稳定;
- 个别设备容易成为 straggler;
- 低精度下 router 和 expert 激活更容易不稳定。
6.2 LatentMoE 的意义
Stable LatentMoE 的目标很可能不仅是增加专家数量,还包括:
- 在更紧凑的 latent 表示空间中执行专家计算;
- 降低每个 expert 的输入输出宽度;
- 在保留模型容量的同时减少 expert compute;
- 改善超大 expert 数量下的通信开销;
- 允许 shared path 与 routed path 分工。
K3 因而不是“一个小模型挂很多专家”,而是“一个 100B 级激活模型挂载接近 3T 的专家容量”。
七、Quantile Balancing:从软均衡转向容量约束
传统 MoE 常见做法是在训练损失中加入辅助负载均衡项:
问题在于:
- 太小,专家负载不均;
- 太大,会损害语义路由;
- 路由器可能为了均匀而牺牲专家专业化;
- 不同训练阶段可能需要不同系数;
- 896 experts 下超参数会非常敏感。
Quantile Balancing 的思路是根据 router score 的分位数直接确定专家分配阈值或配额:
Router Scores
↓
统计专家或设备的 Score Distribution
↓
计算对应容量的 Quantile Threshold
↓
根据分位点决定 Token Assignment
潜在优势包括:
- 直接控制专家容量;
- 减少对 balance coefficient 的依赖;
- 专家负载更可预测;
- 更适合 static-shape execution;
- 减少训练 step 之间的负载震荡。
从系统角度看,这相当于把 MoE routing 从一个纯粹的软优化问题,转变为更接近容量约束调度的问题。
八、Fully Balanced Expert Parallelism
即使模型层面专家分配平均,系统层面仍然可能出现:
- 每个 GPU 收到的 token 数量不同;
- 通信 buffer 大小动态变化;
- CPU 参与 shape 计算;
- Collective 无法提前规划;
- Host synchronization 阻塞关键路径。
K3 的 Fully Balanced Expert Parallelism 强调:
- static shapes;
- critical path 上无 host synchronization;
- 避免专家不均衡降低吞吐。
典型执行流程如下:
Tokens
↓
Router
↓
Capacity-constrained Assignment
↓
Fixed-size Expert Buffers
↓
All-to-All
↓
Expert Compute
↓
Combine
对于 896 experts,理论 FLOPS 并不是唯一瓶颈。通信调度、尾延迟和 shape 抖动可能比矩阵乘本身更致命。
九、Per-Head Muon:按 Attention Head 优化参数
Muon 是一种 matrix-aware optimizer。AdamW 主要按元素维护一阶与二阶统计,而 Muon 会对二维参数矩阵的梯度做近似正交化:
Kimi K2 使用 MuonClip 改善大规模训练稳定性,K3 则进一步发展为 Per-Head Muon。
对于 Attention 投影矩阵:
普通 Muon 会将整个矩阵一起处理,但不同 head 的功能和梯度分布可能差异很大。Per-Head Muon 会先 reshape:
然后分别优化每个 head。
潜在收益包括:
- 保留 head 之间的功能差异;
- 避免强 head 和弱 head 相互干扰;
- 更好适应混合 KDA/MLA 架构;
- 改善超大 hidden dimension 下的训练稳定性;
- 有利于多模态 head specialization。
十、SiTU:为低精度训练设计的激活单元
SiTU 即 Sigmoid Tanh Unit。从命名和架构目标看,它采用 sigmoid 与 tanh 的组合构成 GLU 类结构,其概念形式可写为:
与 SwiGLU 相比,SiTU 的关键特征是:
- sigmoid 和 tanh 都是有界函数;
- tanh 输出零中心;
- 极端激活不会无限增长;
- 更适合 MXFP8 activation;
- 更容易控制 MoE expert 的输出幅度;
- 对超深网络和残差累积更稳定。
SwiGLU 中的 SiLU 分支近似无界:
在 2.8T MoE、低精度激活和超长训练中,少量 outlier 也可能导致量化尺度被拉高、有效精度下降以及 expert 输出不稳定。因此 SiTU 很可能是为 activation control 与 quantization robustness 专门设计的。
十一、MXFP4 权重与 MXFP8 激活
K3 从 SFT 阶段开始进行量化感知训练:
- 权重采用 MXFP4;
- 激活采用 MXFP8。
这说明模型公开的低精度形式并非简单 PTQ,而是模型在后训练阶段已经适应目标数值格式。
11.1 理论显存规模
若 2.8T 参数以 FP16 保存:
若以 4-bit 保存:
实际部署还需要考虑:
- Scale metadata;
- Embedding;
- Router 参数;
- Runtime workspace;
- KV / recurrent state cache;
- Tensor Parallel 和 Expert Parallel buffer。
因此,即便采用 MXFP4,K3 仍然是 TB 级显存模型。
11.2 为什么从 SFT 阶段开始 QAT
可能的训练路径是:
- 预训练主体使用较高精度,避免影响基础能力;
- SFT 阶段开始适应 MXFP4/MXFP8;
- 后续 RL 和 Agent 训练维持目标格式;
- 最终模型在部署精度下完成行为塑形。
这比训练完成后直接量化更适合 reasoning、tool calling、长程 Agent、多模态和 MoE routing 等对误差敏感的任务。
十二、Post-training:从问答模型转向长程工作模型
K3 的训练目标明显不是单轮问答,而是持续执行复杂工作。
其重点能力包括:
- 多小时编码;
- 大型代码仓库导航;
- 终端与工具调用;
- 多阶段科研;
- Office 文档处理;
- 浏览器操作;
- CAD、游戏和视觉迭代;
- 多 Agent 协作。
传统问答轨迹是:
Question → Answer
K3 更接近:
Goal
↓
Plan
↓
Tool Call
↓
Observe Result
↓
Revise Plan
↓
More Tool Calls
↓
Verify
↓
Final Artifact
12.1 Preserved Thinking History
K3 的一个关键工程约束是:模型在保留完整 thinking history 的模式下训练。
如果 Agent Harness:
- 删除历史 reasoning;
- 对历史进行错误压缩;
- 只保留 tool result;
- 中途切换到其他模型;
- 使用与训练格式不一致的 message schema;
长任务质量可能显著下降。
Agent 接入注意事项 K3 的长期状态不仅存在于可见对话中,也依赖 reasoning trajectory。第三方 AgentKit 必须把 reasoning state 当成独立的一等状态管理,而不能只维护 visible messages 与 tool results。
十三、百万上下文不等于无限记忆
需要区分三个概念:
- 能够接收 1M token;
- 能够在 1M token 中准确检索;
- 能够在 1M token 的 Agent 轨迹中持续稳定工作。
这三者并不相同。
实际部署仍需处理:
- Prefill 成本;
- KDA recurrent state;
- MLA KV Cache;
- Thinking history;
- Tool observations;
- 图像 token;
- Context pollution;
- 长任务错误累积。
因此,1M context 更适合作为大容量工作区,而不是取消 Memory、RAG 和 Context Engineering。
十四、多模态与 Vision-in-the-loop
K3 是原生多模态模型,不只是后挂独立视觉模型。重点场景包括:
- 截图驱动的前端开发;
- 游戏开发;
- CAD;
- 图像和视频理解;
- 视频剪辑;
- PDF 图像内容分析;
- 可视化报告和幻灯片;
- Vision-in-the-loop 调试。
典型视觉反馈循环如下:
生成代码
↓
运行应用
↓
截取界面
↓
视觉检查
↓
修改代码
↓
再次运行
其价值在于把视觉模型融入 Agent 的持续反馈,而不是停留在单轮“看图回答”。
十五、编码与工程能力
15.1 GPU Kernel 优化
K3 被用于:
- Profiling;
- Kernel rewrite;
- Benchmark;
- Hopper GPU 优化;
- 非 NVIDIA GPGPU 优化;
- KDA、AttnRes 和 MLA kernel 优化。
这种任务要求模型同时处理数值正确性、硬件特征、性能瓶颈和长时间迭代,比短代码 benchmark 更接近真实工程。
15.2 MiniTriton
K3 从零构建过类 Triton 编译系统,包含:
- Tile-level DSL;
- MLIR 中间表示;
- Optimization passes;
- PTX code generation;
- Runtime;
- Tensor Core 路径;
- NanoGPT 端到端训练验证。
其任务链条是:
DSL Semantics
→ IR Lowering
→ Optimization
→ Codegen
→ Runtime
→ Numerical Correctness
→ Performance
15.3 芯片设计案例
K3 还被用于在开源 EDA 流程中设计面向自身 Nano 架构的芯片。该案例不能等同于实际流片成功,但证明模型已经能够协调:
- RTL;
- Verification;
- Synthesis;
- Timing;
- Physical constraints;
- Architecture optimization。
十六、Benchmark 应如何解读
K3 在多项 coding、productivity、agentic 和 multimodal benchmark 上进入前沿区间,但 benchmark 结果需要结合以下因素理解。
16.1 Harness 不一致
不同模型可能使用不同 Agent Harness:
- Kimi Code;
- Claude Code;
- Codex;
- Terminus;
- mini-SWE-agent。
Agent benchmark 的结果应写成:
因此,模型分数不能完全归因于权重本身。
16.2 高 reasoning 预算
官方成绩通常是在最大 reasoning effort、较高计算预算下获得。这更接近能力上限,而不是默认低延迟 API 体验。
16.3 内部或修改版测试
部分 benchmark 由 Moonshot 修改、校准或内部维护。更稳妥的判断方式是观察多个第三方 benchmark 是否形成一致趋势,而不是只看单项第一。
合理结论是:
K3 已进入闭源前沿模型附近的能力区间,尤其擅长长程编码、工具使用和视觉工程,但不能仅凭官方榜单认定它全面超过最强闭源模型。
十七、推理基础设施
17.1 为什么推荐 64 卡以上 Supernode
每个 token 需要访问 16 个专家,推理过程包含:
Token Batch
↓
Router
↓
All-to-All Dispatch
↓
16 Experts per Token
↓
All-to-All Combine
↓
Next Layer
如果跨节点网络带宽不足:
- Expert dispatch 会成为瓶颈;
- 尾部设备拖慢整个 step;
- 小 batch 下利用率下降;
- Decode latency 显著恶化。
这类模型更适合:
- 大型 NVLink / NVSwitch Supernode;
- H100/H200/H20 SuperPOD;
- 高带宽国产加速器集群;
- 专业推理服务商。
并不适合普通工作站或消费级 GPU。
17.2 Prefix Cache 对 KDA 的挑战
普通 Transformer prefix cache 主要保存 KV Cache,但 KDA 维护递归状态:
如果多个请求共享 prefix,需要缓存的不只是 KV,而是 prefix 结束位置的 KDA state,并处理状态复用、分支、batch 与设备同步。
17.3 Disaggregated Inference
长上下文请求的 Prefill 计算量大,而 Decode 常受内存带宽限制,因此适合采用分离式推理:
Long Prompt → Prefill Cluster
↓
Distributed Cache
↓
Decode Cluster
这种架构是大型 MoE API 能控制推理成本的重要前提。
十八、开放权重的真实意义
优势
- 权重可下载;
- 可进行私有化部署;
- 可进行领域微调;
- 可研究 3T 级 MoE;
- 能推动 vLLM、SGLang 和硬件厂商适配;
- 可构建企业 Agent;
- 降低对单一闭源 API 的依赖。
现实门槛
- MXFP4 权重仍约 1.4TB;
- 推荐 64 卡高带宽系统;
- KDA 需要专用 kernel;
- AttnRes 需要 runtime 适配;
- MoE All-to-All 要求高;
- Preserved thinking history 要求 Harness 兼容;
- 普通推理框架不能只加载 checkpoint 就达到官方效率。
因此,K3 更准确的定位是:
开放给云厂商、研究机构和大型企业部署,而不是面向个人设备的本地开源模型。
十九、主要局限
19.1 对 Thinking History 敏感
如果不能完整保留历史 reasoning:
- 长任务质量可能不稳定;
- 模型可能忘记此前决策逻辑;
- 中途换模型风险较高;
- Context compression 需要专门适配。
19.2 过度主动
强 Agent 模型在意图不明确、权限边界模糊或存在多种可行选择时,可能自行替用户做决定。因此生产 Agent 必须具备:
- Approval gate;
- 文件和命令白名单;
- Transaction boundary;
- 写入与破坏性操作确认;
- Budget 与 maximum steps;
- Sandbox;
- 明确的 Agent 行为规范。
19.3 Benchmark 与产品体验并不等价
架构效率和 benchmark 优势不会自动转化为更好的实际体验。差距可能体现在:
- 指令理解细腻度;
- 输出风格;
- 错误恢复;
- 不确定性表达;
- Agent 行为可控性;
- 工具调用稳定性;
- 短任务效率;
- 对模糊需求的判断。
二十、Kimi K2 与 Kimi K3 对比
| 维度 | Kimi K2 | Kimi K3 |
|---|---|---|
| 总参数 | 约 1T | 约 2.8T |
| 激活参数 | 约 32B | 约 104B |
| Attention | MLA 为主 | KDA + Gated MLA |
| Residual | 标准残差 | Attention Residuals |
| MoE | 较传统 MoE | Stable LatentMoE |
| 专家稀疏度 | 较低 | 16/896 |
| 优化器 | MuonClip | Per-Head Muon |
| 激活函数 | 常规 GLU 路线 | SiTU |
| 量化 | 主要作为部署优化 | SFT 起进行 QAT |
| 上下文 | 相对较短 | 1M |
| 多模态 | 后续版本增强 | 原生整合 |
| 产品目标 | Agentic Intelligence | Frontier Long-horizon Work |
K2 证明了大规模 MoE 与 Muon 可以稳定训练;K3 则进一步解决长上下文、网络深度、更高专家稀疏度、更低精度和更长 Agent 轨迹。
二十一、研究贡献判断
K3 并不是简单拼装既有技术。比较有独立价值的贡献包括:
- Kimi Delta Attention:线性注意力和 Delta Rule 的实际规模化;
- Attention Residuals:把 Attention 从序列维度扩展到深度维度;
- Stable LatentMoE:把专家稀疏度扩展到 16/896;
- Quantile Balancing:用分位容量控制替代敏感的辅助均衡超参数;
- Per-Head Muon:将矩阵优化器适配到独立 attention head;
- SiTU:针对低精度和激活稳定性设计的新 GLU 单元;
- 低精度 Post-training:从 SFT 阶段直接针对 MXFP4/MXFP8 优化;
- KDA Prefix Cache:解决线性 Attention 的生产缓存复用;
- Static-shape Balanced EP:模型路由与底层 Collective 调度联合设计。
其中,KDA、Attention Residuals 与超稀疏 MoE 的组合最值得长期关注。
二十二、对未来模型架构的影响
22.1 Transformer 更可能演进为混合架构
未来不一定是 Transformer 被 SSM 完全替代,而更可能形成:
Linear Attention / Recurrent State
+
Sparse Full Attention / MLA
+
Depth Attention
+
MoE
其中:
- 线性模块负责低成本持续记忆;
- Softmax 模块负责精确检索;
- AttnRes 负责跨层选择;
- MoE 负责参数容量。
22.2 Residual Path 将成为新的 Scaling 方向
AttnRes 说明,未来模型可能不再把残差连接视为固定基础设施,而会把它本身当成可学习、可路由和可稀疏化的结构。
22.3 开放模型竞争转向系统级创新
K3 的竞争力来自:
Architecture
+ Optimizer
+ Quantization
+ Routing
+ Distributed Training
+ Inference Cache
+ Agent Harness
+ Data
未来大型开放模型的壁垒不只是权重,而是完整的软硬件协同栈。
二十三、对 LocalEngine 与 PrivyAgent 的启示
23.1 不适合 LocalEngine 本地部署
即使采用 MXFP4,权重仍为 TB 级:
- 普通 Mac Studio 统一内存远远不足;
- 普通 8 卡服务器也不适合;
- 转换为 GGUF 没有现实意义;
- KDA 和 AttnRes 需要专用 Runtime。
因此 LocalEngine 不应把 K3 作为本地模型目标。
23.2 更适合通过 ProviderKit 接入远程 API
PrivyAgent
↓
ProviderKit
├─ LocalEngine:小模型、本地隐私任务
├─ Ollama / LM Studio:中型本地模型
└─ Kimi K3 API:长程复杂 Agent
ProviderKit 应支持:
- Reasoning effort;
- 1M context;
- Preserved thinking history;
- Multimodal messages;
- Tool calls;
- Context cache;
- Long-running sessions;
- Token budget;
- Provider-specific Agent Harness。
23.3 AgentKit 应增加 Reasoning State
基础消息模型:
struct AgentMessage {
let role: Role
let content: Content
}
对于 K3 可能不足,应扩展为:
struct AgentTurn {
let visibleMessage: Message?
let reasoningState: ReasoningState?
let toolCalls: [ToolCall]
let toolResults: [ToolResult]
let providerMetadata: ProviderMetadata
}
并支持:
- Provider 保存 opaque reasoning state;
- Reasoning state 默认不向用户展示;
- Context compaction 时单独处理;
- 不同模型之间不直接复用不兼容状态;
- Session 中途切换模型时重新建立计划。
23.4 Approval 与 Policy 层必须前置
Model Proposal
↓
Policy Evaluation
↓
Risk Classification
↓
Approval Required?
↓
Sandbox Execution
↓
Verification
尤其应覆盖:
- 删除文件;
- 修改代码仓库;
- Git push;
- 数据库写操作;
- 发邮件;
- 云资源变更;
- 支付;
- 外部 API 调用。
能力越强的模型,越需要严格的执行隔离和审批边界。
二十四、综合评价
| 维度 | 评价 |
|---|---|
| 技术创新 | 9/10 |
| 模型能力 | 9/10 |
| 推理效率 | 相对规模而言优秀,但绝对成本极高 |
| 开放价值 | 9.5/10 |
| 个人开发者可用性 | 5/10 |
最终判断
Kimi K3 的本质是:
用 KDA 解决百万 token 的横向信息流,用 Attention Residuals 解决超深网络的纵向信息流,再以 16/896 的 Stable LatentMoE 扩展知识容量,并通过 Quantile Balancing、Per-Head Muon、SiTU 和 MXFP4/MXFP8 将整个体系稳定训练和部署到 2.8T 参数规模。
它很可能是 2026 年开放权重模型中,架构创新密度和系统工程完成度最高的模型之一。
Loading discussion…