简短结论

一篇好的训练论文不只是提高某项基准分数,它应当改变每个有效 token 的成本、规模化边界,或工程复杂度

阅读框架

评估一项训练优化时,按顺序检查以下四层:

  1. 数学层:目标函数、优化器或表征是否改变?
  2. 并行层:数据、张量、流水线和专家并行如何组合?
  3. 内核层:通信、内存访问和算子融合是否真正减少了瓶颈?
  4. 运维层:故障恢复、数据治理和集群利用率是否可持续?

为什么系统细节重要

随着模型增长,吞吐量不再只由 FLOPS 决定。通信拓扑、检查点频率、长尾任务和数据读取都会成为主要成本。

任何“训练效率提升”的结论都应追问:它与哪种硬件、批次大小和网络相比?是否计入了失败任务重跑的成本?

对产品团队的启示

即使不训练基础模型,这个框架依然适用于端侧推理:应把模型质量、峰值内存、首 token 时间、持续吞吐、能耗放在同一张决策表上。