运行时的真实边界

一个完整的本地 AI 运行时至少要处理模型生命周期、上下文管理、内存压力、推理调度、工具调用、权限边界和故障恢复。

推荐分层

应用层

智能体运行时

提供商抽象层

推理运行时

硬件后端

这套分层使同一个智能体可以在 LocalEngine、Ollama、LM Studio 或云端提供商间切换,而不会将产品逻辑绑定到某一个推理框架。

关键指标

  • 首 token 时间
  • 解码 tokens/s
  • 峰值常驻内存
  • 热降频
  • 取消延迟
  • 结构化输出成功率