推理优化 2026年9月14日 第12章:端侧推理 理解端侧推理的资源约束、异构硬件、运行时与优化方法,并建立可复现的性能评测流程 端侧推理 Edge AI ExecuTorch 量化 异构计算 本章简介 把模型部署到手机、汽车、摄像头、PC 或嵌入式设备,与把模型部署到数据中心并不是同一道题。端侧设备的内存、功耗、散热和软件环境更加受限,硬件型号却更加分散;一次算得很快并不等于能够持续稳定地运行。 本章从完整工程链路出发,介绍模型如何从 PyTorch 导出为端侧程序,运行时如何把计算分配给 CPU、GPU、NPU 或 DSP,以及如何通过量化、图优化、内存规划和性能评测构建可靠的端侧推理系统。 本章小节 12.1 端侧推理基础:从模型导出到异构硬件执行:端侧约束、软硬件栈、运行时选型、优化方法、Benchmark 与 ExecuTorch/XNNPACK 最小实例 上一篇 第11章:推理优化选型与端到端实战 下一篇 12.1 端侧推理基础:从模型导出到异构硬件执行