边缘设备面临内存、算力和功耗的三重约束。高端AI手机可支持约100亿参数模型的端侧部署,PC可支持约200亿参数,车载场景可部署200亿至600亿参数的模型。但电池容量、散热能力和内存带宽远不及云端GPU,因此量化成为端侧部署的必要条件。高通已实现2-bit量化压缩,使端侧能支持的模型尺寸持续扩大;苹果AFM3系列通过稀疏架构在端侧部署约200亿参数模型,每次推理仅激活部分参数以降低算力需求。
GGUF是当前边缘和CPU推理的事实标准格式,由llama.cpp项目维护。它采用单文件格式(元数据、tokenizer和权重打包在一起),支持从Q2_K(约2.5 bits/weight)到Q8_0(8 bits/weight)的多种量化级别。推荐Q4_K_M(约4.5 bits/weight)作为最佳平衡点——70B模型约40GB,精度保持约98%。GGUF原生支持llama.cpp、Ollama、LM Studio等工具,在Apple Silicon上利用统一内存优势可高效运行大模型,也支持Android NPU和Qualcomm Hexagon DSP加速。
现代边缘SDK(如NEXA SDK、Arm KleidiAI)支持跨CPU/GPU/NPU的异构后端自动调度。系统自动识别设备算力资源,在支持NPU的设备(如Qualcomm SA8295汽车芯片、Apple M系列Mac)上优先调用NPU实现低功耗高性能运行;在无专用AI芯片的设备上通过CPU/GPU优化确保基础体验。这种"一次开发、全设备运行"的模式大幅降低了端侧部署的工程门槛。
端侧并非要替代云端,而是形成分工协作的混合AI架构。端侧承担高频、实时、隐私敏感的任务(如语音助手、个人数据理解、即时翻译),云端处理更复杂、更重的推理和规划任务。高通、Arm等厂商正推动端云协同体系,通过低时延连接技术确保端云之间的智能调度。在这种架构下,量化后的端侧模型可作为第一道处理层,仅在需要时才将请求路由至云端大模型,实现成本、延迟和隐私的最优平衡。