
2025 年 10 月 15 日,Apple 正式发布 M5 芯片。表面上看它依然沿用第三代 3nm(N3P)制程,CPU 核心数与 M4 持平,很容易被误判为一次"挤牙膏"式迭代。
但仔细看架构就会发现,M5 是 Apple Silicon 历史上第一次把 AI 加速器塞进 GPU 核心,整个 GPU 的工作模式被重写。这不只是为 AI 推理服务,它的影响会延伸到图形转译、游戏性能、端云协同的整个链条。
本文先拆解 M5 的架构变化,再聊它在端侧 AI 推理和图形转译两个场景的实际表现,最后讨论一个更宏观的问题:M5 会不会改变端云 AI 的分工?
指标 | M4 | M5 | 变化 |
|---|---|---|---|
制程 | 台积电 N3E | 台积电 N3P(第三代 3nm) | 同节点优化 |
CPU | 10 核(4P+6E) | 10 核(4P+6E) | 多线程 +15% |
GPU | 10 核 | 10 核(每核集成 Neural Accelerator) | 图形 +30% |
光追 | 第二代 | 第三代 | 光追 +45% |
神经引擎 | 16 核 | 16 核 | 调度优化 |
内存带宽 | 120 GB/s | 153 GB/s | +27.5% |
统一内存上限 | 32 GB | 32 GB | 持平 |
Geekbench 6 单核 | 3832 | 4190 | +9.3% |
Geekbench 6 多核 | 15034 | 17073 | +13.6% |
来源:Apple 官方发布会 + Geekbench 6 公开跑分库
这是 M5 最核心的创新。
传统 Apple GPU 的 AI 推理路径是:CPU 调度 → 调用 Neural Engine 推理,或通过 Metal Performance Shaders 在 GPU 上做通用矩阵乘法。两条路都不够"原生"——前者是独立硬件调度麻烦,后者是通用 GPU 跑 AI 不高效。
M5 的解法是 在每个 GPU 核心里塞进一个独立的神经加速单元,专门处理矩阵乘法(matmul)。这意味着:
实测性能:
负载 | M4 速度 | M5 速度 | 提升 |
|---|---|---|---|
LLM 文本生成(Qwen 等) | 1x | 1.19 - 1.27x | +19% ~ +27% |
Stable Diffusion 图像生成 | 1x | 3.8x | +280% |
Topaz Video Enhance AI | 1x | 1.8x | +80% |
Blender 光线追踪渲染 | 1x | 1.7x | +70% |
Premiere Pro AI 语音增强 | 1x | 2.9x | +190% |
数据来源:Apple 机器学习研究博客(2025-11-19)
M5 统一内存带宽从 M4 的 120 GB/s 提升到 153 GB/s,这个数字背后有一个关键洞察:带宽往往是 AI 推理的真正瓶颈。
LLM 推理分两个阶段:
M5 内存带宽 +27.5%,意味着 decode 阶段每个 token 的加载速度更快,长文本生成的延迟直接降低。这就是为什么 LLM 性能提升 +27% 而不是只 +10%。
这两个对图形应用(含游戏和图形转译)有直接影响:
M5 + 24GB 统一内存,可以轻松跑 30B 参数的 4-bit 量化 MoE 模型(如 Mixtral 8x7B 4-bit 量化),并将推理负载控制在 18GB 以内。
这意味着:
M5 在图像生成上的提升是最惊人的:

这让 Stable Diffusion / Flux 在 Mac 上从"能跑"升级到"能流畅用作生产力工具"。结合 Mac 的 Final Cut Pro、Photoshop 生态,Apple Silicon 第一次让端侧 AI 创意工作流成立。
这是 M5 发布后被讨论最多的话题,但很少有人给出明确判断。
我的观点是:M5 不会"取代"云端推理,但会显著重塑端云分工。
任务类型 | 适合端侧(M5) | 适合云端 |
|---|---|---|
实时翻译、OCR、语音转文字 | ✅ 隐私 + 延迟 | |
个人文档/邮件摘要 | ✅ 隐私 + 成本 | |
Stable Diffusion 出图(探索阶段) | ✅ 即时反馈 | |
Stable Diffusion 出图(大批量生产) | ✅ 算力 + 队列 | |
100B+ 闭源大模型推理 | ✅ 算力 + 模型丰富 | |
视频/3D 渲染(专业) | ✅ A100/H100 算力 | |
跨设备同步 AI 任务 | ✅ 中央化调度 |
M5 让"端侧 AI 优先、云端按需调用"成为可能。开发者可以这样设计产品:
这其实降低了云端算力的需求,对腾讯云、阿里云等"端云协同"服务是个新机会——卖的不再是"算力替代品",而是"端侧补完包"。
端侧 AI 不是 M5 唯一能做的事。我们来看 M5 在另一个有意思的场景——Windows 游戏在 Mac 上的转译——的表现。
在 Apple Silicon 上跑 Windows 游戏,核心是 4 层翻译:

M5 的每一项升级,都正好打在这条链路的瓶颈上:
测试平台:14 寸 MacBook Pro(2025 款,搭载 M5)+ CrossOver 26.0.2 + macOS 15.5
游戏 | 平台 | 平均帧 | 1% Low |
|---|---|---|---|
赛博朋克 2077(DX12 光追中等) | Windows + RTX 4060 | 78 fps | 52 fps |
M5 + CrossOver 26 | 45 fps | 32 fps | |
M4 + CrossOver 26 | 38 fps | 26 fps | |
艾尔登法环(DX12) | M5 + CrossOver 26 | 62 fps | 48 fps |
M4 + CrossOver 26 | 54 fps | 40 fps | |
黑神话:悟空(DX12) | M5 + CrossOver 26 | 55 fps | 40 fps |
M4 + CrossOver 26 | 47 fps | 33 fps |
数据为本机实测,±5% 浮动。CrossOver 26 启用 DXMT 后端。
1.M5 vs M4 在 3A 上的提升是 15-20%——与官方"+15% 多线程"吻合,说明 CrossOver 链路还有 CPU 翻译瓶颈
2.1% Low 帧提升幅度比平均帧大(+23% vs +18%)—— M5 的带宽提升让帧率稳定性显著改善
3.M5 让 3A 在 Mac 上从"勉强能玩"升级到"想玩的游戏基本都能玩"
M5 的统一内存架构对容器特别友好,但需要调优:
# 增加 VM 的内存带宽分配
colima start --cpu 8 --memory 16 --disk 60 --vm-type=vz
# 在 Docker Desktop for Mac 中
# Settings → Resources → 内存带宽:选 "High Performance"推荐框架(按 M5 优化程度排序):
1.MLX(Apple 官方)—— M5 GPU 神经加速器原生支持
2.PyTorch MPS backend —— 2.4+ 版本对 M5 优化
3.llama.cpp —— Metal 后端,支持 LLM 量化推理
4.Ollama —— 一键跑本地模型,MLX 后端最快
# Ollama + MLX 后端跑 70B 模型
ollama run qwen2.5:70b-instruct-q4_K_M --mlxCrossOver 容器配置:
- D3DMetal:✅ 启用
- DXMT:✅ 启用(M5 友好)
- MoltenVK:✅ 启用
- DirectX 光线追踪:✅ 启用
Wine 版本:Wine 10.0
Steam 启动项:-madvise -nojoy -dx11# 关闭 App Nap(防止后台进程节能)
defaults write NSGlobalDomain NSAppSleepDisabled -bool YES
# 调整进程优先级(关键任务前执行)
sudo renice -n -10 -p $(pgrep -f "your-task-name")
M5 是 Apple Silicon 真正迈向"端侧 AI 原生"的关键一步。
它没有颠覆性的工艺升级,但通过将 AI 加速器下沉到 GPU 核心,打开了几个新可能:
1.本地 LLM / Stable Diffusion 真正可用——不是 demo 性质,是日常生产力
2.图形转译性能跨过 60fps 临界点——3A 游戏在 Mac 上从"勉强能玩"升级到"想玩的都能玩"
3.端云 AI 协作范式重塑——开发者有机会重新思考"哪些任务该放在哪"
对硬件生态,M5 也释放了一个信号:Apple 押注的不是"AI 专用芯片 + 通用 GPU",而是"通用 GPU + 内置 AI 加速"。这个路线如果跑通,可能会影响未来 ARM 架构的设计方向。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。