首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >AI Infra 系列 · 第六章 GPU 性能工程(四):并行策略

AI Infra 系列 · 第六章 GPU 性能工程(四):并行策略

作者头像
dongdonglog
发布2026-09-18 18:36:58
发布2026-09-18 18:36:58
320
举报
概述
模型大了训不动,第一反应往往是"多拿点卡"。但卡拿到手,怎么切才是真问题——切错一天白烧几万块。这篇不讲抽象理论,讲账本:671B 的模型每卡要装 10 TB 模型状态,连 ZeRO-2 都救不回来;张量并行每层两次 all-reduce,跨节点就废;专家并行的 all-to-all 流量能跟计算量打成 1:1。每一步都能用脚本算出来,不需要你有万卡集群。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档