dongdonglog
AI Infra 系列 · 第六章 GPU 性能工程(四):并行策略
原创
关注作者
腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
dongdonglog
社区首页
>
专栏
>
AI Infra 系列 · 第六章 GPU 性能工程(四):并行策略
AI Infra 系列 · 第六章 GPU 性能工程(四):并行策略
dongdonglog
关注
发布于 2026-09-18 18:36:58
发布于 2026-09-18 18:36:58
32
0
举报
概述
模型大了训不动,第一反应往往是"多拿点卡"。但卡拿到手,怎么切才是真问题——切错一天白烧几万块。这篇不讲抽象理论,讲账本:671B 的模型每卡要装 10 TB 模型状态,连 ZeRO-2 都救不回来;张量并行每层两次 all-reduce,跨节点就废;专家并行的 all-to-all 流量能跟计算量打成 1:1。每一步都能用脚本算出来,不需要你有万卡集群。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系
cloudcommunity@tencent.com
删除。
机器学习
大模型部署
算法
gpu
性能优化
#AI infra
#性能工程
#模型优化
问题归档
专栏文章
快讯文章归档
关键词归档
开发者手册归档
开发者手册 Section 归档