首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >AI Infra 系列 · 第六章 GPU 性能工程(三):torch.compile 不是开关——碎算子能快一倍,GEMM 基本白搭

AI Infra 系列 · 第六章 GPU 性能工程(三):torch.compile 不是开关——碎算子能快一倍,GEMM 基本白搭

作者头像
dongdonglog
发布2026-09-16 18:05:29
发布2026-09-16 18:05:29
1600
举报
概述
`torch.compile` 大概是深度学习里投入产出比最高的一行代码,也是最容易让人失望的一行。同一份代码,碎算子密集的负载能快一倍,纯大矩阵乘的模型可能只快 3%。差别不在你会不会调参,在你拿它干什么活。这篇不打算给你一个结论,而是给你一段能直接跑的脚本:先自己量出这两个数字,再往下读,后面的每一节都是在解释你看到的那个结果。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档