帮你快速理解、总结文档立即下载

HyperAcc 训练加速套件概述

最近更新时间:2026-08-14 18:27:00
本文档已由 AI 辅助审校
我的收藏

产品概述

腾讯云 HyperAcc 训练加速套件是面向 PyTorch 训练任务的高性能训练加速组件。安装已编译的 HyperAcc wheel 包后,您可通过环境变量启用不同加速能力,并在训练入口 Python 脚本开头导入 import hyperacc.auto 完成自动激活。
HyperAcc 采用显式启用策略:默认情况下,未设置任何环境变量时,import hyperacc.auto 不执行任何操作,不会引入额外行为。您可通过 HA_USE_* 环境变量按需显式启用指定能力。
该策略支持在生产训练环境中进行灰度接入和按场景启用,同时具备快速回退能力,在保障现有训练流程稳定性的同时,降低新能力接入风险。

核心能力

能力
说明
适用场景
无侵入接入
通过 import hyperacc.auto 和环境变量启用能力,减少对原训练逻辑的改动。
需要快速接入已有 PyTorch 训练脚本。
透明替换
透明替换等能力的实际启用取决于模型结构、PyTorch 版本及运行环境;不满足条件或发生不兼容时,会跳过并保持原有设置。建议先在测试环境验证后再用于生产训练。
在兼容场景下,无需改造训练框架,即可按需启用算子及流程优化能力
算子加速
提供 NVIDIA GPU 与 DCU 的部分算子优化能力。
3D 检测、多模态训练、LLM/VLM 训练等计算密集场景。
系统级优化
提供 GC 优化、CPU/NUMA 绑核和透明大页配置能力。
多卡训练、大内存训练、对训练时延稳定性敏感的任务。
自动编译
基于 torch.compile 对 PyTorch 模型进行自动编译和粒度控制。自动编译的能力的实际启用取决于模型结构、PyTorch 版本及运行环境;不满足条件或发生不兼容时,会回退到原有的模式。建议先在测试环境验证后再用于生产训练。
希望利用 PyTorch 2.x 编译能力提升训练或推理性能。
DataLoader 优化
调整 pin_memorynum_workersprefetch_factor 等参数。
数据加载成为训练瓶颈或需要统一 DataLoader 参数的任务。
注意:
自动编译、透明替换等能力的实际启用取决于模型结构、PyTorch 版本及运行环境;不满足条件或发生不兼容时,具体跳过、回退或报错行为以日志及产品文档为准。建议先在测试环境验证后再用于生产训练。

产品优势

有助于减少接入成本:以 wheel 包形式交付,您安装后即可在训练入口导入使用。
有助于减少训练脚本改造:通过环境变量控制功能开关,保留原训练脚本主体结构。
主要场景:可用于自动驾驶、3D 检测、多模态、LLM/VLM 等训练场景的部分优化。
便于灰度和回退:功能默认关闭,单项能力可独立启用或关闭。
提升资源利用效率:通过 CPU/NUMA 绑核、GC 调优、DataLoader 调优等方式,优化训练过程中的系统开销。

应用模型

自动驾驶(Autonomous Driving):BEVFormer、BevFusion、Sparse4D
具身智能(VLA Model):PI、PI0.5、lingbot-va
语言模型:Qwen、QwenVL 系列
注意:
文中涉及的第三方产品、软件、框架、模型及商标名称归其各自权利人所有,仅用于说明 HyperAcc 的适配或使用场景,不构成任何认可、合作、担保或背书。
已验证或可参考的模型包括 BEVFormer、BevFusion、Sparse4D、PI、PI0.5、lingbot-va、Qwen、QwenVL 系列。具体支持的模型版本、算子能力和效果以交付 wheel 包及产品文档为准。

应用场景

自动驾驶模型训练

HyperAcc 提供点云体素化、动态散射、多相机特征聚合、光栅化、SyncBatchNorm 等能力,适用于 3D 检测、BEV 感知、多传感器融合等自动驾驶训练任务。

大模型和多模态模型训练

HyperAcc 提供 RMSNorm、RoPE、Dropout、GELU 等部分 GPU/DCU 优化能力,并支持基于 torch.compile 的自动编译,可用于大模型和多模态模型训练中的算子与模型执行优化。

多卡分布式训练

HyperAcc 可根据可见 GPU、进程 rank 和 NUMA 拓扑进行 CPU 亲和绑定,有助于减少跨 NUMA 访存带来的训练抖动。

数据加载优化

HyperAcc 可通过环境变量统一调整 DataLoader 参数,适合数据加载瓶颈明显或容器环境参数不一致的训练任务。

支持环境

项目
说明
Python
支持 Python 3.8 及以上版本,且需要与交付 wheel 包的 Python ABI 匹配。
PyTorch
支持 PyTorch 2.0 及以上版本,启用自动编译能力时依赖 torch.compile
GPU 硬件平台
支持 NVIDIA GPU 和 DCU,具体能力以交付 wheel 包和环境变量开关为准。
操作系统
面向 Linux 训练环境。透明大页和 NUMA 绑核能力依赖 Linux 系统接口。

使用限制

不同硬件平台支持的算子能力不同,实际启用取决于模型结构、PyTorch 版本及运行环境,不符合当前硬件平台的算子开关会被自动跳过。建议先在测试环境验证后再用于生产训练。
配置透明大页要求具备系统写入权限。权限不足场景下,训练进程不会中止,透明大页相关配置无法完成。
自动编译依赖模型结构、PyTorch 版本及第三方依赖库兼容性,建议在测试环境完成充分验证后,再应用至生产环境。
以上性能提升方向为能力说明,不代表所有场景下的实际表现。实际性能效果可能因模型结构、数据加载、硬件平台和训练配置不同而存在差异,具体以实际使用情况为准。