产品概述
腾讯云 HyperAcc 训练加速套件是面向 PyTorch 训练任务的高性能训练加速组件。安装已编译的 HyperAcc wheel 包后,您可通过环境变量启用不同加速能力,并在训练入口 Python 脚本开头导入
import hyperacc.auto 完成自动激活。HyperAcc 采用显式启用策略:默认情况下,未设置任何环境变量时,
import hyperacc.auto 不执行任何操作,不会引入额外行为。您可通过 HA_USE_* 环境变量按需显式启用指定能力。该策略支持在生产训练环境中进行灰度接入和按场景启用,同时具备快速回退能力,在保障现有训练流程稳定性的同时,降低新能力接入风险。
核心能力
能力 | 说明 | 适用场景 |
无侵入接入 | 通过 import hyperacc.auto 和环境变量启用能力,减少对原训练逻辑的改动。 | 需要快速接入已有 PyTorch 训练脚本。 |
透明替换 | 透明替换等能力的实际启用取决于模型结构、PyTorch 版本及运行环境;不满足条件或发生不兼容时,会跳过并保持原有设置。建议先在测试环境验证后再用于生产训练。 | 在兼容场景下,无需改造训练框架,即可按需启用算子及流程优化能力 |
算子加速 | 提供 NVIDIA GPU 与 DCU 的部分算子优化能力。 | 3D 检测、多模态训练、LLM/VLM 训练等计算密集场景。 |
系统级优化 | 提供 GC 优化、CPU/NUMA 绑核和透明大页配置能力。 | 多卡训练、大内存训练、对训练时延稳定性敏感的任务。 |
自动编译 | 基于 torch.compile 对 PyTorch 模型进行自动编译和粒度控制。自动编译的能力的实际启用取决于模型结构、PyTorch 版本及运行环境;不满足条件或发生不兼容时,会回退到原有的模式。建议先在测试环境验证后再用于生产训练。 | 希望利用 PyTorch 2.x 编译能力提升训练或推理性能。 |
DataLoader 优化 | 调整 pin_memory、num_workers、prefetch_factor 等参数。 | 数据加载成为训练瓶颈或需要统一 DataLoader 参数的任务。 |
注意:
自动编译、透明替换等能力的实际启用取决于模型结构、PyTorch 版本及运行环境;不满足条件或发生不兼容时,具体跳过、回退或报错行为以日志及产品文档为准。建议先在测试环境验证后再用于生产训练。
产品优势
有助于减少接入成本:以 wheel 包形式交付,您安装后即可在训练入口导入使用。
有助于减少训练脚本改造:通过环境变量控制功能开关,保留原训练脚本主体结构。
主要场景:可用于自动驾驶、3D 检测、多模态、LLM/VLM 等训练场景的部分优化。
便于灰度和回退:功能默认关闭,单项能力可独立启用或关闭。
提升资源利用效率:通过 CPU/NUMA 绑核、GC 调优、DataLoader 调优等方式,优化训练过程中的系统开销。
应用模型
自动驾驶(Autonomous Driving):BEVFormer、BevFusion、Sparse4D
具身智能(VLA Model):PI、PI0.5、lingbot-va
语言模型:Qwen、QwenVL 系列
注意:
文中涉及的第三方产品、软件、框架、模型及商标名称归其各自权利人所有,仅用于说明 HyperAcc 的适配或使用场景,不构成任何认可、合作、担保或背书。
已验证或可参考的模型包括 BEVFormer、BevFusion、Sparse4D、PI、PI0.5、lingbot-va、Qwen、QwenVL 系列。具体支持的模型版本、算子能力和效果以交付 wheel 包及产品文档为准。
应用场景
自动驾驶模型训练
HyperAcc 提供点云体素化、动态散射、多相机特征聚合、光栅化、SyncBatchNorm 等能力,适用于 3D 检测、BEV 感知、多传感器融合等自动驾驶训练任务。
大模型和多模态模型训练
HyperAcc 提供 RMSNorm、RoPE、Dropout、GELU 等部分 GPU/DCU 优化能力,并支持基于 torch.compile 的自动编译,可用于大模型和多模态模型训练中的算子与模型执行优化。
多卡分布式训练
HyperAcc 可根据可见 GPU、进程 rank 和 NUMA 拓扑进行 CPU 亲和绑定,有助于减少跨 NUMA 访存带来的训练抖动。
数据加载优化
HyperAcc 可通过环境变量统一调整 DataLoader 参数,适合数据加载瓶颈明显或容器环境参数不一致的训练任务。
支持环境
项目 | 说明 |
Python | 支持 Python 3.8 及以上版本,且需要与交付 wheel 包的 Python ABI 匹配。 |
PyTorch | 支持 PyTorch 2.0 及以上版本,启用自动编译能力时依赖 torch.compile。 |
GPU 硬件平台 | 支持 NVIDIA GPU 和 DCU,具体能力以交付 wheel 包和环境变量开关为准。 |
操作系统 | 面向 Linux 训练环境。透明大页和 NUMA 绑核能力依赖 Linux 系统接口。 |
使用限制
不同硬件平台支持的算子能力不同,实际启用取决于模型结构、PyTorch 版本及运行环境,不符合当前硬件平台的算子开关会被自动跳过。建议先在测试环境验证后再用于生产训练。
配置透明大页要求具备系统写入权限。权限不足场景下,训练进程不会中止,透明大页相关配置无法完成。
自动编译依赖模型结构、PyTorch 版本及第三方依赖库兼容性,建议在测试环境完成充分验证后,再应用至生产环境。
以上性能提升方向为能力说明,不代表所有场景下的实际表现。实际性能效果可能因模型结构、数据加载、硬件平台和训练配置不同而存在差异,具体以实际使用情况为准。