产品概述
随着大模型参数规模与训练集群节点数量持续攀升,分布式训练已从“单机可完成”演进为“百卡、千卡级协同工程”。训练任务一旦启动,可能面临环境异构、算力浪费、性能瓶颈难定位、故障难复现等多重挑战,任何一个节点的细微异常,都可能让整轮训练付诸东流。
HyperTrace 训练效能保障套件是面向大模型分布式训练的全链路护航与性能分析套件,围绕训练任务的启动、运行和调优三大阶段,按能力层级提供针对性的保障与观测支持:
训练前 - 节点环境预检: 无需侵入业务代码,自动排查多机环境与硬件隐患,提前阻断异常训练任务;
训练中 - 多维度性能观测: 基于 eBPF 技术实现系统与通信指标的零侵入采集,无需修改业务代码,无需重启训练进程;
调优阶段 - 算子级瓶颈定位: 支持深入定位 GPU Kernel 级性能瓶颈;仅需提前注入目标环境或通过 Preflight 模式拉起训练,即可在不改动训练脚本代码的前提下完成高精细度算子追踪。
该套件致力于为大模型训练全生命周期保驾护航,以降低训练中断风险、辅助减少问题遗漏、提升问题定位效率为目标,围绕训练任务的启动、运行和调优三大阶段,提供端到端的可观测与稳定性保障能力,帮助您在每一轮训练中“起得稳、跑得顺、调得准”。

核心能力
能力 | 说明 | 应用场景 |
训练前环境预检 | 在每个训练节点启动前运行,检测 GPU 占用/僵尸进程、节点健康状态、集群配置一致性和基线标准化,检测通过后自动拉起训练命令;如任一节点未通过预设检查,则通知各节点暂不启动本次训练任务。 | 分布式训练启动前确保每个节点环境就绪。 |
零侵入全链路采集 | 通过 eBPF 采集 Python 函数栈、CUDA/HIP API 调用、GPU Kernel 活动、CPU 调度(具体采集范围以支持环境和产品文档为准),无需修改训练代码或重启进程。 | 需要快速分析已在运行的 GPU 训练任务。 |
GPU 算子性能分析 | 通过轻量 Tracer 注入自动拦截算子执行与数据搬运事件,获取 kernel 耗时等关键指标。 | 定位具体 GPU kernel 的性能瓶颈。 |
注意:
如果是在宿主机环境执行性能数据采集,需要有
root 权限;如果是在容器环境执行性能数据采集,需要容器处于特权模式,或者容器启动参数中包含权限: SYS_PTRACE、PERFMON、BPF,否则无法获取 CPU 函数栈和 eBPF 采集的数据。产品优势
覆盖训练全生命周期:围绕训练任务的启动、运行和调优三大阶段,提供从环境预检、多维度观测到算子级瓶颈定位的端到端保障。
训练前主动拦截风险:在训练启动前自动排查 GPU 占用、僵尸进程、节点健康状态、集群配置一致性等隐患,发现问题时通知各节点暂不启动训练任务,减少因异常环境启动训练造成的算力和时间浪费。
训练过程中随时采集、按需诊断:训练任务运行期间可随时采集,无需中断训练即可实时获取性能数据并定位瓶颈,也无需修改训练业务代码,尤其适合长周期、高成本的训练任务。
算子级瓶颈定位:还原算子符号并分析线程、寄存器及显存微架构开销,辅助定位具体 GPU Kernel 的性能瓶颈,避免盲目调优。
支持环境
项目 | 说明 |
操作系统 | Linux 内核 5.4+(推荐 5.15+)。 |
GPU 硬件平台 | 支持 NVIDIA GPU 和 DCU。 |
训练运行时 | 支持 CUDA 和 HIP。 |
Python 版本 | 3.8 ~ 3.12。 |
使用限制
如果是在宿主机环境执行需要 root 权限才能加载 eBPF 程序;如果是容器环境需要提供特权模式,或者开启权限:
SYS_PTRACE、PERFMON、BPF。算子采集需要提前通过
hyper-trace setup 命令注入到目标环境,或通过 preflight 模式启动训练进程。多节点模式需 root SSH 免密登录各训练节点。