产品架构

腾讯云大模型训推平台 TI-ONE 以「数据—训练—管理—服务」的全链路设计,构建从模型开发到生产落地的一站式能力体系。平台向下依托腾讯云原生底座,打通 GPU/国产算力、CFS/COS/GooseFS 存储、TCOP 监控与 CLS 日志,提供弹性可靠的算力与数据基础;向上由数据中心、训练工坊、工作流、模型管理、模型服务与大模型广场六大模块协同——支持数据集构建与标注、任务式建模与云端开发机、拖拽式工作流编排、模型仓库与推理优化,以及 PD 分离部署、自动扩缩容、TACO 推理加速与多维模型评测。同时通过企业管理与平台管理双层治理,实现资源组、配额、权限与全局配置的精细管控,帮助企业以更低成本、更高效率完成大模型的训练、精调与规模化上线。

应用场景

解决方案

  • 算力及平台管理
  • 大模型服务运营
  • 全流程 LLM 工具链
  • 国产算力全面适配

面向多团队共享 GPU 集群、训推混部、夜间闲时跑训练等场景,TI-ONE 通过“企业管理-工作空间”两级权限体系实现资源隔离与协作共享,配合资源组配额、潮汐训推一体优先级调度、GPU 虚拟化切分与主动式健康检测,把一堆卡变成可治理的弹性算力池,将算力利用率大幅提升。

产品特性

大模型广场一键部署

内置腾讯混元、DeepSeek、Qwen、GLM、Kimi 等主流开源大模型,支持一键发布为推理服务并智能推荐所需资源,紧跟开源社区持续更新,用户可以快速尝鲜。

内置模板一键精调

内置多种主流开源大模型精调模板,开箱即用;原生支持 Ray 分布式框架并内置 veRL,无需复杂环境配置即可一键拉起强化学习训练。

PD 分离部署

独立 Prefill / Decode 角色,可分别配置算力类型与自定义镜像;内置大模型一键启动 PD 分离,实现首字延迟提速 2 倍+、包间延迟提速 5 倍+。

TACO 推理加速

自研 TACO 推理引擎,开箱即用覆盖 LLM/VLM/DiT;对比开源 vLLM,QPM 提升 42%~76%、首字延迟最大降 52%(TACO-X);长文本场景量化版性能可达 2.11×。

模型服务持续运营

支持副本自动/手动扩缩容(定时 + HPA 自动策略)、多版本灰度发布与平滑回退、全量服务请求记录,满足生产级高可用与合规审计诉求。

潮汐训推一体调度

基于资源组的优先级抢占调度(高优推理可抢占低优训练)+ 空闲资源出借 + 服务弹性扩缩容,白天承载推理、夜间闲时跑训练,实现训推一体潮汐调度。

GPU 虚拟化与算力配额

最小至 0.01 卡的 GPU 虚拟化切分,配合“可用模块 / 预设资源 / 算力配额”三重管控,避免资源抢占与闲置,实现算力精细化治理。

国产算力全面适配

“底座/驱动/框架/平台”四层适配体系 + 统一注解调度,统一纳管 NVIDIA 与海光、昆仑芯等芯片,国产卡支持虚拟化切分,像用 NVIDIA 一样用国产卡。

大模型自动评测

内置开源评测集自动评估通用能力,支持自定义评测集与裁判模型打分、少量数据调试、单条结果分步查看,并输出多模型对比雷达图,为选型与上线提供量化依据。

客户案例

常见问题

TI-ONE 是怎么收费的?

TI-ONE 公有云采用“云服务器订阅费用 + TIONE 订阅费用”的总费用模式。算力资源有两种获取方式:

从 TIONE 平台购买:支持包月(操作便捷、订阅路径短)与按量(随用随停、按秒计费);从 CVM 选择:复用已购 CVM 机器,支持包月 / 按量 / 竞价实例(竞价可获得更低算力价格)。

此外,按使用场景可能开通其他云原生产品并另行计费,包括存储(COS/CFS/GooseFSx/GooseFS)、镜像(TCR)、监控(TCOP)、日志(CLS)、负载均衡(CLB)等。

TI-ONE 和 CVM 是什么关系?

TI-ONE 和 CFS 是什么关系?

如何进行企业管理?

更多问题请查看 常见问题,也可在 问答社区 中进行提问。

按照我们的入门指南, 只需点几次鼠标,即可轻松使用TI-ONE。