帮你快速理解、总结文档立即下载

资源配置与自动伸缩

最近更新时间:2026-09-11 18:24:32
我的收藏
模型服务的运行成本与可用性主要取决于资源配置。本文介绍如何为服务版本选择计算资源、设置副本数量,以及通过控制台或 SDK 调节服务的运行状态。

前提条件

已创建模型服务并完成基础信息与版本配置。新建服务的流程详见 部署在线推理服务。
当前账号在工作空间内具备模型服务的编辑权限。

选择计算资源

新建或编辑服务版本时,资源来源 选择 平台按量计费 (Serverless)。该模式下:
平台按副本运行时长计费,无需预购机器资源组。
资源池由平台统一调度,可按请求量动态拉起或回收副本。
服务停止后立即停止计费。
资源规格 需要根据模型的算力需求选择。常见档位示例:
类型
典型规格
适用模型
CPU
多档 CPU 规格
传统机器学习模型(树模型、线性模型、轻量级推荐模型)。
GPU
含 GPU 卡的规格
深度学习模型(图像识别、NLP、向量检索)。
提示
单副本规格与副本数量共同决定服务容量。建议先以 1 副本、中等规格上线压测,再依据 QPS / 延迟指标横向扩展。

设置副本数量

在版本配置或服务详情页输入目标副本数量 ,平台立即扩缩到指定数量。多副本可提升服务可用性,适合临时压测、紧急扩容与稳定生产服务。

更新服务

服务运行后,在服务详情页单击编辑 进入更新服务 ,调整资源与运行参数:
可修改 :服务描述、资源规格、请求限流、副本数量、副本调节、调度策略、自动停止等配置项。
不可修改 :服务名称(页面中置灰)。
更换模型版本
控制台:更新服务 操作不修改已部署的模型,更换模型版本需通过服务详情页的新增版本 完成。
SDK:update_deployment 支持通过 model_uri 参数更换模型版本。
页面右侧 配置概览 实时汇总本次配置。
提示
修改资源规格后副本的具体重启行为以平台实际实现为准。

通过 SDK 调节资源与运行状态

除控制台外,也可通过 MLflow Deployments SDK 在 Notebook / Python 任务中调节副本数(config={"replicas": N})与启停服务(service_action 取值 STOP / RESUME / SCALE)。具体调用方式与注意事项详见 部署在线推理服务 的更新、扩缩容与版本切换。

常见问题

Q:副本数为 0 时服务还可被调用吗?
A:不可以。副本数为 0 时服务进入已停止状态,调用地址返回失败。如需暂时停止服务并停止计费,请在服务详情页单击 停止 ,或通过 SDK 调用 update_deployment(config={"service_action": "STOP"})

相关文档

部署在线推理服务(REST API)