帮你快速理解、总结文档立即下载

什么是模型服务

最近更新时间:2026-09-11 20:42:31
本文档已由 AI 辅助审校
我的收藏
模型服务把一个模型版本封装为长期运行的在线推理端点。一次完整的服务链路包括:
输入:从 Catalog 的注册模型中选择已有的模型版本进行部署。
运行:平台按量计费提供算力,并按弹性策略自动调整副本数。
调用:业务系统通过 HTTP 接口、携带鉴权 Token 调用服务。
沉淀:请求与响应 payload 自动落库到 Catalog 中的推理表,运行指标与告警接入工作空间的通知渠道。

关键概念

理解模型服务,需要熟悉以下核心概念:
概念
说明
服务(Endpoint)
一个对外暴露的推理端点,对应稳定的服务名称与调用地址。一个服务下可挂载多个版本。
服务版本(Served Entity)
服务下的一次具体部署,对应「某个模型 + 某个版本 + 一组资源配置」。同一服务内可并存多个版本,按流量比例分发请求。
副本(Replica)
同一服务版本的运行实例。副本数越多吞吐越高、可用性越好,支持手动 / 定时 / 自动 / 组合调节。
计算资源
服务运行时占用的算力,支持平台按量计费。资源规格决定单副本的 CPU / 内存 / GPU 容量。
流量比
多版本并存时按比例(如 80 / 20)将请求分发到不同版本,便于灰度发布与 A/B 测试。
推理表(Inference Table)
由 Catalog 管理的 Delta 表,自动收集请求与响应 payload,作为数据漂移、效果与公平性监控的事实表。
鉴权 Token
服务启用鉴权后,调用方需在请求 Header 中携带的 Bearer Token,由平台生成与轮换。

相关文档