模型服务把一个模型版本封装为长期运行的在线推理端点。一次完整的服务链路包括:
输入:从 Catalog 的注册模型中选择已有的模型版本进行部署。
运行:平台按量计费提供算力,并按弹性策略自动调整副本数。
调用:业务系统通过 HTTP 接口、携带鉴权 Token 调用服务。
沉淀:请求与响应 payload 自动落库到 Catalog 中的推理表,运行指标与告警接入工作空间的通知渠道。
关键概念
理解模型服务,需要熟悉以下核心概念:
概念 | 说明 |
服务(Endpoint) | 一个对外暴露的推理端点,对应稳定的服务名称与调用地址。一个服务下可挂载多个版本。 |
服务版本(Served Entity) | 服务下的一次具体部署,对应「某个模型 + 某个版本 + 一组资源配置」。同一服务内可并存多个版本,按流量比例分发请求。 |
副本(Replica) | 同一服务版本的运行实例。副本数越多吞吐越高、可用性越好,支持手动 / 定时 / 自动 / 组合调节。 |
计算资源 | 服务运行时占用的算力,支持平台按量计费。资源规格决定单副本的 CPU / 内存 / GPU 容量。 |
流量比 | 多版本并存时按比例(如 80 / 20)将请求分发到不同版本,便于灰度发布与 A/B 测试。 |
推理表(Inference Table) | 由 Catalog 管理的 Delta 表,自动收集请求与响应 payload,作为数据漂移、效果与公平性监控的事实表。 |
鉴权 Token | 服务启用鉴权后,调用方需在请求 Header 中携带的 Bearer Token,由平台生成与轮换。 |