本教程介绍了如何快速开始使用 CLB 模型路由。
前提条件
操作步骤
步骤1:创建模型路由实例
1. 登录 CLB 模型路由控制台。
2. 在左侧导航栏中,单击实例管理。
3. 在实例列表页中,单击新建,参数说明如下。
参数 | 说明 |
实例类型 | 可选共享型、企业型。共享型实例适用于开发测试与功能验证环节;企业型实例适用于生产环境,保障业务安全可控。 |
网络类型 | 仅企业型实例支持,可选公网、内网。 |
监听协议 | 监听协议可选 HTTP(80)、HTTPS(443)。网络类型选择公网时,监听协议建议选择 HTTPS(443)。 |
证书 | 共享型实例本身自携带证书,仅企业型实例需要绑定证书。 |
所属网络 | 企业型实例需要选择所属网络。 |
实例名称 | 最多支持 255 个字符。 |
标签 | |
TPM | 每分钟允许处理的最大 Token 数(Tokens Per Minute),单位:千/分钟。 |
RPM | 每分钟允许的最大请求次数(Requests Per Minute),单位:次/分钟。 |
4. 完成以上参数配置后,单击确定创建实例。
5. 在实例列表中,即可查看您创建的实例。
步骤2:创建模型路由访问密钥(API Key)
1. 在左侧导航栏中,单击模型路由 CMR 标签下的实例管理。单击您创建实例的实例 ID,进入实例基本信息页面,切换至用户组页签。
2. 单击新建 Key,参数说明如下。
参数 | 说明 |
Key 名称 | 最多支持255个字符。 |
标签 | |
限制类型 | 可选择速率限制或积分预算。 |
积分预算 | 若限制类型为积分预算则需要填写具体的积分预算内容。 |
TPM | 若限制类型为速率限制则需要填写 TPM。每分钟允许处理的最大 Token 数(Tokens Per Minute),单位:千/分钟。 |
RPM | 若限制类型为速率限制则需要填写 RPM。每分钟允许的最大请求次数(Requests Per Minute),单位:次/分钟。 |
3. 完成以上参数配置后,单击确定完成新建 Key。
4. API Key 创建成功后,会在创建成功的弹窗中展示 API Key 信息,请您妥善保管。您也可以单击下载到本地,进行保存。
说明:
关闭弹窗后将无法再次查看完整的 Key,请谨慎操作并妥善保管。
步骤3: 新增 BYOK 模型
1. 在左侧导航栏单击 BYOK 进入 BYOK 列表页。
2. 单击新建创建 BYOK,参数说明如下。
参数 | 说明 |
模型来源 | 可选原厂模型、第三方代理、自建模型。 |
所属厂商 | |
所属网络 | 模型来源选择自建模型时需要填写所属网络。 |
API 地址 | 模型来源选择第三方代理、自建模型时需要填写 API 地址。API 地址仅支持 VIP,不支持域名。不同厂商叫法可能不同,(如 API Base 或 Base URL)。以 DeepSeek 为例,其 API 地址为:https://api.deepseek.com/v1 。 |
API Key | 这里需要填写您在上游大模型上使用的模型 API Key。 |
域名 | 模型来源选择自建模型时需要填写域名。域名为往上游模型发送请求时携带的 HTTP Header。 |
选择模型 | 所属厂商和 API Key 填入后,在此处下拉框中选择即可。若没有展示完全,支持手动输入模型名称,或通过点击获取模型列表选择所属厂商支持模型。 |
连通性探测 | 添加 API Key 并选择正确的模型后即可单击 API Key 标签中的检查按钮,探测 API Key 的健康情况。也可在下方的健康检查中,单击开始检查,统一探测 API Key 的健康情况,方便您及时剔除不健康的 API Key。 |
实例名称 | 最多支持255个字符。 |
标签 |
3. 完成以上参数配置后,单击下一步:多模态配置,进行模型启用模态的配置。
4. 完成模型多模态配置后,单击完成实现 BYOK 模型的创建。
步骤4:配置模型调度管理
1. 在左侧导航栏中,单击实例管理。
2. 单击您创建实例的实例 ID,进入实例基本信息页面,切换至模型调度管理页签。
3. 在关联模型列表右侧单击批量关联,并选择需要关联的模型,确认后进行关联。
4. 配置意图路由。在路由策略示意图中,在意图路由模块单击新建。或者在页面意图路由模块,单击新建规则。
可以选择内置的业务模板,也可以自定义意图路由业务。
通过配置意图路由的意图分类和对应的模型,系统会自动识别用户消息的意图分类,将请求路由到对应场景的模型处理。
5. 配置路由策略。路由策略分为模型间策略和模型内策略,具体介绍如下:
模型间策略:当请求未指定具体模型时,系统将根据当前实时状态或语义复杂度,智能选择最合适的模型进行处理。模型间策略分为简单随机路由、最低系数路由。
简单随机路由:在可用模型中随机选择。
最低系数路由:优先分发到积分较低的模型。
模型内策略:当模型确定后,系统将根据实时性能指标,从该模型下不同的服务所属厂商中,动态选择最优的访问节点。模型内策略分为简单随机路由、最低繁忙路由、最低延迟路由、用量均衡路由。
简单随机路由:在可用模型中随机选择。
最低繁忙路由:将请求分配给当前最空闲的模型。
最低延迟路由:自动选择当前延迟最低的模型。
用量均衡路由:按用量均衡分配请求到各模型。
最低系数路由:优先分发到积分较低的模型。
6. 配置 Fallback 策略,当关联模型路由中的模型服务失败时会使用 Fallback 中的模型。在 Fallback 策略列表右侧单击编辑。选择对应模型并点击确定。
步骤5:调用模型路由 API
在左侧导航栏中,单击实例管理。单击您创建实例的实例 ID,进入实例基本信息页面,您可以根据调用示例中的举例并使用 OpenAI 请求方式编写请求即可访问各种配置的模型。
后续操作
在左侧导航栏中,单击实例管理。单击您创建的实例的实例 ID,进入实例基本信息页面,切换至用量详情页签。关注资源消耗,随时监控模型网关的使用情况(比如 token 和模型资源包使用情况),避免额度不足造成调用失败。您也可以切换至聊天测试页签来测试配置是否生效。