模型性能分析聚焦全量模型的运行状态与使用效能,实时统计模型调用次数、平均耗时、错误率及 Token 使用量等核心指标,精准定位模型性能瓶颈与资源浪费问题,为模型优化迭代、资源配置调整提供数据支撑。
操作步骤
1. 登录 腾讯云可观测平台。
2. 在左侧菜单栏中选择 AI 可观测 > 模型性能分析。
3. 在页面顶部选择合适的地域、业务系统以及模型。
4. 通过右上方的时间选择器指定查询时间跨度。

指标卡片
指标 | 说明 |
模型调用次数 | 选定时间范围内所有 LLM 模型调用的总次数,附环比变化 |
模型调用错误率 | 调用失败(超时、限流、模型异常等)的比例 |
首 Token 耗时 | 从请求发出到接收到模型返回的第一个 Token 的耗时,支持切换查看平均值、P99、P95、P50 |
模型调用耗时 | 从请求发出到模型完整响应的端到端耗时,支持切换查看平均值、P99、P95、P50 |
趋势图表
模型调用次数(次):展示模型调用量的变化趋势。
模型调用错误率(%):展示错误率的变化趋势。
首 Token 耗时(毫秒):四线折线图,同时展示平均值、P99、P95、P50四条曲线。首 Token 耗时直接影响用户感知到的响应速度,是 Agent 应用体验的关键指标。
模型调用耗时(毫秒):四线折线图,同时展示平均值、P99、P95、P50四条曲线。模型调用耗时包含完整的输出生成过程,与输出 Token 数量正相关。
Top 10分布
支持 Top 10模型分布和 Top 10应用分布 两个 Top 10排行模块,可以按调用次数、错误率、首 Token 平均耗时、调用耗时四个统计维度切换排序。