帮你快速理解、总结文档立即下载

模型性能分析

最近更新时间:2026-08-04 18:59:32
我的收藏
模型性能分析聚焦全量模型的运行状态与使用效能,实时统计模型调用次数、平均耗时、错误率及 Token 使用量等核心指标,精准定位模型性能瓶颈与资源浪费问题,为模型优化迭代、资源配置调整提供数据支撑。

操作步骤

2. 在左侧菜单栏中选择 AI 可观测 > 模型性能分析
3. 在页面顶部选择合适的地域、业务系统以及模型。
4. 通过右上方的时间选择器指定查询时间跨度。


指标卡片

指标
说明
模型调用次数
选定时间范围内所有 LLM 模型调用的总次数,附环比变化
模型调用错误率
调用失败(超时、限流、模型异常等)的比例
首 Token 耗时
从请求发出到接收到模型返回的第一个 Token 的耗时,支持切换查看平均值、P99、P95、P50
模型调用耗时
从请求发出到模型完整响应的端到端耗时,支持切换查看平均值、P99、P95、P50

趋势图表

模型调用次数(次):展示模型调用量的变化趋势。
模型调用错误率(%):展示错误率的变化趋势。
首 Token 耗时(毫秒):四线折线图,同时展示平均值、P99、P95、P50四条曲线。首 Token 耗时直接影响用户感知到的响应速度,是 Agent 应用体验的关键指标。
模型调用耗时(毫秒):四线折线图,同时展示平均值、P99、P95、P50四条曲线。模型调用耗时包含完整的输出生成过程,与输出 Token 数量正相关。

Top 10分布

支持 Top 10模型分布Top 10应用分布 两个 Top 10排行模块,可以按调用次数、错误率、首 Token 平均耗时、调用耗时四个统计维度切换排序。