HAI 提供模型接入、推理服务、资源调度、缓存优化、可信运行和可观测运维能力,帮助您完成从开发验证到线上部署的工作。
主流模型和自定义模型接入
HAI 支持预置主流模型,并可根据产品能力接入企业自研或微调模型。自定义推理服务可使用公有或私有 Docker 镜像,具体支持范围以控制台为准。
智能扩缩和模型分发
HAI 通过资源编排、网络亲和调度、模型预分片和模型分发能力缩短服务扩容与加载时间。
共享 KVCache
HAI 可通过分级共享 KVCache 将部分缓存从显存下沉至分布式缓存或存储,有助于提升 GPU 资源利用效率,并可在适用场景下减少重复计算和资源消耗。具体支持模型、推理框架和实际效果以控制台及实测为准。
可信执行环境
可信推理使用 TEE 对运行中的模型和数据提供隔离保护。
可观测与运维
HAI 可提供 GPU 使用率、QPS、首 Token 时延等监控指标,以及运行日志、缓存效果和服务状态查看能力。实际指标范围取决于产品形态和部署方式。