首页
学习
活动
专区
圈层
工具
发布
首页标签模型测试

#模型测试

qModel 开源算法模型平台v1.4.2 模型版本管理:支持版本创建、对比、切换与回滚

吴同

随着参数调整、数据变化、算法优化和业务规则更新,同一个模型会不断产生新的版本。如果仍然主要依赖文件名、目录或人工记录进行管理,随着版本数量增加,容易出现版本关系...

1800

RAG评测指标

质量保障小乔

RAG 评测指标按照「检索层-生成层-端到端层-工程层-专项安全层」五层架构拆解,覆盖从底层组件能力到最终业务价值的全链路;按评测方式可分为客观量化指标、LLM...

12810

Agent 评测报告模板

质量保障小乔

【填写说明:明确本次评测核心目标,例如验证新版本工具调用优化效果、评估端到端任务达标率、对比两个模型版本的能力差异、排查线上失败案例根因】

9110

大模型幻觉测试

质量保障小乔

本方法为企业级可落地的全流程幻觉测试体系,融合学术界权威基准与工业界工程实践,覆盖从口径定义、用例设计、自动化执行、量化打分到归因优化的完整闭环。

10110

【面试题】RAG相关面试题

质量保障小乔

首先明确:RAG领域没有官方统一命名的“命中率”术语,行业通常所说的「命中率」默认指检索命中率(Hit Rate),是信息检索领域的经典指标。

7510

基于 LangSmith Traces 的 RAG 分层评测方案

质量保障小乔

本方案基于 LangSmith 原生 Trace 数据结构,遵循分层解耦、全链路可追溯、指标可量化的原则,将 RAG 评测拆解为检索层、生成层、端到端层三个层级...

8910

AI测试核心问题

质量保障小乔

通过故意破坏输入条件,验证AI生成用例的抗干扰能力,避免“输入稍微变就生成废用例”。

8510

Agent 评测方法、工具和指标体系

质量保障小乔

Agent 评测不能只看“最终回答对不对”,而要同时评估:是否正确理解任务、规划是否合理、工具是否正确调用、环境状态是否真正改变、失败时是否恢复、安全边界是否守...

32510

LLM / RAG / Agent 的评估工具

质量保障小乔

LLM RAG Agent 三类场景的评估工具对比,按“工具→定位→核心能力→适用场景”结构化呈现。

15510

HAR文件如何辅助RAG评测

质量保障小乔

HAR(HTTP Archive),是W3C事实标准的HTTP会话存档文件,本质是JSON格式,完整记录一次会话下全部HTTP/HTTPS请求与响应全量数据。

15010

大模型推理加速Medusa详解:单模型多头并行解码,解决投机解码双模型部署痛点20.1

未闻花名

在深入拆解 Medusa 技术之前,我们先铺垫一个业界主流的大模型提速方案"投机解码"。相信看过前文的朋友都清楚,投机解码核心是Draft-Target 双模型...

29610

本地大模型落地医疗场景:Qwen3-32B与ChatGLM3-6B高血压慢病筛查实战测评19.9

未闻花名

做本地大模型部署调试这段时间,直观感受真的是一山更比一山高。最开始落地医疗场景AI项目,我一直用的是ChatGLM3-6B,日常的语义对话、简单信息解读都很流畅...

15610

qModel 算法模型平台开源版 v1.4.0 升级:新增模型 API 服务与计算任务全流程管理能力

吴同

在这一过程中,模型训练完成只是应用链路的起点,如何实现模型服务化部署、计算任务管理、运行状态监控以及结果分析,成为算法工程化落地过程中需要重点解决的问题。

10300

分层配额显存共享方案:RTX4090运行ChatGLM2/3双模型,显存池化应用实践19.4

未闻花名

本地私有化部署ChatGLM系列模型是比较普遍的落地场景,实际过程中也必定会碰到一个硬性资源瓶颈:一张24G的 RTX4090 显卡,原生框架只能串行加载Cha...

25210

为什么AI时代,测试工程师必须补齐算法能力?

霍格沃兹-测试开发学社

一份 SKILL.md,配上脚本、工具声明和领域知识,就能让 Agent 获得一项相对完整的能力:代码审查、依赖升级、数据分析、发布计划、故障排查、测试执行……

14810

AI Agent测试中的DFS和BFS:测试工程师为什么需要理解搜索算法?

霍格沃兹-测试开发学社

15000
领券