首页
学习
活动
专区
圈层
工具
发布
首页标签模型测试

#模型测试

qModel 算法模型平台开源版 v1.4.0 升级:新增模型 API 服务与计算任务全流程管理能力

吴同

在这一过程中,模型训练完成只是应用链路的起点,如何实现模型服务化部署、计算任务管理、运行状态监控以及结果分析,成为算法工程化落地过程中需要重点解决的问题。

7800

分层配额显存共享方案:RTX4090运行ChatGLM2/3双模型,显存池化应用实践19.4

未闻花名

本地私有化部署ChatGLM系列模型是比较普遍的落地场景,实际过程中也必定会碰到一个硬性资源瓶颈:一张24G的 RTX4090 显卡,原生框架只能串行加载Cha...

14510

为什么AI时代,测试工程师必须补齐算法能力?

霍格沃兹-测试开发学社

一份 SKILL.md,配上脚本、工具声明和领域知识,就能让 Agent 获得一项相对完整的能力:代码审查、依赖升级、数据分析、发布计划、故障排查、测试执行……

11910

AI Agent测试中的DFS和BFS:测试工程师为什么需要理解搜索算法?

霍格沃兹-测试开发学社

12800

qModel 算法模型平台开源版 v1.3.0 新增模型审批能力,完善算法模型从接入到上线的治理流程

吴同

但随着模型类型增多、使用人员扩大,仅依靠人工确认或直接发布的方式,容易出现: 模型上线缺少统一审核节点;发布申请信息不完整;模型变更过程难以追踪;审核结果缺少记...

3600

开源多模态视觉模型图像地理推理驱动定向社会工程攻击研究

芦笛

中国互联网络信息中心 | 工程师 (已认证)

针对 2026 年 7 月 McAfee 与 KnowBe4 披露的新型网络威胁,本文系统研究开源视觉语言模型(VLM)基于社交平台公开旅游照片实现无元数据地理...

13310

2026 技术观察:MLOps 进入模型治理阶段,版本管理、漂移监测和灰度回滚成为 AI 生产新底座

用户12583401

过去,很多团队更关注模型能不能训练出来、指标是否足够高、能不能部署到线上。但当模型真正进入生产环境后,新的问题会持续出现。

25610

大语言模型幻觉驱动幻影域名抢注(Phantom Squatting)攻击机理与分层防御技术研究

芦笛

中国互联网络信息中心 | 工程师 (已认证)

生成式大语言模型(LLM)普遍存在事实幻觉缺陷,模型会自主生成不存在、符合语义逻辑的域名地址。攻击者利用该稳定幻觉特征,提前注册此类虚构域名并部署仿冒站点实施钓...

23210

2026技术观察:AI 服务网关加速普及,多模型调用开始进入统一路由时代

用户12583401

2026 年,AI 应用不再只依赖单一模型。一个真实系统里,可能同时使用大语言模型、Embedding 模型、图像模型、语音模型和本地小模型。不同模型有不同价格...

23210

WorkBuddy 全模型使用指南:31 条管线的高效驾驭

nexlo

五渠道、三阵营、一张表。从如何选到如何配,本文是 WorkBuddy 模型体系的完整索引。

2.7K10

大模型测试常见误区,90%测试专家都踩过

顾翔

引言 随着ChatGLM、Qwen、DeepSeek及Claude等大语言模型(LLM)加速落地,金融、政务、医疗、客服等关键领域正大规模引入AI能力。然而,当...

19010

大模型测试:技术深度解析

顾翔

2024年,大语言模型(LLM)正加速从API服务演进为嵌入式智能体、自主工作流与多模态决策中枢。与此同时,传统软件测试范式——基于明确输入/输出断言、覆盖路径...

29600

2026大模型测试:成本与效益的临界点

顾翔

2025年Q3,某头部金融AI平台在上线新一代风控大模型(128B参数、多模态推理)后72小时内触发3起生产级幻觉事件——非敏感信息泄露、监管合规条款误判、实时...

34100

为什么Analytics Agent 总答错?来自 Anthropic 的数据分析最佳实践

七牛开发者

在 Anthropic 内部,大约 95% 的业务分析请求已经由 Claude 自动完成,且整体准确率高达 95% 左右。

33110
领券