首页
学习
活动
专区
圈层
工具
发布
首页标签AI测试解决方案

#AI测试解决方案

TAPD AI 测试基于DeepSeek和混元大模型重构测试范式,支持AI一键生成测试用例、智能评审需求。

接口用例越多越难维护?先让AI学会看懂一次业务变更

霍格沃兹-测试开发学社

接口字段改动不会平均影响全部用例。真正危险的是:字段看似只多了一个枚举值,AI却按照旧规则批量维护断言,把“部分退款”仍当成“退款完成”。这篇把接口维护从“改脚...

1900

厂商会悄悄改发布页上的数字:测试团队该把结论锚在自己能重跑的那一份上

霍格沃兹-测试开发学社

选型材料还剩最后一页。你上周从厂商发布页截下来的那张图,被贴进了三份评审文档,其中一个数字撑起了整个『为什么选这版模型』的论证。今天临下班你想把同一块区域再截一...

1400

国家评测机构首次给智能体分五级:这套五维框架,测试团队明天就能抄成上线验收清单

霍格沃兹-测试开发学社

上线评审会开到第二十分钟,卡在同一个问题上:这个智能体到底能不能上线。产品说演示很顺;算法说场景集通过率不错;安全说没报漏洞;运维说回滚预案写好了;业务负责人最...

2600

Agent 自进化:从评测、记忆到 Skill 更新,工程闭环怎么搭

霍格沃兹-测试开发学社

如果同一种错误反复出现,历史经验没有沉淀,Prompt 和 Skill 修改后也缺少稳定的回归验证,那么 Agent 即使接了再多工具、工作流再复杂,也很难形成...

3400

只测最终答案已经不够了:Agent Regression Testing到底在回归什么?

霍格沃兹-测试开发学社

客服 Agent 收到“这笔订单不要了,帮我退掉”。它最后回复“退款已提交”,用户也看到了退款金额。两小时后财务发现:退款走到了上一笔订单,优惠券却补给了当前订...

1400

AI修的补丁单测都过了,模型一加载就挂:真正该拦的是哪一层?

霍格沃兹-测试开发学社

研发把一段 AI Coding 补丁交给测试:单测通过、静态检查通过、接口 Mock 也返回 200。合并后,模型服务在启动阶段报错,原因是补丁改了配置读取路径...

300

大模型测评实战:从零跑通 Kev,给“概率模型”做 4 类自动化测试

霍格沃兹-测试开发学社

这两年,测试工程师接触的大模型,大多都在“写”:写用例、写脚本、写日志总结、写缺陷分析。

2000

Fortify静态代码扫描工具最新版本V26.2中新增大量针对AI技术的安全检测内容

道普云

Fortify是软件安全测试领域较为主流的一款静态代码扫描工具,Fortify近日发布了最新版本V26.2。虽然在之前的几次更新中,已经新增了一些关于AI技术的...

1200

Google公开Agent Quality Flywheel:为什么改Prompt的模型不能同时当裁判?

霍格沃兹-测试开发学社

团队让AI分析失败用例、修改Prompt,再让同一个AI重新评分。报告显示:通过率提高了,问题解决了。

1600

AI 测试 Skill 大全,我日常在用的 25 个,夯爆了!

测试开发技术

关于Agent Skill介绍,如果还不清楚的,可以看看之前公众号发表的这篇 最近很火爆的Claude Skills到底是个啥?解决什么问题?怎么用!

5800

OpenAI旧Evals进入退役倒计时:Agent测评别再押在一个平台按钮上

霍格沃兹-测试开发学社

很多团队说“我们做过几十条 Agent Eval”,实际资产只存在某个平台的网页按钮里:案例是谁写的、标准答案是什么、评分器怎么判、失败时调用了哪些工具,全靠系...

3710

决策行 / 缺陷清单 / 复现附录:CI 时代的质量报告,为什么必须分层写

霍格沃兹-测试开发学社

评审会上把质量报告投出来。总监三秒划到最后一行:『所以能不能上?』开发盯着自己模块那三条红,其余一眼不看。测试同行从头核对附录里的分母和区间,眉头越皱越紧。三类...

7610

一份不能重跑的质量报告只是备忘录:可复现脚注的字段设计与纯标准库生成实现

霍格沃兹-测试开发学社

半年前报告里那句『已验证修复』,今天被人翻出来质疑。你想重跑当时那次回归,却卡在三个问题上:那会儿用的哪个模型版本?prompt 改过没有?随机种子锁没锁?报告...

4000

报告里写『通过率 92%』,等于只报了一半:把 AI 测试数字连置信区间一起交出去

霍格沃兹-测试开发学社

同一套回归用例,周一早上跑完是 88%,你不放心又跑了一次,变成 94%。周报你贴了 94%——贴 88% 那次,评审会上要被人追问『怎么又掉了』;贴 94% ...

4910

『效率提升 2 倍』写进质量报告之前,先立三条口径规矩

霍格沃兹-测试开发学社

周报里那行『测试效率提升 3 倍』,在会上被总监问了一句:分子是什么,分母是什么?办公室安静了下来。写这行的人并不心虚——他是真觉得,用 AI 辅助之后,写用例...

5010

一次 pytest 跑出三个覆盖率:行、分支、需求,你的报告写的是哪个?

霍格沃兹-测试开发学社

线上事故复盘会开到第四十分钟,卡在『这块逻辑没测到』这句话上。有人把当期的质量报告翻出来投屏,念出声:『行覆盖率百分之九十多,怎么会没测到?』会议室安静了几秒。...

5710

测试报告别只做『成绩单』:五个字段把放行责任写清楚

霍格沃兹-测试开发学社

晚上七点四十分,你把质量报告发进发布审批群。十分钟后,群里有人回了个『收到』,有人回了句『辛苦了』,上线照旧。三天后回滚通知弹进群,有人翻回你那份报告,问了一句...

4800

AI Agent 事故复盘的十维度归因写法:从指令完整性到执行完整性,每维都产出一条可回归用例

霍格沃兹-测试开发学社

AI Agent 事故复盘的十维度归因写法:从指令完整性到执行完整性,每维都产出一条可回归用例

9110

「我改完自己试了几个问题,感觉没问题」不算发布记录:给每次 Prompt 上线留一份三段式报告

霍格沃兹-测试开发学社

「我改完自己试了几个问题,感觉没问题」不算发布记录:给每次 Prompt 上线留一份三段式报告「这个拒答问题是什么时候开始的?」「上周订单确认率变好,是谁改了什...

5110

同一模型、同一机器、只改一个开关,为什么压测结果仍可能不可信?

霍格沃兹-测试开发学社

摘要:NVIDIA公布了Blackwell机密计算环境下的推理对照实验。本文不复述性能数字,而是拆解测试团队如何复现实验、识别不可外推的边界,并把吞吐、TPOT...

8910

相关产品

  • AI测试解决方案

    TAPD AI 测试基于DeepSeek和混元大模型重构测试范式,支持AI一键生成测试用例、智能评审需求。

领券