摘要:模型可以替换,但IDE提供的编译诊断、预览和模拟器工具并不天然等价。测试应把任务结果、工具使用和失败恢复一起纳入兼容矩阵。
OpenAI用GPT-Live-1和Codex改造LED屏,语音测试最该盯哪条链?
周一上午十点,产品把改好的提示词整段贴进测试群,末尾跟一句:就换了两个词,晚上能上吧。你盯着那两处改动看了半分钟——退款话术里加了「运费一并退还」,「转人工」改...
周报里那行「平均 6.2 步完成」看着很体面,直到你把某条会话的调用日志按时间铺开:同一个订单查询接口,它连着叫了十九次,参数一字未改。最后它交出一段格式完整、...
评审会开到第三遍,产品经理把同一句话又念了一次:「这个『基本可用』,具体要看到什么才算过了?」桌上六个人——算法、产品、运维、测试都在——没人接话。不是不想答,...
过去测广告,重点是展示、点击、跳转和归因。广告变成可对话的商家Agent后,用户会追问价格、库存、退款和效果,系统不再只是展示素材,而是在实时生成承诺。
接口字段改动不会平均影响全部用例。真正危险的是:字段看似只多了一个枚举值,AI却按照旧规则批量维护断言,把“部分退款”仍当成“退款完成”。这篇把接口维护从“改脚...
选型材料还剩最后一页。你上周从厂商发布页截下来的那张图,被贴进了三份评审文档,其中一个数字撑起了整个『为什么选这版模型』的论证。今天临下班你想把同一块区域再截一...
上线评审会开到第二十分钟,卡在同一个问题上:这个智能体到底能不能上线。产品说演示很顺;算法说场景集通过率不错;安全说没报漏洞;运维说回滚预案写好了;业务负责人最...
如果同一种错误反复出现,历史经验没有沉淀,Prompt 和 Skill 修改后也缺少稳定的回归验证,那么 Agent 即使接了再多工具、工作流再复杂,也很难形成...
客服 Agent 收到“这笔订单不要了,帮我退掉”。它最后回复“退款已提交”,用户也看到了退款金额。两小时后财务发现:退款走到了上一笔订单,优惠券却补给了当前订...
研发把一段 AI Coding 补丁交给测试:单测通过、静态检查通过、接口 Mock 也返回 200。合并后,模型服务在启动阶段报错,原因是补丁改了配置读取路径...
这两年,测试工程师接触的大模型,大多都在“写”:写用例、写脚本、写日志总结、写缺陷分析。
团队让AI分析失败用例、修改Prompt,再让同一个AI重新评分。报告显示:通过率提高了,问题解决了。
关于Agent Skill介绍,如果还不清楚的,可以看看之前公众号发表的这篇 最近很火爆的Claude Skills到底是个啥?解决什么问题?怎么用!
很多团队说“我们做过几十条 Agent Eval”,实际资产只存在某个平台的网页按钮里:案例是谁写的、标准答案是什么、评分器怎么判、失败时调用了哪些工具,全靠系...
评审会上把质量报告投出来。总监三秒划到最后一行:『所以能不能上?』开发盯着自己模块那三条红,其余一眼不看。测试同行从头核对附录里的分母和区间,眉头越皱越紧。三类...
半年前报告里那句『已验证修复』,今天被人翻出来质疑。你想重跑当时那次回归,却卡在三个问题上:那会儿用的哪个模型版本?prompt 改过没有?随机种子锁没锁?报告...
同一套回归用例,周一早上跑完是 88%,你不放心又跑了一次,变成 94%。周报你贴了 94%——贴 88% 那次,评审会上要被人追问『怎么又掉了』;贴 94% ...
周报里那行『测试效率提升 3 倍』,在会上被总监问了一句:分子是什么,分母是什么?办公室安静了下来。写这行的人并不心虚——他是真觉得,用 AI 辅助之后,写用例...