首页
学习
活动
专区
圈层
工具
发布
首页标签测试策略

#测试策略

同一份Android工程换了一个AI Agent,最先坏的可能不是代码

霍格沃兹-测试开发学社

摘要:模型可以替换,但IDE提供的编译诊断、预览和模拟器工具并不天然等价。测试应把任务结果、工具使用和失败恢复一起纳入兼容矩阵。

900

OpenAI用GPT-Live-1和Codex改造LED屏,语音测试最该盯哪条链?

霍格沃兹-测试开发学社

OpenAI用GPT-Live-1和Codex改造LED屏,语音测试最该盯哪条链?

1200

改一句提示词就敢上线?先把这三类场景挑出来陪你跑

霍格沃兹-测试开发学社

周一上午十点,产品把改好的提示词整段贴进测试群,末尾跟一句:就换了两个词,晚上能上吧。你盯着那两处改动看了半分钟——退款话术里加了「运费一并退还」,「转人工」改...

1400

智能体不是不会做,是卡住了也不告诉你:给会话装一台停滞检测器

霍格沃兹-测试开发学社

周报里那行「平均 6.2 步完成」看着很体面,直到你把某条会话的调用日志按时间铺开:同一个订单查询接口,它连着叫了十九次,参数一字未改。最后它交出一段格式完整、...

2100

pytest 断言管得了代码,管不了「基本可用」:质量人手里的第三张表,为什么决定你在不在决策桌上

霍格沃兹-测试开发学社

评审会开到第三遍,产品经理把同一句话又念了一次:「这个『基本可用』,具体要看到什么才算过了?」桌上六个人——算法、产品、运维、测试都在——没人接话。不是不想答,...

1000

用户点开一条广告,却和商家Agent聊了十分钟:谁保证它没有乱承诺?

霍格沃兹-测试开发学社

过去测广告,重点是展示、点击、跳转和归因。广告变成可对话的商家Agent后,用户会追问价格、库存、退款和效果,系统不再只是展示素材,而是在实时生成承诺。

1100

国家评测机构首次给智能体分五级:这套五维框架,测试团队明天就能抄成上线验收清单

霍格沃兹-测试开发学社

上线评审会开到第二十分钟,卡在同一个问题上:这个智能体到底能不能上线。产品说演示很顺;算法说场景集通过率不错;安全说没报漏洞;运维说回滚预案写好了;业务负责人最...

6800

Agent 自进化:从评测、记忆到 Skill 更新,工程闭环怎么搭

霍格沃兹-测试开发学社

如果同一种错误反复出现,历史经验没有沉淀,Prompt 和 Skill 修改后也缺少稳定的回归验证,那么 Agent 即使接了再多工具、工作流再复杂,也很难形成...

6210

高校档案库房时序温湿度数据采集:存储策略与历史追溯实现

HONSOR盛世宏博

温湿度监测的价值不仅在于“当下是否超标”,更在于“历史发生了什么、趋势如何演变”。高校档案库房承载着学籍、教学、科研等需要长期保存的档案,环境数据的连续采集与长...

6510

Google公开Agent Quality Flywheel:为什么改Prompt的模型不能同时当裁判?

霍格沃兹-测试开发学社

团队让AI分析失败用例、修改Prompt,再让同一个AI重新评分。报告显示:通过率提高了,问题解决了。

7210

决策行 / 缺陷清单 / 复现附录:CI 时代的质量报告,为什么必须分层写

霍格沃兹-测试开发学社

评审会上把质量报告投出来。总监三秒划到最后一行:『所以能不能上?』开发盯着自己模块那三条红,其余一眼不看。测试同行从头核对附录里的分母和区间,眉头越皱越紧。三类...

10410

实测:给 Agent 补上记忆与工具能力,效果能提升多少(附清单)

A1Book

2025 年以来,智能体从概念走向落地,但很多团队对"到底该补哪些能力、补了之后收益多大"缺乏量化口径。本文基于公开技术资料的共识结论,对四项能力做逐项实测评估...

10610

实验室高低温试验间:以太网温湿度记录仪抗干扰通讯稳定性测试

BJ盛世宏博小程

实验室高低温试验间(温箱/步入式试验室)与常规机房、配电室、车间有一个根本性的不同:被测对象本身就是极端温度环境,而监测设备往往就安装在温箱内部或紧贴温箱壁面。

8110

arxiv 把渗透测试拆成 pytest 能断言的子任务:Google 式记分法轮到防守方用了

霍格沃兹-测试开发学社

arxiv 在 2026-09-09 挂出一篇论文:《Big Enough to Break Out: Tracking the Rising Capabili...

6200

Grok 4.7进Copilot后,测试团队先别比谁更聪明:先测它会不会把任务做得更危险

霍格沃兹-测试开发学社

模型接入开发工具后,最容易出现一种错觉:代码通过测试,模型就升级成功了。实际上,模型变化可能影响工具选择、修改范围、重试次数、解释方式和成本。

13000

AI写代码更快了,npm发布权限该怎么收紧?一次讲清stage-only令牌能挡什么

霍格沃兹-测试开发学社

很多团队的发布流水线只有两种状态:要么没有npm令牌,什么也发不了;要么拿着能直接npm publish的令牌,一旦脚本、依赖或Runner被攻破,攻击者就能把...

13000

Copilot把模型选择变成“效率、平衡、智能”三档:同一套测试还能证明三个档位都可靠吗?

霍格沃兹-测试开发学社

同一个开发者上午让Copilot解释一段代码,下午让它修改支付逻辑。两个任务都选“自动模型”,背后却可能走不同模型、不同推理预算和不同成本路径。

13610

交换机 POE 端口功率分配策略:高密度部署以太网温湿度传感器时的过载保护机制

盛世宏博小可

前面把双供电切换测试、Wireshark 抓包排障讲透了。这一篇回到供电侧——当你的机柜里有 24 口、48 口交换机,每口都插着 PoE 温湿度传感器(或者更...

18010

SNMP 与 Modbus TCP 双协议并行:网口温湿度变送器在监控网络中的端口冲突复盘

盛世宏博科技

近期在调试一套工业环境监控系统时,遇到了关于 Modbus 连接保持的问题。现场部署了一批 恒湿净化设备(包括 @恒湿消毒净化一体机 等),主要用来维持特定环境...

10210

Google 开源 ARTEMIS:AI Agent 如何接管 Android 真机测试?

霍格沃兹-测试开发学社

它不是帮你简单生成几段 Appium 脚本,而是让 AI Agent 直接操作 Android 真机或模拟器:理解自然语言测试任务、识别页面、点击控件、跨 Ap...

15400
领券