首页
学习
活动
专区
圈层
工具
发布
首页标签测试开发

#测试开发

3个Skills把密钥盘点、轮换、撤销串成一条测试流水线

霍格沃兹-测试开发学社

安全团队常见的一句话是:“这批Token应该没人用了。”问题在于,应该不是证据。一个旧PAT可能埋在CI变量、个人脚本、Runner缓存、Agent环境或某个半...

300

GitHub AI Scan不再依赖CodeQL默认配置:覆盖扩大后,怎么证明漏洞没漏?

霍格沃兹-测试开发学社

摘要:GitHub扩大AI Scan覆盖范围,不再要求仓库启用CodeQL默认配置。本文说明扫描覆盖变广后,如何建立可解释的漏洞样本、误报门禁和仓库级回归。安全...

100

AI写代码更快了,npm发布权限该怎么收紧?一次讲清stage-only令牌能挡什么

霍格沃兹-测试开发学社

很多团队的发布流水线只有两种状态:要么没有npm令牌,什么也发不了;要么拿着能直接npm publish的令牌,一旦脚本、依赖或Runner被攻破,攻击者就能把...

100

PR合并后Agent会话自动标记完成:省下的是列表空间,丢掉的可能是事故证据

霍格沃兹-测试开发学社

Agent修完代码、PR合并,会话自动标记Done,过一段宽限期再删除。GitHub 9月18日周更新披露了这项可选预览能力。

600

Copilot把模型选择变成“效率、平衡、智能”三档:同一套测试还能证明三个档位都可靠吗?

霍格沃兹-测试开发学社

同一个开发者上午让Copilot解释一段代码,下午让它修改支付逻辑。两个任务都选“自动模型”,背后却可能走不同模型、不同推理预算和不同成本路径。

700

Google 开源 ARTEMIS:AI Agent 如何接管 Android 真机测试?

霍格沃兹-测试开发学社

它不是帮你简单生成几段 Appium 脚本,而是让 AI Agent 直接操作 Android 真机或模拟器:理解自然语言测试任务、识别页面、点击控件、跨 Ap...

2400

RAG 不一定需要大模型重排:Jev 能不能做 Context Filtering?

霍格沃兹-测试开发学社

传统方案会用 Embedding 阈值、Cross-Encoder Reranker,或者再调用一次 LLM 做筛选。

3410

Tool、MCP、Skill 越来越多,Jev 能解决 Agent 路由吗?

霍格沃兹-测试开发学社

但当能力数量变成 50 个、100 个甚至更多,路由本身就开始成为 Agent Harness 的核心问题。

3710

Jev 进入 Agent Guardrail:高风险 Tool Call 该怎么测?

霍格沃兹-测试开发学社

当 Tool Call 开始真正影响外部系统,Guardrail 就不再只是一个“安全功能”,而是必须被系统测试的一条关键链路。

5610

Jev 与概率校准:AI 决策系统该怎么测试?

霍格沃兹-测试开发学社

当 AI 开始直接参与分类、路由、风险判断和业务决策以后,测试工程师要验证的,已经不只是“结果对不对”,还包括:

3910

秋招项目生成了Python、Java两套SDK,面试时怎样证明它们不是“都能跑,但结果不同”?

霍格沃兹-测试开发学社

摘要:面向应届生设计一个多语言SDK契约测试项目,用黄金向量验证序列化、错误码和流式取消,比单纯生成客户端更能体现测开能力。

6710

同一份PR重跑三次,AI评审每次都发现新问题:这是能力增强,还是结果不稳定?

霍格沃兹-测试开发学社

摘要:新版Copilot Review会展示后续才发现的Previously missed问题。本文给出重复运行、变形补丁和问题级召回的稳定性评测方法。

4510

GitHub把覆盖率门禁开放给API后,最先暴露的可能不是低覆盖,而是各仓库标准完全不同

霍格沃兹-测试开发学社

摘要:GitHub 9月18日支持用REST API管理代码覆盖率规则。本文说明怎样把最小覆盖率、最大下降幅度、例外和规则漂移纳入测试。

6810

SDK生成器已经开源,最难的却不是“能不能生成”:六种语言怎样证明行为一致?

霍格沃兹-测试开发学社

摘要:Google与Speakeasy开放OpenAPI生成工具后,本文聚焦生成式SDK的质量门:同一规范在不同语言里必须保持序列化、错误、流式取消和版本来源一...

7210

Agent Harness 又要多一层?Jev 开始接管这些高频判断

霍格沃兹-测试开发学社

该调用哪个 Tool?加载哪个 Skill?哪些上下文值得保留?这次操作有没有风险?执行结果需不需要人工检查?

11810

Agent 里为什么不该什么都交给大模型?Jev 给了一个新答案

霍格沃兹-测试开发学社

看起来没有 ChatGPT、Claude 这类大模型那么“全能”,但如果你真正做过 Agent、RAG 或 AI 测试平台,就会发现:

26510

GitHub把覆盖率门禁开放给API后,最先暴露的可能不是低覆盖,而是各仓库标准完全不同

霍格沃兹-测试开发学社

一个组织有40个仓库。A仓要求覆盖率80%,B仓只要新增代码不下降,C仓因为迁移时临时关过一次门禁,半年后没人记得打开。

6400

Copilot会自动关闭自己提过的问题:AI代码评审最该测的,变成了“它为什么消失”

霍格沃兹-测试开发学社

第一次评审,AI指出“退款接口缺少幂等键”。开发提交第二版,只改了变量名。再次评审后,这条评论却从待办区消失了。

6810

OpenAI把Codex Harness开放出来后,我反而更关心一个问题:Agent连续跑几天,到底该怎么测?

霍格沃兹-测试开发学社

OpenAI新发布的Agents API让开发者可以直接使用Codex背后的Harness和基础设施,Agent开始真正具备跨小时甚至跨天执行任务的能力。但Ag...

14300
领券