安全团队常见的一句话是:“这批Token应该没人用了。”问题在于,应该不是证据。一个旧PAT可能埋在CI变量、个人脚本、Runner缓存、Agent环境或某个半...
摘要:GitHub扩大AI Scan覆盖范围,不再要求仓库启用CodeQL默认配置。本文说明扫描覆盖变广后,如何建立可解释的漏洞样本、误报门禁和仓库级回归。安全...
很多团队的发布流水线只有两种状态:要么没有npm令牌,什么也发不了;要么拿着能直接npm publish的令牌,一旦脚本、依赖或Runner被攻破,攻击者就能把...
Agent修完代码、PR合并,会话自动标记Done,过一段宽限期再删除。GitHub 9月18日周更新披露了这项可选预览能力。
同一个开发者上午让Copilot解释一段代码,下午让它修改支付逻辑。两个任务都选“自动模型”,背后却可能走不同模型、不同推理预算和不同成本路径。
它不是帮你简单生成几段 Appium 脚本,而是让 AI Agent 直接操作 Android 真机或模拟器:理解自然语言测试任务、识别页面、点击控件、跨 Ap...
传统方案会用 Embedding 阈值、Cross-Encoder Reranker,或者再调用一次 LLM 做筛选。
但当能力数量变成 50 个、100 个甚至更多,路由本身就开始成为 Agent Harness 的核心问题。
当 Tool Call 开始真正影响外部系统,Guardrail 就不再只是一个“安全功能”,而是必须被系统测试的一条关键链路。
当 AI 开始直接参与分类、路由、风险判断和业务决策以后,测试工程师要验证的,已经不只是“结果对不对”,还包括:
摘要:面向应届生设计一个多语言SDK契约测试项目,用黄金向量验证序列化、错误码和流式取消,比单纯生成客户端更能体现测开能力。
摘要:新版Copilot Review会展示后续才发现的Previously missed问题。本文给出重复运行、变形补丁和问题级召回的稳定性评测方法。
摘要:GitHub 9月18日支持用REST API管理代码覆盖率规则。本文说明怎样把最小覆盖率、最大下降幅度、例外和规则漂移纳入测试。
摘要:Google与Speakeasy开放OpenAPI生成工具后,本文聚焦生成式SDK的质量门:同一规范在不同语言里必须保持序列化、错误、流式取消和版本来源一...
该调用哪个 Tool?加载哪个 Skill?哪些上下文值得保留?这次操作有没有风险?执行结果需不需要人工检查?
看起来没有 ChatGPT、Claude 这类大模型那么“全能”,但如果你真正做过 Agent、RAG 或 AI 测试平台,就会发现:
一个组织有40个仓库。A仓要求覆盖率80%,B仓只要新增代码不下降,C仓因为迁移时临时关过一次门禁,半年后没人记得打开。
第一次评审,AI指出“退款接口缺少幂等键”。开发提交第二版,只改了变量名。再次评审后,这条评论却从待办区消失了。
OpenAI新发布的Agents API让开发者可以直接使用Codex背后的Harness和基础设施,Agent开始真正具备跨小时甚至跨天执行任务的能力。但Ag...