在上一篇《经理不提需求,代码就不能改》中,我写了一个创业做 To B 业务的朋友最近经历的合作冲突。
腾讯 | 高级前端工程师 (已认证)
前几天,我把一个更便宜的模型接进多 Agent 工作流。原计划是让它先执行,遇到难题再交给 Codex。
某天群里弹出一条消息:"用AI生成了200条用例,五分钟搞定,效率拉满!"底下一片点赞。可等评审会上把这200条用例铺开看,会发现一个尴尬的事实:边界值用的还是...
这并不矛盾。AI优化的是软件交付链条中的一个环节——编码;企业需要交付的却是一项经过需求确认、架构评审、测试验证、安全检查、变更审批和生产观测的业务能力。
给视频第一帧的目标掩码,后面所有帧都不再给标注。一套冻结视觉模型能把目标跟到最后吗? 这次没有接入专门训练的视频分割网络,也没有根据验证集标签调阈值。我们把 ...
最近踩了个公众号限流的小坑,之前连续更新大量Claude系列同质化内容,被平台悄悄限流关进“小黑屋”。
在持续交付节奏日益加快的今天,回归测试正从‘质量守门员’演变为‘交付加速器’。然而,传统回归测试面临三大顽疾:用例冗余率超65%(2023年Applitools...
2024年,RAG(Retrieval-Augmented Generation)已从技术概念跃升为金融、医疗、政务等高可信场景的标配架构。但随之而来的,是一场...
随着大模型应用从通用对话走向垂直落地,RAG(Retrieval-Augmented Generation)已成为构建可信AI应用的核心范式。然而,一个鲜被讨论...
这套库有 41 个 skill,重点是把 Agent 拉回真实工程:先对齐,再规格化,再拆票,再实现,再测试和评审。
GSK(中国) | 全栈架构师 (已认证)
我认识一个团队,花了三周时间跟第一种问题死磕。他们的编程 Agent 会改一行代码 → 跑崩一个测试 → 修复那个测试 → 又跑崩另一个测试 → 无限循环,永远...
看出关键区别没?CLAUDE.md 是「你想让它怎么干」,自动记忆是「它自己摸索出来的怎么干」。 你纠正它「这个项目跑测试得先起本地 Redis」,它下次就记得...
https://pmc.ncbi.nlm.nih.gov/articles/PMC8358584/pdf/10.1177_17470218211008060.p...
在本地用spoon执行一点问题没有,但上传到远程的服务器上,转换就是获取不到变量。
Sexual Calculator 是一个基于心理学维度开发的“性压抑程度”评测工具。 它通过一系列精心设计的问题,帮助你审视内心的真实状态。数据完全本地化处理...
中间是20hash(r160)的编码,"kj06lhgx84h39snsljcey3tpc046ze68"
凌晨回归结束,页面上不是 1 条失败,而是几百条红色记录。登录、下单、支付可能同时失败,但真正的根因也许只有一个:环境不可用、公共依赖超时,或者同一段初始化代码...
这篇不把它写成“又一个 AI 测试平台介绍”。我更关心一个现实问题:接口或服务端逻辑修完以后,把覆盖率报告里的未覆盖分支转成可运行的单元测试。
但你让它做几件真实工作,很快就能看到差别:读普通网页没问题,换成 Twitter 搜索就遇到 API 费用;上服务器访问 Reddit 返回 403;YouTu...
服务端 E2E 只看 HTTP 200 很容易漏问题:页面成功了,但消息没发、缓存没写、下游服务重试了三次。Tracetest 的定位是用 OpenTeleme...