暂无搜索历史
本文所有代码、日志、测试结论都来自一个实际可跑的项目 Old Game Sandbox(PC 老游戏沙盒)。没有虚构的代码,没有编造的日志。
「Agent」这个词被滥用了。调一次 LLM 不叫 Agent,调一次工具不叫 Agent。能循环、能自己决定下一步调什么工具、能把工具结果喂回自己继续推理——...
评价一个 AI 编程工具,最有效的办法不是跑 benchmark,而是把一个真实的、带着历史包袱的项目交给它,观察它如何从"半成品"走到"可发布"。本文记录我使...