Anthropic 刚发布了 Claude Sonnet 4.5。
先说结论:这是目前最强的编程模型。在 SWE-bench Verified 上拿到 77.2% 的成绩,把其他模型甩在身后。更夸张的是,它能连续工作 30 多个小时处理复杂任务,注意力还不会涣散。

除了编程,Claude Sonnet 4.5 在操作电脑方面也有突破。OSWorld 测试中达到 61.4% 的成绩,四个月前 Sonnet 4 才 42.2%。配合新推出的 Chrome 扩展,Claude 现在能直接在浏览器里导航网站、填表格、完成各种任务。
数学和推理能力也有明显提升。各种专业领域的专家测试后发现,金融、法律、医学、STEM 领域的知识和推理能力比之前的模型强太多。

产品更新方面,Claude Code 加入了 checkpoint 功能,可以保存进度随时回滚。还发布了原生 VS Code 扩展。API 增加了上下文编辑和记忆工具,让 AI 代理能处理更复杂的任务。Claude 应用现在支持代码执行和文件创建,包括表格、幻灯片和文档。
最有意思的是 Claude Agent SDK。Anthropic 把自己用来构建 Claude Code 的基础设施开放了出来。开发者现在可以用同样的工具构建自己的 AI 代理。
安全性方面,这是 Anthropic 发布的最"对齐"的前沿模型。减少了谄媚、欺骗、权力追求等问题行为,对提示注入攻击的防御也有进展。

价格保持不变,每百万 token 收费 3/15 美元。开发者直接用 claude-sonnet-4-5 调用即可。
几家公司的反馈挺有说服力。Cursor CEO 说这是他们见过的最强编程模型。GitHub 的产品负责人说 Sonnet 4.5 让 Copilot 在处理复杂任务时表现更好。Replit 从 9% 的错误率降到了 0。Canva 说模型明显更智能了。Sonnet 4.5在金融领域优势明显。金融代理基准测试中,它大幅领先其他基础模型,成为目前最适合实际金融分析工作的模型。

Anthropic 还搞了个临时研究预览 "Imagine with Claude",展示 Claude 实时生成软件的能力。Max 订阅用户可以体验五天。
昨天deepseek更新,今天claude就来了!下一个是谁,国庆又有得看了。