7月1号早上起来,朋友圈被 Claude Sonnet 5 刷屏了。看了眼官方公告,"史上最具 Agent 能力的 Sonnet",价格还比 Opus 便宜一半。说实话,这种宣传看多了,有点审美疲劳。但作为一个天天和 AI 编程工具打交道的人,还是忍不住想验证一下——这次到底是营销话术,还是真有提升。 我是 6 月 30 日 Sonnet 5 上线当天就开始用的,到现在正好一周。说几个真实的感受,不吹不黑。
从 Sonnet 4.6 切过来,第一件事是看账单
切模型很简单,API 里把模型名从 claude-sonnet-4-20250514 换成 claude-sonnet-5 就完事了。但我第一反应是去后台看了眼计费规则。
官方说法是首发优惠价:2/百万输入 token,10/百万输出 token,到 8 月 31 日截止。之后会调整到 3/15。
这个定价其实挺有意思的。我之前用 Sonnet 4.6 的成本大概是每月大几百块,换成 Sonnet 5 之后……第一周账单出来,我盯着看了半天。按这个消耗速度,单月成本大概会上涨 20%-30%。 不是说好的降价吗?我又翻了下官方说明,发现有个细节被很多人忽略了:Sonnet 5 用了一个新的 tokenizer,同样内容的 token 数量大概会多 10%-35% 。官方说定价已经把这个因素考虑进去了,但实际跑下来,我的体感是——对于代码类任务,token 消耗确实比 4.6 高一些。 简单说就是:单 token 价格降了,但每千字消耗的 token 多了。最终账单……不好不坏,但也没省多少钱。
Agent 能力到底提升了多少?
这是重点。 我用 Sonnet 5 跑了几个真实任务,有简单的有复杂的,结论先放出来:Agent 能力的提升是真实的,但主要集中在长程任务上。
场景一:给一个 React 组件写测试
这个任务很简单,我丢给 Sonnet 4.6 和 Sonnet 5 分别跑了一遍。 Sonnet 4.6 基本上就是按照我的 prompt 生成代码,偶尔会漏掉边界情况,但核心逻辑没问题。 Sonnet 5 的区别在于——它会自己多问一句"这个组件在什么状态下会报错",然后自己补了几个边界 case 的测试用例。第一次看到这个行为的时候,我愣了一下:这玩意儿开始"多想了"。 这大概就是官方说的"Self-checking"能力变强了。它不再完全依赖 prompt 里写的检查项,而是自己会想一步。
跨文件的 Bug 排查
这是我最常遇到的情况。 有个老项目,bug 藏得比较深,涉及三个文件的变量传递问题。之前用 Sonnet 4.6 排查这种问题,它经常在一个文件里绕来绕去,最后给出一个治标不治本的 patch。 换 Sonnet 5 试了一下,感觉确实不一样。它会在排查完一个文件之后,主动说"这个改动可能会影响其他文件",然后继续追踪下去。我观察了几次,它确实会自己顺着调用链往下走,而不是等着我来问。 这里有个细节:之前用 Sonnet 4.6,我需要把三个文件的内容都塞进 context 里才有可能让它理解全貌。Sonnet 5 好像对长上下文的处理更稳了,同样的上下文量,它的输出逻辑更连贯,中途跑偏的情况少了。
场景三:让它帮我写一个需求文档再实现
这个是我好奇试的。让 Sonnet 5 先写一个技术方案,然后按方案实现。 Sonnet 4.6 做这个任务时,写方案和实现经常是脱节的——方案里写的和实际跑出来的代码对不上。 Sonnet 5 好像会把方案里的约束记更久,实现的时候会时不时回看方案,而不是写到一半就放飞自我了。 我没法量化这个提升有多少,但从体感上说,这种"前后一致性"的改善,在实际工作中挺有用的。
代价:它变得更"话痨"了
有提升就有代价。
Sonnet 5 的输出普遍比 4.6 长。它会加很多解释、判断、边界说明。不是说不好,但如果你的场景是"快速补全一段代码",这种话痨模式会拖慢节奏。
我在 Cursor 里用的时候,发现它会生成很多"思考过程"类的注释。代码本身是对的,但注释里全是它的自我对话。提交前得手动删一遍,不然 commit message 看着像在读论文。
这个问题在简单任务上尤其明显。我只是想让它补一个 try-catch,它给我补了四五行注释解释为什么加这个判断。这种"过度解释"的倾向,我用了一周才稍微适应——后来我学会了在 prompt 里加一句"不要添加额外注释"。
关于工具调用
Sonnet 5 的工具调用能力确实强了。 之前用 Sonnet 4.6 调用 bash 工具时,经常遇到它执行完命令就"愣住"了,需要我再追问一句"然后呢"才能继续。Sonnet 5 在这点上有改善——执行完命令,它自己会解读输出,然后继续往下走。这个改进很实用,省了我不少"prompt 加持"的功夫。 不过我发现,在高并发场景下,它的响应延迟比 4.6 稍高一点。大概是因为它思考的步骤更多了,单次响应的耗时长了几秒。不是什么大问题,但如果你的工作流依赖快速迭代,这个差异可能需要注意。
我的结论
一周用下来,我认为 Sonnet 5 的 Agent 能力提升是真实的,但值不值得切换,要看你的场景。
如果你主要用它做:
- 单次代码补全 → 4.6 完全够用,5 没明显优势,还可能更话痨
- 长程 Bug 排查 / 跨文件重构 → 5 明显更强,尤其是需要它"自己想一步"的时候
- 让它自主完成多步骤任务 → 5 的连贯性和自我检查能力比 4.6 强一个档次
关于价格: 如果你之前用 Sonnet 4.6 觉得够用,切换到 5 不一定会省钱。但如果你现在还在用 Opus 4.8 跑这些任务,换成 Sonnet 5 应该能省不少——性能差距缩小了,价格差距拉大了。 说实话,我现在把主力工作切到 Sonnet 5 了。Opus 4.8 还在用,但只留给那些 Sonnet 5 确实搞不定的硬骨头。省下来的 token 配额,还是挺香的。
最后提醒一句:首发优惠到 8 月 31 日,之后会调价。如果觉得 5 适合你,早点锁定优惠价也行。当然,如果你不急,等它稳定一阵子再说也行——毕竟 Sonnet 模型每次大版本迭代初期都有点小问题,4.6 刚出的时候也不是一开始就那么稳的。