Claude 5.5 现在已有两款发布模型:9 月 22 日公布的 Opus 5.5,以及 9 月 28 日公布的 Sonnet 5.5。Anthropic 将 Opus 定位于需要持续判断的复杂工作,Sonnet 定位于范围明确的日常工作。最新公告中的 Haiku 5.5 仍待发布。Opus 公告、Sonnet 公告。
对编码任务,有用的比较是一个合格结果到底花了多少。Sonnet 较低的 Token 单价让它值得进入试用名单,但不能证明加上返工和审阅后,它在所有任务上都更省钱。
核验日期:2026 年 9 月 29 日。 本文提供官方费率与计算示例。Agent.Space 没有测量两个模型在示例工作负载上的速度、通过率或实际成本。
Opus 5.5 和 Sonnet 5.5 API 单价
下表是第一方 Standard API 价格,单位为美元/百万 Token,来源为 Claude Platform 价格页:
容易忽略的是,两个模型的缓存读取单价相同。Opus 的输入、输出和缓存写入价格是 Sonnet 的两倍,但混合账单不一定恰好翻倍。也不要用缓存读取价格来估算缓存写入。
其他处理模式、云供应商合同、付费工具和适用的数据驻留附加费,需要分别核对。Opus Fast 有独立费率;拿 Standard 与 Fast 比较,会同时改变模型之外的条件。订阅额度也不能转换成固定 Token 承诺。比较套餐而非 API 请求时,请看 Claude Code 计费路径。
一个可以自己重算的请求预算
假设请求包含 100,000 个未缓存输入 Token、500,000 个缓存读取 Token,以及 10,000 个计费输出 Token;不包含新建缓存、付费工具、特殊处理或其他收费。这是价格计算示例,不是真实运行记录。
因为缓存读取价格相同,这个例子里的 Opus 贵 75%,而不是 100%。后续请求如果没有命中缓存、或输出更多,比例会变化。Opus 如果能用更少调用完成任务,完整任务的结论还会再变。
把方法用于真实项目时,应将假设数字替换成供应商报告的用量,计入全部调用、失败和返工,并把人工审阅投入与 Token 账单并列记录。编程 Agent API 成本指南解释了完整核算方法。
先拿哪些任务来试?
下面是我们的评估建议,不是跑分排名:
模型应该通过结果获得默认位置。Sonnet 如果稳定通过任务、总投入更低,就使用这份证据;Opus 如果避免重复返工,或找到了另一条路径漏掉的问题,也应纳入判断。不要因为某款模型被描述为更强,就授予更多权限。
供应商降本比例不等于你的预算预测
API 兼容性也应进入比较。Opus 5.5 规格说明了持续启用的 Adaptive Thinking,以及强制工具选择和 Thinking Block 处理的破坏性变化。集成如果不能完成工具循环,更低单价也无从节省。切换已有应用前,先核对这些变化。
Anthropic 报告的是各模型相对前代的典型任务成本变化。这属于供应商测试结果,不是你工作负载上 Sonnet 与 Opus 的确定差距。有效比较需要相同初始状态、兼容工具、记录过的推理投入,以及固定验收规则。
使用独立仓库副本,先评价产物,再重复几个任务,之后才决定默认模型。回归评估指南能帮助区分一次失败与可重复差异。CLI 选择和供应商别名检查,见 Claude Code 使用 Sonnet 5.5。
在 Agent.Space 比较实际可用路径
Agent.Space 为受支持的 harness 和模型提供共享项目边界。先核对实时模型价格与兼容模型选择器,再判断 Claude 5.5 是否可用。这里的 Anthropic API 单价不等于 Agent.Space 用量报价。
合适的受支持路径可用时,创建 Agent.Space Workspace,保存任务说明和验收证据,让另一条 Session 或同事检查结果。受控比较应使用独立副本;两个 Session 修改同一文件树,不代表自动隔离。第一个项目指南说明了如何从明确的小任务开始。
