AI+ 2026-09-22
Anthropic 发布 Claude Opus 5.5:更便宜、更快、更会干长活
2026 年 9 月 22 日,Anthropic 发布 Claude Opus 5.5——Claude 5.5 系列的首个模型,定位「长时程 agentic 编程与知识工作」。发布数小时内冲上 Hacker News 首页第一(1100+ 分),与同日 OpenAI 的 GPT-6 Sol/Luna 发布正面撞期。
关键提升(对比 Opus 5)
- agentic 编程:Terminal-Bench 4.0 得分 66.4%(上一代 52.3%)
- 计算机使用:OSWorld 2.0 得分 81.8%(上一代 74.0%)
- 知识工作:GDPval-AA v2.1 达 1846 Elo(上一代 1708)
- 速度与成本:生成速度提升 30% 以上,典型工作负载成本降低约 40%(一半来自更强的 token 效率);官方案例显示测试者用 9.5 小时完成 HAProxy 的 C→Rust 迁移,成本比 Fable 5.1 低 51%
定价:旗舰价格带下探
| 项目 | Opus 5.5 | Opus 5 |
|---|---|---|
| 输入 / 百万 token | $4 | $5 |
| 输出 / 百万 token | $20 | $25 |
| 缓存读取 | $0.20 | $0.50 |
另有快速模式(最高 2.5 倍速,$8/$40)。自适应推理(adaptive reasoning)提供 low 到 max 五档思考深度,简单任务用低档省成本、难任务用高档换质量。模型名 claude-opus-5-5,已上线 Claude Platform、AWS、Google Cloud 与 Azure;Pro/Max/Team/Enterprise 订阅用户获得更高的五小时用量上限。Sonnet 5.5 与 Haiku 5.5 将在数周内推出。
同日对垒:两家的发布互相「点名」
耐人寻味的是时间线:OpenAI 上午发布 GPT-6 Sol,基准对比的靶子还是 Claude Opus 5 与 Fable 5.1;几小时后 Anthropic 直接甩出 Opus 5.5——OpenAI 公告里引用的每一个「被超过」的分数,恰恰是刚被自家新旗舰刷新前的旧数字。旗舰级模型的迭代周期已压缩到季度级,任何「领先」的有效期都在以周计。对选型企业来说,锁定单一厂商的榜单优势意义越来越小,建立自己的任务基线、保持多模型可切换才是稳妥姿势。
对企业的启示
- 成本面:旗舰模型输出价进入 $20 区间且缓存读取腰斩,长对话、大代码库场景(Agent 编程、文档分析)的实际账单将明显下降;
- 工程面:自适应推理的五档深度设计适合「混布」——同一工作流里,路由判断用低档、核心生成用高档;
- 如果您正在评估 Claude、GPT 与国产模型在企业自动化中的组合方案,ProMen 的 AI+ 团队可以协助搭建多模型路由与成本基线评测。