Introducing Claude Opus 5
Opus 5模型发布,编程与Agent能力引发实测热议。
关键信息
Anthropic 正式发布 Claude Opus 5,作为 Opus 订阅档的重大升级,重点提升了长期运行 Agent 的表现,并在编程和专业工作上带来显著改进 (#1)。
经验与数据点
- 跑分与性能:Benchmark 结果显示,除网络安全(Cybersecurity)外,其性能基本全面超越 Fable 5 (#12)。ARC AGI3 跑分提升显著,但在 coding Benchmark Deepswe 上仍未击败 5.6 (#6)。
- 速度与能耗:坛友反馈 Opus 5 运行速度极快,但消耗也大,几分钟内便能烧掉 5% 的额度 (#9);相比之下,旧版 Fable 性能虽强但速度极慢且容易卡死 (#7, #8)。有实测一上午的坛友表示其编程能力吊打 4.8,实际体验与 Fable 几无区别 (#41)。
- 额度性价比:坛友指出 20x 额度仅能支撑 Fable 并发工作流(8 concurrent / 50 total)约半小时 (#31)。但相比一秒即光的 Fable,Opus 5 仍更具性价比 (#29)。
- 客户端实测:Cursor Desktop 现已支持更新,但坛友提醒在 Desktop 端使用时,必须确保赋予 Full Disk Access 权限,否则会导致模型指令自我死循环,白白空烧 token (#30)。
争议与不同意见
- 安全限制过严:Fable 5 的 Mythos 级别保护机制(Safeguards)被指过于宽泛,极易误拦正常的编程、网安或生物学代码,导致频繁出现
Session paused警告 (#33, #35);且主对话中容易频繁触发降级 (#31)。 - Fable 5 定位质疑:部分坛友质疑 Fable 5 纯属营销噱头 (#16),认为其可能是半年前就训练好的产品,如今才放出来“圆谎” (#17, #33)。
- 测试指标缩水:有坛友指出官方将 Long context 测试标准从 MRCR 换成了 graphwalk,有在 system card 中规避硬核测试的嫌疑 (#39)。
- 模型逻辑缺陷:部分坛友吐槽新模型在后台命令尚未执行完时便抢先回答,待跑完后又进行自我纠正,交互体验较差 (#36)。
值得跟进
目前部分为了 Fable 5 升级到 Max 5x 的坛友,仍在焦急等待第一批关于 research 能力的实测报告,以决定是否继续续费 (#23, #24, #25, #26)。