泥潭日报 uscardforum · 内容汇总

Introducing Claude Opus 5

内容摘要

Opus 5模型发布,编程与Agent能力引发实测热议。

关键信息

Anthropic 正式发布 Claude Opus 5,作为 Opus 订阅档的重大升级,重点提升了长期运行 Agent 的表现,并在编程和专业工作上带来显著改进 (#1)。

经验与数据点

  • 跑分与性能:Benchmark 结果显示,除网络安全(Cybersecurity)外,其性能基本全面超越 Fable 5 (#12)。ARC AGI3 跑分提升显著,但在 coding Benchmark Deepswe 上仍未击败 5.6 (#6)。
  • 速度与能耗:坛友反馈 Opus 5 运行速度极快,但消耗也大,几分钟内便能烧掉 5% 的额度 (#9);相比之下,旧版 Fable 性能虽强但速度极慢且容易卡死 (#7, #8)。有实测一上午的坛友表示其编程能力吊打 4.8,实际体验与 Fable 几无区别 (#41)。
  • 额度性价比:坛友指出 20x 额度仅能支撑 Fable 并发工作流(8 concurrent / 50 total)约半小时 (#31)。但相比一秒即光的 Fable,Opus 5 仍更具性价比 (#29)。
  • 客户端实测:Cursor Desktop 现已支持更新,但坛友提醒在 Desktop 端使用时,必须确保赋予 Full Disk Access 权限,否则会导致模型指令自我死循环,白白空烧 token (#30)。

争议与不同意见

  • 安全限制过严:Fable 5 的 Mythos 级别保护机制(Safeguards)被指过于宽泛,极易误拦正常的编程、网安或生物学代码,导致频繁出现 Session paused 警告 (#33, #35);且主对话中容易频繁触发降级 (#31)。
  • Fable 5 定位质疑:部分坛友质疑 Fable 5 纯属营销噱头 (#16),认为其可能是半年前就训练好的产品,如今才放出来“圆谎” (#17, #33)。
  • 测试指标缩水:有坛友指出官方将 Long context 测试标准从 MRCR 换成了 graphwalk,有在 system card 中规避硬核测试的嫌疑 (#39)。
  • 模型逻辑缺陷:部分坛友吐槽新模型在后台命令尚未执行完时便抢先回答,待跑完后又进行自我纠正,交互体验较差 (#36)。

值得跟进

目前部分为了 Fable 5 升级到 Max 5x 的坛友,仍在焦急等待第一批关于 research 能力的实测报告,以决定是否继续续费 (#23, #24, #25, #26)。

Opus 5Fable 5ClaudeAgentCursor