GPT-5.5 代码能力飙升?然后 token 比 5.4 还少
GPT-5.5代码能力被质疑,但速度提升。
1. 关键信息
- GPT-5.5 在 Terminal-Bench 2.0 准确率 82.7%,SWE-Bench Pro 58.6%,Expert-SWE 73.1%(#2)。
- 用户反馈 5.5 比 5.4 速度快、质量可接受(#14)。
- Plus 用户可用 5.5(#6)。
- 有用户认为 Codex 比 Claude 好用(#9),也有用户指出 GPT 终端能力远不如 Claude(#8, #10, #12)。
2. 羊毛/优惠信息
无
3. 最新动态
4. 争议或不同意见
- #8 #10 #12 强烈质疑基准测试结果,认为 GPT Terminal 能力远不如 Claude,测试可能泄漏训练集。
- #13 指出 GPT-5.4 表现不稳定(薛定谔),而 Claude 和 Kimi 更稳定。
- #7 调侃 Anthropic(人类学)才是增加 token 使用最不要脸的。
5. 行动建议
- 如果你是 Plus 用户,可以尝试 5.5 体验速度提升,但若依赖终端/命令行任务,建议继续使用 Claude。