真实场景的AI code review的recall才20%几,还敢all accept吗
阿里AI Code Review低召回率引发对云服务可靠性及职场摸鱼文化的嘲讽
关键信息与数据点
- 性能表现:阿里测试显示CC+opus 4.6+/code-review Recall仅29%,Codex+GPT5.5+review Recall仅5% (#1)。少数榜单显示4.6版本优于4.8版本 (#20)。
- 行业现状:阿里内部声称80% PR Comment由AI生成,但低召回率导致大量漏报 (#1)。
- 竞品评价:用户反映近期Claude和Codex表现糟糕,“蠢得不行”,使用体验下降 (#26);@hncswpy 指出微软收购GitHub和LinkedIn后,相关服务体验也变差 (#24)。
争议与不同意见
- 可靠性对比:@Wi-Fi 认为云服务可靠性正从“五个9”降级至类似导弹发射的低可靠水平 (#7);@hncswpy 指出Anthropic和GitHub虽常宕机(uptime像圣诞树),但因非关键基础设施依赖,故未倒闭;若用于美军或医疗金融等Critical场景则风险极大 (#12, #15)。
- 技术乐观主义:@十柒柒 认为AI Code Review出问题由AI解决 (#14);@福禄寿 调侃有Mythos秘密武器可将uptime提升至100个9 (#22);@lijunle 称AI写代码的问题在于它“没有问题”(即缺乏人类般的错误意识或责任)(#18)。
- 降级实锤:部分用户认为当前趋势确为服务降级 (#23)。
- 环境差异观点:@season1 提出低召回率可能源于实验环境与生产环境的差异,若配置好Skill、约束并清晰传达需求文档,效果应更好;纯模型测试不能代表大多数人的生产环境 (#29)。
风险与注意事项
- 安全隐患:All Accept在低Recall下风险极高,可能导致严重事故 (#1, #4)。
- 依赖风险:若关键系统(如飞控、国防)依赖此类AI或云服务,宕机后果不可控 (#10, #12, #17)。
- 上下文缺失限制:@xenomorph 指出AI直接裸看代码仅能修改语法错误,缺乏Design Doc、Ticket、Dependency等上下文时,如同让CRUD Boy Review Linux Kernel,且受限于Pipeline权限和Agent运行环境 (#27)。
闲聊脉络
讨论从技术风险转向职场心态与行业对比。用户普遍持消极或无所谓态度,认为互联网代码质量差是常态(“屎山”),且相比制药、航空等高危行业,互联网容错率较高,甚至出现“AI = All Indian”的刻板印象调侃 (#4, #5, #6, #11)。 - 对立情绪与摆烂心态:部分用户表现出对AI的敌意,认为AI厉害会导致员工被PIP,希望AI搞垮公司事故频发才是正解 (#29);也有用户表示记不清Recall定义,采取“凑合用、坏了再修”的摆烂态度 (#25)。