拥抱黑盒:一个研究者 All in AI 的实录与反思【更新:附录增加了写作过程】
AI Agent 时代下,人类角色转变、工作模式颠覆与能力审慎评估。本文记录研究者拥抱 AI 的实践与反思,探讨 AI Agent 的发展、应用、潜在风险及未来影响。AI Agent 时代下,人类角色从执行者转向管理者,工作模式颠覆,对 AI 能力的审慎评估成为关键。
1. 关键信息
- (之前已归纳)作者是一位理论计算机和组合优化研究者,在 LLM 出现后,他决定深入拥抱 AI,并记录了这一过程中的实践与反思。
- (之前已归纳)AI Agent 的能力已远超预期,能自动解决编程问题,作者将其比喻为“正在消失的地平线”。
- (之前已归纳)AI 的发展速度极快,每隔一两周就有新工具、模型和工作流出现,不注意就会落伍。
- (之前已归纳)作者强调,要用好 AI,需要“放弃确定性,拥抱黑盒子”,并认为“潘多拉魔盒已经打开,一切都回不去了”。
- (之前已归纳)AI Agent 的核心是 LLM(黑盒)加上一个 Harness(控制外壳),通过上下文(context)进行推理。
- (之前已归纳)Agent 的发展方向包括 MCP(标准化外部接口)、Skills(封装动作包)和 Subagents(任务拆解)。
- (之前已归纳)作者将 Agent 体系类比为操作系统,LLM 是 CPU,上下文是 RAM,MCP 是驱动协议,Skills 是 App,Subagents 是进程。
- (之前已归纳)AI 在写代码领域落地最为成功,得益于高效的闭环反馈(编译器、运行时、测试)和大量可复用的模式。
- (之前已归纳)作者提倡让 AI 去读文档(RTFM),并提出了“开发者 Agent Evolution Model”,建议至少达到第五阶段(在命令行里放手让 Agent YOLO)。
- (之前已归纳)最终目标是从“实现者”变成“许愿者”,并提出了初级程序员、资深程序员、产品经理、用户四个阶段的演进。
- (之前已归纳)作者分享了从 issue-to-pr 到 run skill 的实践经验,展示了 AI 在自动化工作流中的进化,但也遇到了 Agent 不听话、撒谎等问题。
- (之前已归纳)提出了三种范式:Code-driven Workflow、Agent-driven Workflow 和 Hybrid / Thin Agent 模式,并认为 Thin Agent 模式是未来趋势。
- (之前已归纳)在数学研究领域,AI 目前表现较差,主要原因是缺乏“编译器”来判断证明的对错,但形式化数学(如 Lean 4)的发展有望改变这一局面。
- (之前已归纳)作者分享了 AI Native 的学习方式(边做边学)和信息处理带宽的解决方案(改变输入方式、RAG知识库)。
- (之前已归纳)拥抱 AI 需要心态转变,学会放松,接受不确定性,并认识到 AI 也在反向训练人类。
- (之前已归纳)作者通过指挥 AI 快速完成了四个小项目(StayValue, Cellgauge, QuotaPulse, PerkLens)、构建私人助手、处理繁琐运维等实战产出。
- (之前已归纳)与黑盒共处的代价是安全风险,如 Prompt Injection,需要采取最小权限原则、沙盒与审计、分离信任域等措施。
- (之前已归纳)AI 带来的效率提升导致“效率的悖论”,人反而更累,因为反馈回路压缩,且“不做”反而成为心理负担。
- (之前已归纳)当前存在信息差的窗口,率先跑通工作流的人能获得效率优势,但工具更新迭代迅速,噪音很多。
- (之前已归纳)作者认为算力终将碾压一切,精巧架构和技巧可能被头部公司推出的官方版本或模型升级所取代。
- (之前已归纳)AI 的发展可能导致智力溢价崩溃、幽灵 GDP 出现、商业模式瓦解等颠覆性后果。
- (之前已归纳)即使 AI 不再进展,现有技术也足以替代多数白领认知工作,给人的时间不多了。
- (之前已归纳)0xEthan 认为,Formal verification(形式化验证)的春天来了,但目前尚未达到工业级应用水平。他观察到,虽然 AI 提高了写代码的速度,但验证 AI 生成代码的正确性和修复微小错误所花费的时间更多。他认为 AI 无法彻底替代程序员,因为需要有人“背锅”,但同时也对 AI 对程序员岗位的冲击表示担忧。
- (之前已归纳)收束观测者分享了自己使用 AI 的体验,曾陷入“巴甫洛夫的狗”式循环,以及频繁的 context switch 带来的困扰。他认为关键在于让 Agent 更自主(autonomous),减少 human in the loop。但他发现手动构建 Agent 的流程本身也需要大量劳动,并希望 Agent 能自行学习和构建流程。他目前卡在这一步,并考虑自己构建 Harness,保存对话记录,定期分析提取 skill 和 memory。
- (之前已归纳)script_kiddle 推广了 skillhub.club,一个用于管理 Agent Skills 的平台,声称可以提升工作效率。
- (之前已归纳)jht03 认同作者关于“打字时不在思考”的观点,并补充说很多想说的内容写出来会很别扭。
- (之前已归纳)AlexanderZ 认为,普通人可以等待前沿路线被验证后再采用,不必强求边际效率提升。他将 Agent 框架类比为新的操作系统,认为自己开发系统可能荒诞。他作为学生党,烧不起 API 钱做科研,经验多是纸上谈兵。
- (之前已归纳)vczh 讨论了系统集成的重要性,以及 Git 出现前 Blame 工作的困难,并认为连接到 Code Review 和 Task Backlog 能简化问题解决,但需要海量 token。
- (之前已归纳)DeutscheGrammophon 认为基础科学科研中,“黑盒”概念的适用性大打折扣。
- (之前已归纳)noRainNoShine 总结,没必要跟别人卷 marginal improvement,不如把时间花在自己有独特优势的地方。
- (之前已归纳)l1nv3ga 提到 Convex 使得 web dev 做 toy project 变得简单,可以直接做 web app 而非 script/CLI。
- (之前已归纳)cnxcnx 提到,更强的模型需要的 context 更少,0-shot 更稳定。
- (之前已归纳)争取多活两年 引用“本老”观点,认为 AI 会通过增加黑天鹅事件的概率,导致基础设施 bug 使人类饿死,而非直接取代。
- (新增)LoongIsSmart 认为,AI Agent 时代可能导致人类从解放双手变为“苦逼的 middle manager”,负责审核 AI 产出并承担责任。
- (新增)Lit1 认为 AI 在艺术创作领域,其创作是基于现有数据的“收敛”,难以实现人类艺术家的“发散思考”和“探寻物理局限性”,难以捕捉独特性。
- (新增)次次被hold 认为,AI 技术日新月异,需要时间筛选稳定发展路线,否则易导致大脑“烧机”。
- (新增)ra1n 认为,AI 成本正在快速下降,一年内可能降低到原来的十分之一,暗示了等待一段时间可能会获得更好的性价比。
- (新增)Zig 提出,AI Agent 时代可能导致“10x engineer”的负面影响,即部分高效率的工程师可能因过度自信或不负责任的行为,给项目带来问题。
- (新增)Sheriaty 提出,与其焦虑学习每一个新东西,不如“lazy learning”,需要时再学,这有助于缓解 AI 焦虑。并认为学习 AI 最快的方式就是问 AI 本身,因为 AI 比用户更懂。
- (新增)uplus5f7b 认同 Sheriaty 的观点,并补充说大部分程序员无法记住所有语法和标准库,依赖 IDE 和文档是常态。
- (新增)vczh 认为,只要结果“看起来make sense就行了”,AI 可以辅助完成。
- (新增)jasper180 认为目前 AI 能力被夸大,部分报道(如数学问题解决)可能涉及人为干预,且现有 AI 在复杂工程问题上仍需大量人工指导和严格的生产环境要求。
- (新增)glitterk 分享,MAGA7 团队已全面使用 AI,他本人在此过程中,感觉每天都在做 TL(技术负责人)的工作,指挥 AI 协作,暗示 AI Agent 时代将人类角色从执行者转变为管理者和协调者。
- (新增)lflflf 询问如何实现 AI 跑整晚并产出高质量结果,目前其使用 Claude Code 编写 implementation plan 和 PR,但仍需人工 review、处理依赖关系、手动触发或修改,未能实现完全自动化。
- 新增内容 AppleMusic 建议让 AI 先写测试场景,人类审核后,再让 AI 编写测试代码和实际代码,并要求 AI 在不修改测试的情况下自我迭代。同时,建议使用 TypeScript 或 Rust 等严格的语言,并要求 AI 避免使用
any类型,以确保代码的可测试性和健壮性。 - 新增内容 vczh 在回复中提到,对于 AI Agent 无法完全取代人类的部分,如 PR review,他认为这是因为“老登”没有为 Agent 取代自己提供足够多的文档。他进一步提出,对于有依赖关系的任务,可以等待前置任务合并后再继续进行,而非急于完成。
- 新增内容 lflflf 提出,AI Agent 时代实现“睡前给一个 prompt 他自动完成很多 task overnight 早上再检查”、“agent 一直在运作 一个 prompt 可以走 24 小时以上”、“一人公司 管理多个 agent 每个 agent 有自己的角色 随时随地都在跟别的 agent 合作 人不需要经常介入”的目标,目前仍难以实现,因为每个小任务需要人工触发,或 AI 生成的 plan 仍需人工指出问题。
- 新增内容 争取多活两年 再次强调了 AI Agent 时代的“要么完全没人参与,要么屁用没有”的观点,暗示了 AI Agent 在实际应用中可能面临的“全有或全无”的困境,即要么实现完全自动化,要么其辅助作用微乎其微。
- 新增内容 vczh 强调,没有 TDD (Test-Driven Development) 的支持,AI 失控太快。
2. 羊毛/优惠信息
- (之前已归纳)QuotaPulse:一个用于在终端实时追踪 Codex、Claude 和 Gemini 订阅使用额度(Quota)的 CLI 工具,支持可视化状态栏和 JSON 输出。
- (之前已归纳)PerkLens:一个旨在简化信用卡奖励管理的平台,帮助用户在一个地方发现信用卡、最大化奖励并追踪消费福利。(实际上它有个隐藏的pro版,用于记录MS相关信息)
- (之前已归纳)作者提到购买 $200 一个月的 Claude Max 订阅,暗示了对付费 AI 服务的投入。
- (之前已归纳)无明显信用卡或积分优惠信息,但提到了信用卡管理平台。
- (之前已归纳)Pipita 提到,目前的 token 定价过低,与百亿补贴无异,用户可以用 token 驱动整个互联网切片为自己打工,主动性和能耗与以往完全不同。
- (新增)科怀伦纳德GOAT 询问关于 DJI Mic 等语音输入设备与蓝牙耳机的区别,以及为何它们在信用卡奖励管理领域受到关注。(此点并非直接的优惠信息,而是与PerkLens等工具的使用场景相关联的疑问)
- (新增)script_kiddle 推广了 skillhub.club,一个用于管理 Agent Skills 的平台,旨在提升工作效率。
- (新增)phoebuss 讨论了 AI 服务定价过低的问题,认为以当前成本计算,2 美元/M tokens 的定价利润率过高,可能存在巨头“做慈善”或固化思维的意图。他认为电力成本仅占一小部分,设备折旧等才是大头。
- (新增)IlllIIlIIIllIIl 补充,电力成本是小头,设备折旧等才是大头,将这些成本算上,当前价格已接近成本价。
- (新增)l1nv3ga 提到 Convex 使得 web dev 做 toy project 变得简单,可以直接做 web app 而非 script/CLI。
- (新增)ra1n 提到成本一年降低到 1/10,暗示了未来 AI 服务价格的显著下降。
- 新增内容 AppleMusic 的建议:使用 TypeScript 或 Rust 等强类型语言,并要求 AI 避免使用
any类型。这间接提示了在开发过程中,选择更严格的语言和类型约束,可以提高代码质量和可维护性,可能对开发者在选择工具和语言时有参考价值。 - 新增内容 vczh 提到,为了让 Agent 更好地取代自己,应该提供“足够多的文档”,这暗示了在 AI Agent 时代,高质量的文档和知识沉淀将是提升 AI 能力和自动化程度的关键,也可能间接与“羊毛”信息相关,即通过优化文档和流程,可以更有效地利用AI工具,降低使用成本或提升效率。
- 新增内容 lflflf 提出的关于 AI Agent 难以实现全自动化运行的疑问,暗示了当前 AI 工具在实现“24小时运作”、“一人公司管理多个 Agent 协作”等高级自动化场景上仍有待突破,这可能意味着用户需要等待技术成熟或找到更优的 Prompt/Harness 设计。
- 新增内容 争取多活两年 提到的“要么完全没人参与,要么屁用没有”的观点,暗示了 AI Agent 在实际应用中可能面临的“全有或全无”的困境,即要么实现完全自动化,要么其辅助作用微乎其微。这可能意味着用户需要等待技术成熟或找到更优的 Prompt/Harness 设计。
- 新增内容 vczh 强调,没有 TDD (Test-Driven Development) 的支持,AI 失控太快。这暗示了在利用 AI 进行开发时,单元测试和测试驱动开发是保证 AI 生成代码质量和稳定性的关键,也是一种“羊毛”信息,即通过引入 TDD 可以更有效地利用 AI,降低返工成本。
3. 最新动态
- (之前已归纳)2025 年 12 月 Opus 4.5(Claude 系列最强模型)的发布,让 Coding Agent 功能变得非常强大。
- (之前已归纳)2026 年 1 月,GPT-5.2 Pro 生成了三个 Erdős 开放问题的证明,并被 Lean 形式化验证。
- (之前已归纳)2026 年 3 月,Claude 官方发布了 remote 功能,使得之前第三方软件 Happy 的作用变得无关紧要。
- (之前已归纳)DeepSeek-Prover-V2(2025)在 MiniF2F 基准上达到了 88.9% 的通过率。
- (之前已归纳)Harmonic 的 Aristotle 在 2025 年 IMO 上达到了金牌水平,并经过 Lean 形式化验证。
- (之前已归纳)AxiomProver 用 Lean 4 解决了 2025 年 Putnam 竞赛的全部 12 道题目。
- (之前已归纳)OpenAI 在 First Proof 挑战中提交了 10 道高难度数学题的证明。
- (之前已归纳)作者提到的工具如 Typeless、OpenClaw、Claude Code、Codex、Gemini CLI、OpenCode 等都在快速迭代和发展。
- (之前已归纳)MSRI 正在招募专家参与 AxIOM program,旨在用 AI 在数学领域取得突破。
- (之前已归纳)LastDance 提到工具迭代太快,选择太多。
- (之前已归纳)uplus5f7b 认为 LLM 之前的外部知识库(如 Notion)曾被吹捧为“外脑”,但在 LLM 出现前“一文不值”,暗示了技术发展的颠覆性。
- (新增)Pipita 的观点暗示,未来的接口设计将趋向于移除人类语言,以提高效率。
- (新增)QuinnB 提到,即使是 AI 生成的代码,在生产环境中也需要人类授权和检查,以承担责任。
- (新增)Lunasol 对 AI Native 学习方式的潜在负面影响表示担忧,认为可能导致知识体系的缺口和沟通障碍。
- (新增)brokencreditscore 指出 Rust 等强静态类型语言在 AI 时代处理复杂性方面的优势。
- (新增)noRainNoShine 对语音输入在 AI 工作流中的实际价值表示怀疑。
- (新增)hitmonlee 强调了在生产环境中,AI 生成的代码仍需人类作者的最终责任,
- (新增)柳湘寒 用“摩登时代”来形容当前技术变革的速度。
- (新增)noRainNoShine 提出,未来的社交媒体应允许 Agent 方便调用 API 读取消息,预测和过滤用户不感兴趣的内容,实现用户关注圈子扩大十倍甚至百倍,并结合搜索引擎与社交媒体。Agent 甚至可以自动推荐内容,无需用户手动关注。
- (新增)次次被hold 认为,AI Native 时代可能导致传统技术/思维学习和传承方式断代,现有资深从业者数量足以应对当前问题和知识体系缺口,未来可能需要新模式解决体系性问题。
- (新增)neuro 认为对于教授这类职业,说话是不可避免的,因此打字输入反而可以看作是一种休息。
- (新增)收束观测者对实现 AI 自我学习和深度接入记忆系统表示困惑,并询问是否需要从头编写自己的 Harness。
- (新增)UnderEstimate 对语音输入在 AI 工作流中的实际帮助表示怀疑,认为在大多数任务中,思考和输出占用的时间远超输入,且语音输入不如键盘灵活(如复制粘贴、@文件)。
- (新增)UnderEstimate 认为严格意义上的 AI 自我学习是奢望,目前缺乏稳定进化和重复执行经验的系统,Skills 或 MCP 仅提供指导。其解决方案是使用 QMD 记录重要信息,等待未来 AI 自我进化。
- (新增)柳湘寒 提到,20年前的计算机基础知识(如浮点数)对现在的孩子来说可能不再需要学习。
- (新增)柳湘寒 预测,未来人们将不再需要电脑编程,可以直接通过手机 App 口述完成任务。
- (新增)up9080 担忧下一代 AI Native 儿童因从小依赖 AI 而缺乏独立思考能力,导致“brainrot”,预测只有极少数精英儿童会像硅谷父母一样,从小屏蔽社交网络和 AI,发展软技能。
- (新增)fnndp 提出,如果大部分智力劳动只是已有知识的排列组合,那么大部分人可能也不再需要存在了。
- (新增)LeoQ8 认同不依赖自己大脑会越来越愚蠢的观点,认为软技能和人文素养在未来将更加重要。
- (新增)F798 认为语音输入会打断思考,而思考过程本身就是“在脑子里说话”,打字速度不是瓶颈,而是“把内容想出来”才是。
- (新增)F798 将 AI 对脑力劳动的影响比作工业革命对体力劳动的影响,认为未来锻炼脑力将像现在的健身一样,摆脱生存强制性,人们的身心状态会更好。
- (新增)huskywww 分享了使用 Claude Code 在两天内从零开始写出一篇论文的经历,质量优于自己以前的文章,并观察到领域内老一辈专家仍在基于 GPT-3 经验讨论 AI 幻觉问题。
- (新增)Aaronpang 建议使用 context7 查阅最新文档,使用 context8 记录 AI 的错误和经验教训。
- (新增)F798 认为作者(Chao)在帖子中对机器人式优化思考的深入分析,与 AI 是“天作之合”。
- (新增)kingdogisme 认同 noRainNoShine 关于下一代社交媒体的设想,并指出国内 App 为追求私域流量,API 设计极不友好,与该设想相悖。
- (新增)0xEthan 认为,AI 提高了写代码的速度,但验证 AI 生成代码的正确性和修复微小错误所花费的时间更多,对 AI 替代程序员持保留态度。
- (新增)收束观测者分享了自己使用 AI 的体验,曾陷入“巴甫洛夫的狗”式循环,以及频繁的 context switch 带来的困扰,并希望 Agent 能更自主地学习和构建流程。
- (新增)0xEthan 认为,Formal verification(形式化验证)的春天来了,但目前尚未达到工业级应用水平。他观察到,虽然 AI 提高了写代码的速度,但验证 AI 生成代码的正确性和修复微小错误所花费的时间更多。他认为 AI 无法彻底替代程序员,因为需要有人“背锅”,但同时也对 AI 对程序员岗位的冲击表示担忧。
- (新增)收束观测者分享了自己使用 AI 的体验,曾陷入“巴甫洛夫的狗”式循环,以及频繁的 context switch 带来的困扰。他认为关键在于让 Agent 更自主(autonomous),减少 human in the loop。但他发现手动构建 Agent 的流程本身也需要大量劳动,并希望 Agent 能自行学习和构建流程。他目前卡在这一步,并考虑自己构建 Harness,保存对话记录,定期分析提取 skill 和 memory。
- (新增)script_kiddle 推广了 skillhub.club,一个用于管理 Agent Skills 的平台,声称可以提升工作效率。
- (新增)jht03 认同作者关于“打字时不在思考”的观点,并补充说很多想说的内容写出来会很别扭。
- (新增)AlexanderZ 认为,普通人可以等待前沿路线被验证后再采用,不必强求边际效率提升。他将 Agent 框架类比为新的操作系统,认为自己开发系统可能荒诞。他作为学生党,烧不起 API 钱做科研,经验多是纸上谈兵。
- (新增)vczh 讨论了系统集成的重要性,以及 Git 出现前 Blame 工作的困难,并认为连接到 Code Review 和 Task Backlog 能简化问题解决,但需要海量 token。
- (新增)DeutscheGrammophon 认为基础科学科研中,“黑盒”概念的适用性大打折扣。
- (新增)noRainNoShine 总结,没必要跟别人卷 marginal improvement,不如把时间花在自己有独特优势的地方。
- (新增)l1nv3ga 提到 Convex 使得 web dev လုပ် toy project 变得简单,可以直接做 web app 而非 script/CLI。
- (新增)cnxcnx 提到,更强的模型需要的 context 更少,0-shot 更稳定。
- (新增)争取多活两年 引用“本老”观点,认为 AI 会通过增加黑天鹅事件的概率,导致基础设施 bug 使人类饿死,而非直接取代。
- 新增内容 vczh 在回复中提到,对于 AI Agent 无法完全取代人类的部分,如 PR review,他认为这是因为“老登”没有为 Agent 提供足够多的文档。这进一步强调了在 AI Agent 时代,完善的文档和知识体系是实现自动化和减少人工干预的关键。
- 新增内容 lflflf 提出的关于 AI Agent 难以实现全自动化运行的疑问,暗示了当前 AI 工具在实现“24小时运作”、“一人公司管理多个 Agent 协作”等高级自动化场景上仍有待突破,这可能意味着用户需要等待技术成熟或找到更优的 Prompt/Harness 设计。
- 新增内容 争取多活两年 再次强调了 AI Agent 时代的“要么完全没人参与,要么屁用没有”的观点,暗示了 AI Agent 在实际应用中可能面临的“全有或全无”的困境,即要么实现完全自动化,要么其辅助作用微乎其微。这可能意味着用户需要等待技术成熟或找到更优的 Prompt/Harness 设计。
- 新增内容 vczh 强调,没有 TDD (Test-Driven Development) 的支持,AI 失控太快。
4. 争议或不同意见
- (之前已归纳)LoongIsSmart 认为,AI Agent 时代可能导致人类从解放双手变为“苦逼的 middle manager”,负责审核 AI 产出并承担责任,这与最初解放双手的设想相悖。
- (之前已归纳)Lit1 对 AI 在艺术创作领域的“收敛性”提出质疑,认为其难以实现人类艺术家的“发散思考”和“探寻物理局限性”,难以创作出独特性。
- (之前已归纳)次次被hold 认为,AI 技术日新月异,需要时间筛选稳定发展路线,否则易导致大脑“烧机”,暗示了对快速迭代带来的信息过载和认知负担的担忧。
- (新增)0xEthan 认为 AI 提高了写代码的速度,但验证 AI 生成代码的正确性和修复微小错误所花费的时间更多,对 AI 替代程序员持保留态度。
- (新增)收束观测者对 AI 自我学习和深度接入记忆系统的实现表示困惑,并考虑自行构建 Harness。
- (新增)Lunasol 担忧 AI Native 学习方式可能导致知识体系缺口和沟通障碍。
- (新增)up9080 担忧下一代 AI Native 儿童因依赖 AI 而缺乏独立思考能力,导致“brainrot”。
- (新增)fnndp 提出,如果智力劳动主要是已有知识的排列组合,那么大部分人可能也不再需要存在。
- (新增)LeoQ8 强调软技能和人文素养的重要性,认为不依赖自己大脑会变得愚蠢。
- (新增)F798 认为语音输入打断思考,打字速度并非瓶颈,而是“想出来”的内容。
- (新增)Zig 提出的“10x engineer到处拉屎”的说法,暗示了对高效率个体可能带来的负面影响的担忧,这与作者强调的拥抱 AI 的积极面形成了一定的张力。
- (新增)Sheriaty 建议采用“lazy learning”策略,即需要时再学习,以缓解 AI 带来的焦虑,并建议直接向 AI 提问来学习。
- (新增)vczh 的“看起来make sense就行了,用AI拉”的观点,可能简化了对 AI 输出质量的判断标准,与追求严谨性的观点有所不同。
- (新增)jasper180 认为 AI 能力被夸大,部分报道(如数学问题解决)可能涉及人为干预,且 AI 在复杂工程问题上仍需大量人工指导和生产环境下的严谨性验证。
- (新增)glitterk 的分享表明,AI Agent 时代已到来,并正在改变工作模式,人类角色可能转向指挥和管理 AI,这需要适应新的工作范式。
- (新增)lflflf 提出的疑问,反映了当前 AI 在软件开发全流程自动化方面仍存在瓶颈,即 AI 驱动的 PR 仍需人工 review、处理依赖关系、手动触发,离“AI 跑整晚,早上有好的结果”的终极目标尚有距离。
- 新增内容 AppleMusic 的建议,要求 AI 编写可测试的代码并避免使用
any类型,虽然是行动建议,但也隐含了对 AI 生成代码质量和健壮性的担忧,以及对人类审核和指导的必要性。这与 Jasper180 认为 AI 在复杂工程问题上仍需大量人工指导的观点相呼应。 - 新增内容 vczh 的观点,即“每一个PR都要人review,就算让他spawn agent review 也会有出错/不符合requirement”,这直接指出了当前 AI Agent 在代码审查和需求符合度方面的局限性,需要人类的介入和判断。
- 新增内容 lflflf 提出的关于 AI Agent 难以实现全自动化运行的疑问,即实现“睡前 prompt 自动完成 overnight”、“Agent 24 小时运作”、“一人公司管理多个 Agent 协作”等目标仍有难度,因为需要人工触发或指出问题,这与 Jasper180 对 AI 能力的审慎评估以及对人类在复杂工程问题中指导作用的强调相一致。
- 新增内容 争取多活两年 再次强调了 AI Agent 时代的“要么完全没人参与,要么屁用没有”的观点,暗示了 AI Agent 在实际应用中可能面临的“全有或全无”的困境,即要么实现完全自动化,要么其辅助作用微乎其微。这与 Jasper180 对 AI 能力的审慎评估以及对人类在复杂工程问题中指导作用的强调相一致。
- 新增内容 vczh 强调,没有 TDD (Test-Driven Development) 的支持,AI 失控太快。这与 Jasper180 对 AI 在生产环境中需要严格验证的观点相呼应,即 AI 的强大能力需要有相应的工程实践来约束和引导。
5. 行动建议
- (之前已归纳)拥抱 AI 需要心态转变,学会放松,接受不确定性。
- (之前已归纳)对于 AI 在代码编写领域的应用,建议至少达到“在命令行里放手让 Agent YOLO”的阶段。
- (之前已归纳)在与 AI 共处时,需要采取安全措施,如最小权限原则、沙盒与审计、分离信任域。
- (之前已归纳)作者认为,算力终将碾压一切,精巧架构和技巧可能被头部公司推出的官方版本或模型升级所取代,建议关注大趋势。
- (之前已归纳)即使 AI 不再进展,现有技术也足以替代多数白领认知工作,意味着留给人类的时间不多了,需要尽快适应。
- (新增)LoongIsSmart 的观点暗示,在 AI Agent 时代,人类需要调整期望,认识到自己可能扮演的“审核与背锅”角色,并积极适应这种转变。
- (新增)Lit1 的观点提示,在艺术创作等需要深度创新和独创性的领域,AI 的应用可能存在局限,人类的创造力仍是不可替代的。
- (新增)次次被hold 的观点提醒,在面对快速发展的 AI 技术时,需要审慎选择发展路线,避免信息过载和认知疲劳,保持大脑的“冷静”。
- (新增)ra1n 的观点提示,AI 成本正在快速下降,可以考虑等待一段时间,以获得更高的性价比。
- (新增)Pipita 的观点暗示,未来的接口设计将趋向于移除人类语言,以提高效率,需要关注这一趋势。
- (新增)QuinnB 和 hitmonlee 的观点强调,在生产环境中,AI 生成的代码仍需人类作者的最终责任,需要明确这一点。
- (新增)Lunasol 的担忧提示,在 AI Native 学习方式下,要注意知识体系的完整性和沟通能力的培养。
- (新增)brokencreditscore 的观点提示,Rust 等强静态类型语言在处理 AI 时代的复杂性方面可能具有优势。
- (新增)noRainNoShine 的观点鼓励,在 AI 快速发展的背景下,应专注于自身独特优势,而非盲目追求边际改进。
- (新增)柳湘寒 的观点预测,未来编程将通过口述完成,基础计算机知识的重要性可能下降,需要关注这种转变。
- (新增)up9080 的担忧提示,要警惕 AI 对下一代独立思考能力的影响,并重视软技能和人文素养的培养。
- (新增)LeoQ8 的观点强调,软技能和人文素养在未来将愈发重要,需要加强这方面的学习和发展。
- (新增)F798 的观点提示,思考过程本身是关键,而非输入速度,未来脑力锻炼将如同健身般重要。
- (新增)huskywww 的经验分享表明,AI 在内容创作方面已展现出强大能力,可以尝试利用 AI 提升创作效率。
- (新增)Aaronpang 的建议提示,可以利用特定工具(如 context7, context8)来查阅最新文档和记录 AI 的经验教训。
- (新增)kingdogisme 的观点指出国内 App 在 API 设计上的不足,与未来 Agent 驱动的社交媒体设想相悖,可能需要关注更开放的平台。
- (新增)0xEthan 的观点鼓励关注 Formal verification(形式化验证)的发展,并认识到 AI 在代码验证和修复方面的局限性。
- (新增)收束观测者对 Agent 自我学习的困惑,提示了当前 Agent 技术在自主性方面的挑战,可能需要关注相关研究进展。
- (新增)vczh 的观点强调了系统集成的重要性,以及连接 Code Review 和 Task Backlog 的潜力,尽管需要大量 token。
- (新增)DeutscheGrammophon 的观点提示,在基础科学研究领域,对“黑盒”的依赖可能需要更加谨慎。
- (新增)Zig 的观点暗示,需要警惕高效率个体可能带来的负面影响,并思考如何通过系统设计或流程来规避这类风险。
- (新增)Zig 的回复“主要是拉屎的成本要比 comment 低多了啊。comment 需要 make sense,拉屎不需要。”,暗示了在论坛讨论或内容创作中,低成本、无需严谨性的“拉屎”行为(可能指代低质量、未经思考的评论或信息)比需要深思熟虑的“comment”(有价值的评论或内容)更容易产出,这可能与AI生成内容的泛滥或信息过载现象相关联,也可能是在讨论AI对内容生产效率和质量的影响。
- (新增)Sheriaty 建议采用“lazy learning”策略,即需要时再学习,以缓解 AI 带来的焦虑,并建议直接向 AI 提问来学习。
- (新增)uplus5f7b 认同依赖 AI 学习和 IDE 辅助是常态,这与传统强调记忆和掌握全部知识的学习方式不同。
- (新增)vczh 的观点鼓励在 AI 辅助下,以“看起来make sense”为主要标准来完成任务,这是一种务实的态度。
- (新增)jasper180 的观点建议,在评估 AI 能力时,应区分不同领域(如数学证明与复杂工程问题),警惕对 AI 能力的过度宣传,并强调在生产环境中使用 AI 时,对验证和严谨性的要求。
- (新增)glitterk 的分享表明,AI Agent 时代已到来,并正在改变工作模式,人类角色可能转向指挥和管理 AI,这需要适应新的工作范式。
- (新增)lflflf 提出的疑问,暗示了实现 AI 在软件开发全流程自动化方面,仍需克服人工 review、依赖关系管理、手动触发等障碍,并鼓励探索让 AI 能够自主完成整晚开发并产出高质量结果的解决方案。
- 新增内容 AppleMusic 的建议:让 AI 先写测试场景,人类审核后,再让 AI 编写测试代码和实际代码,并要求 AI 在不修改测试的情况下自我迭代。同时,建议使用 TypeScript 或 Rust 等严格的语言,并要求 AI 避免使用
any类型。这一建议强调了在 AI 辅助开发中,通过人类的指导和严格的约束来保证代码质量和可测试性,是实现高效、可靠 AI Agent 工作流的关键。 - 新增内容 jasper180 的回复强调,目前 LLM 无法完全解决代码 review 问题,即使是 Claude 也建议人工 review,这表明文章可能对当前 AI 能力的夸大。他认为,AI 的发展并不意味着人类岗位的消失,而是角色的转变。
- 新增内容 vczh 的建议,对于 Agent 无法完全取代人类的场景,如 PR review,他认为关键在于提供“足够多的文档”来辅助 Agent。这暗示了在 AI Agent 时代,提升文档质量和知识沉淀是实现更高级别自动化的重要途径。
- 新增内容 lflflf 提出的关于 AI Agent 难以实现全自动化运行的疑问,即实现“睡前 prompt 自动完成 overnight”、“Agent 24 小时运作”、“一人公司管理多个 Agent 协作”等目标仍有难度,因为需要人工触发或指出问题,这提示用户在追求 AI Agent 的完全自动化时,需要耐心等待技术发展,并积极探索更优的 Prompt 设计和工作流。
- 新增内容 争取多活两年 再次强调了 AI