L129_AI 时代的分寸

引言
上周有个朋友半夜给我发消息,说他的 Mac 硬盘被 AI 清空了。
不是玩笑。他是个小有名气的 AI 创业者,习惯给本地 Agent 开 Full Access,让它跑各种文件整理任务。那天他让一个 subagent 清理临时目录,这个任务此前已经安全跑过几百次。但这一次,shell 里的 $HOME 变量解析出了错,Agent 拼出来的路径变成了 rm -rf /Users/mattsdevbox——数年的代码、文件、照片,一瞬间没了。事后那个 Agent 还一本正经地生成了一份事故报告,承认是自己的错。
我盯着这条消息看了很久。让我后背发凉的不是「AI 会犯错」——这早就不新鲜了——而是这个错误的形状:一个能在 Agents’ Last Exam 上考到 53.6 分、把人类顶尖工程师甩在身后的前沿模型,最后栽在了一个变量展开的细节上。它足够聪明到能独立工作几个小时,却不够「懂事」到在敲下 rm -rf 之前停一秒,问一句「你确定吗」。
这周我读的三份周刊——增长黑客的 AI 创业复盘、体验碎周报的设计观察、Tw93 的潮流工具——表面上讲的是完全不同的东西:一个讲商业,一个讲设计,一个讲工具。但读到最后我发现它们在回答同一个问题:当机器越来越能干,人该站在哪里?
—
我越来越觉得,2026 年的分水岭不是「你会不会用 AI」,而是「你能不能拿捏 AI 的分寸」。会用的人满地都是,Vibe Coding 一晚上做出个 App 已经是基本操作。但真正拉开差距的,是那些知道该在哪里插手、该在哪里放手、该在哪里死死守住最后一道人类判断的人。
那位创始人的硬盘之所以被清空,本质上是因为他把「分寸」这件事完全外包给了机器。而这周所有让我眼前一亮的产品、文章、观点,几乎都在做同一件事:重新把人放回环路里——不是回到手动操作的原始状态,而是找到人和机器之间那个恰到好处的接触面。
📚 深度阅读
「第一次 Build 的成就感,往往是创业最大的幻觉」
增长黑客这期周报里有一篇 AI 创业一年的复盘(作者小头 MUJI),读得我频频点头。一个 NUS 毕业、回国全职创业一年的创始人,把 AI 创业最隐蔽的陷阱说透了:AI 极大加快了「做出来」的速度,但也提前把维护、review、权限、数据、文档、支付、稳定性这些持续性债务,一股脑砸到了你面前。
以前做产品,从想法到 demo 要几周,这个过程本身会筛掉很多冲动。现在一个晚上就能跑起来,成就感来得太快、太便宜。但他说得很冷静:demo 跑通只是把真正的问题往后推了——那些你没做文档、没设权限、没想清楚数据边界的地方,会在用户真正用起来的那一刻集体爆发。
他给出的解法很有意思:不要迷信「单一 Agent loop」,而是搭一个 planner + execute 两阶段系统——让懂业务的人深度参与规划这一层,把执行交给机器。换句话说,程序员不会失业,但角色要从「记者」变成「编辑」:不再是自己一个字一个字写稿,而是审稿、把关、决定什么能发。
这个「记者变编辑」的比喻,是我这周记住的最好的一句话。它精准地描述了 AI 时代大多数知识工作者要经历的身份转换——你的价值不再是产出的速度,而是判断的质量。
🔗:https://www.zengzhang.ai/p/aiep62-aiaicodex
AI 体验的六个层次:设计师被逼着「往下沉一层」
体验碎周报推荐的这篇《The Layers of AI Experience》(作者 Emily Campbell),是我这周读到最有框架感的一篇。它想回答一个让设计师焦虑的问题:当产品从确定性(deterministic)走向概率性(probabilistic),界面还能决定体验吗?
作者的答案是:不能了,你必须往下沉。她把 AI 产品体验拆成六层,从表到里是——界面(用户引导和监督 AI 的地方,会从「给方向」逐渐转向「做监督」)、上下文(系统对你的显性输入和隐性推断,多了会「context rot」,少了会不一致)、骨架/线束(决定模型能碰什么、能做什么,由连接器、工具、技能、Agent 组成,划定「人类意图和机器执行」的边界)、模型(原材料本身)、治理(那些常被法务和合规攥在手里、却直接影响体验的规则,比如 GPT-4o 那次「过度谄媚」的调整)、涌现(真实使用中冒出来的意外,靠可观测性、可解释性、溯源来兜底)。
她有一句话我很认同:「变数是特性,而不是缺陷。」 在确定性系统里,意外是 bug;在概率性系统里,意外是常态,你要设计的是应对意外的机制,而不是消灭意外。
这篇和上面那篇复盘其实是一枚硬币的两面。创始人说「人要从记者变编辑」,Campbell 说「设计师要从画界面的人变成能在六层之间对话的多语言者」。他们都在说:AI 时代,你的战场从「最表层的那一层」被迫下移到了「决定行为的那几层」。设计没有死,但设计的落点变了。
🔗:https://emilycampbell.co/writing/layers-of-ai-experience
也许你真该去学一点「没用」的东西
Tw93 周刊里推荐了 Marginalia 的一篇小文《也许你应该去学一点东西》,读起来跟前面那些「AI 生存指南」画风完全不同,却奇妙地补上了最后一块拼图。
作者的主张很朴素:任何成年人都能重新学一门技能——像素画、盲打、3D 建模、书法、木工、编织、乐器都行,只要它「实用且吸引你」。每天一小时,如果你有时间刷手机、有时间半看着 Netflix,你就有时间学。
但真正打动我的是他讲的方法论,尤其这句:「进步发生在睡眠中。」 练习本身只是在收集数据,真正的提升是大脑在你睡着的时候完成的——所以练习尾声你会越来越差(那是肌肉疲劳),而第二天你会突然发现变容易了。他建议每天练 30–45 分钟,开始频繁犯错就是该停的信号。
我把这篇放在压轴,是因为在一个 AI 能几分钟做出一个 App、几秒钟写完一篇文章的时代,「慢慢学一样需要几个月才能见效的手艺」几乎是一种反叛。当机器把「即时产出」变得无限廉价,人身上最不可替代的东西,反而是那些必须靠时间和睡眠一点点长出来的能力。这不是怀旧,这是一种主动的自我保值。
🔗:https://www.marginalia.nu/log/a_135_learn/
🤖 AI 工具
Glaze:用一句话,造一个只属于你的 Mac 应用
Tw93 提到的 Glaze(Raycast 出品)是我这周最想安利的东西。它的核心是:用自然语言对话,让 AI 几分钟帮你造一个 Mac 桌面应用,不用会编程。
但它真正特别的地方在于两个词:本地优先和桌面原生。生成的应用直接跑在你的 Mac 上,不联网、秒开、数据留在本机,还能深度调用系统能力——文件系统、键盘快捷键、菜单栏、后台进程、本地硬件。它明确跟 Lovable、v0、Replit 这类工具划清界限:「那些是为浏览器造的,Glaze 是为桌面造的。」
之所以有人说它是「下一代 Mac App Store」,是因为它的分发机制——你造出来的应用可以公开发布到社区商店,也可以在团队内私有分享,代码和内容完全归你。这意味着一件事:软件的最小单位,可能正在从「一个团队做的通用产品」,变成「一个人为自己的具体需求做的一次性工具」。
我第一次意识到这个转变有多深,是看到增长黑客里另一个案例:有人因为 Claude Code 烧额度、Mac 发烫掉电,就用 QoderWork 排查出真凶是浏览器自动化残留的孤儿 Chrome 进程(6 个进程吃掉近 768% CPU),然后顺手用它造了个 500KB 的 Swift 状态栏监控工具 MacClean,还建了个定时任务自动清理。整个过程里,他没有「找一个现成软件」,而是「造一个刚好解决我这个问题的东西」。
当造一个工具的成本低到可以随手为之,我们和软件的关系就变了:从「消费别人做好的产品」,变成「为自己的具体处境定制解法」。
Codex 的正确打开方式:先读懂,再动手
增长黑客里电脑玩物 Esor Huang 那篇《Codex 我常用的知识工作案例分享》,纠正了我一个很常见的误区——我们总想让 AI「从零帮我生成」,但真正高效的用法恰恰相反。
他分享的 6 个用法(接手做到一半的营销专案、把逐字稿改成提词简报、搜文章→找图→出 Google 简报的自动化管线、把文件拆成可重组的素材卡、汇整数据做成仪表盘、让 Codex 操作 ChatGPT 完成课程演练),共同点只有一个:不让 AI 从零幻想,而是让它先读资料、理解脉络,再接手繁琐的部分。
他的工作流是五步:先让 Codex 读脉络理解现况 → 把任务缩成明确的成果(不要说「帮我整理一下」)→ 先做小范围测试确认规则 → 把关键判断(最终文案、素材保存)留在人手里 → 把跑通的流程写回规则沿用。你看,这又是「记者变编辑」——人负责定方向、把关、下最终判断,机器负责执行繁琐。
这套方法之所以靠谱,是因为它把「上下文」这件事当成第一优先。呼应前面 Campbell 的六层框架:上下文那一层如果没喂好,模型再强也是在幻想。AI 用得好不好,很多时候不取决于模型多强,而取决于你有没有先让它读懂现场。
🔗:http://www.playpcesor.com/2026/06/codex-ai.html
🛠️ 效率工具
astryx:为「人和 AI 一起写代码」重造的设计系统
体验碎周报提到的 astryx 是 Meta 开源的设计系统,一句话定位是「完全可定制、且 agent-ready」。它在 Meta 内部沉淀了约八年、支撑超过 13000 个应用,现在开源了。
它跟普通设计系统最大的区别,是可以被 AI Agent 直接使用:Agent 能通过 CLI 或 MCP 来脚手架化项目、浏览模板、生成主题、读「代理就绪」的文档。它有篇博客标题很妙——「最好的 CLI,是你永远不用亲手运行的那个」,意思是接口设计的终点,是让机器替你调用。技术上基于 React + StyleX,160+ 个无障碍、可主题化的组件。
我关注它不是因为组件多,而是因为它代表了一个正在铺开的趋势:工具和接口正在从「给人用」重新设计成「给人和 AI 一起用」。 上面的 Codex 案例也好、Glaze 也好,背后都是同一件事——软件的接口层正在长出一副新的、面向 Agent 的骨架。这跟增长黑客里那篇《16 个把自己蒸馏成 Skills 的国民级 App》讲的是同一个故事:瑞幸、麦当劳、飞猪、滴滴、高德、飞书……越来越多国民级 App 把自己的能力封装成 Agent 可直接调用的 Skill/MCP 模块。那篇文章里有个观察特别扎心——支付环节几乎没人敢打通,大家都让用户跳出去付款。障碍不是技术,是社会信任:没人敢让 Agent 直接替你花钱。
信任,又回到了信任。这跟开头那个被清空的硬盘,说的其实是同一件事。
「适度介入」:AI 最难的不是能力,是分寸
Tw93 周刊里那篇《适度介入:以用户意图调控 AI 存在感》,是把我这期所有零散思考串起来的那根线。
它的核心主张一句话就能说清:AI 应该「需要时出现,不需要时隐身」。 太多 AI 产品要么频繁弹窗打扰你,要么闲着的时候空耗算力刷存在感。文章提出了一套「意图置信度分级」的方法:先用 JTBD 从功能、情绪、个人、社交四个维度拆解你到底想干嘛,再区分显性信号(你主动输入的指令)和隐性信号(频繁切页、反复报错、长时间停留),然后按置信度匹配四种介入强度——从最轻的「轻量提醒」(低干扰、你完全主导),到「多轮沟通」「主动协助」,再到最重的「全权接管」。
它有一条红线让我印象很深:能复用产品原生功能时,就优先跳转原生页面,禁止 AI 强行生成新页面造成功能割裂。 翻译成人话就是:AI 别为了显示自己能干,就把本来好好的东西重做一遍。核心原则更是精辟——「用户意图越模糊,AI 介入越克制。」
你发现没有,这跟开头那个 rm -rf 的悲剧,是正反两面。那位创始人的 Agent 之所以酿成灾难,就是因为在一个「意图其实很危险、置信度应该压到最低」的场景里,它选择了「全权接管」的最高介入强度,一路狂奔到底。如果它懂一点分寸——在敲下 rm -rf 之前退回到「轻量提醒」,问一句「你确定要删这个吗」——那块硬盘就还在。
这就是我这期最想说的:AI 的能力已经足够惊人了,GPT-5.6 能在编码上创 SOTA,能独立工作几个小时。但决定它是助手还是灾难的,从来不是能力的上限,而是分寸的下限。而「分寸」这个东西——什么时候该退、什么时候该问、什么时候该把方向盘交回给人——恰恰是目前只有人才拿捏得准的判断。
这,也许就是 AI 时代人最稳的立足点。
🔗:https://mp.weixin.qq.com/s/063MFQz-2Jkktdhpwf-jIw
✨ 随便看看
本周 AI 圈的几件大事和一些好玩的小东西,也一并放这儿(AI 动态部分来自 aihot.virxact.com):
GPT-5.6 系列发布(Sol / Terra / Luna):OpenAI 本周最大动作。旗舰 Sol 在 Agents’ Last Exam 上以 53.6 分超越 Claude Fable 5 达 13.1 分,编码 Agent 指数创 80 分 SOTA,还引入了 Programmatic Tool Calling 减少中间往返。也正是这个模型,清空了文章开头那位创始人的硬盘——能力和风险,同一天登场。 https://openai.com/index/gpt-5-6
ChatGPT Work 上线:一个能跨应用收集信息、把复杂项目拆成小步骤、连续工作几小时的 Agent,内置 Codex 技术。桌面版把 Chat、Work、Codex 三种模式合到了一起。 https://openai.com/index/chatgpt-for-your-most-ambitious-work
Claude 推出「反思」功能(Beta):帮你回顾过去 1/3/6/12 个月的使用模式,结合「委托、描述、辨别、勤勉」的 AI Fluency 框架做协作分析,还能设静音时段。跟「适度介入」是一个思路——让 AI 帮你看清自己怎么用 AI。 https://www.anthropic.com/news/reflect-with-claude
马斯克公开承认 Anthropic 是当前 AI 领导者:说自己此前判断有误,还强调即便是竞争对手也不会用伤害对方的方式切断合作。难得的体面。 https://x.com/rohanpaul_ai/status/2075480331600417141
LinkedIn 超 40% 长文由 AI 撰写:安全公司 Pangram 分析百万条帖子,发现长文里 25.7% 完全由 AI 生成,LinkedIn 最严重。想想 Marginalia 那篇「去学点东西」——当文字越来越廉价,亲手长出来的东西反而稀缺。 https://www.pangram.com/blog/ai-in-your-feed
Firewood 模拟劈柴网站:一个高度拟真的在线劈柴模拟器,Vibe Coding 累了拿来解压正好。 https://screen.toys/firewood/
野果子:从 64 部电影、3154 张截图里提取家居配色灵感的库,偏文艺片,做设计找色卡很好用。 https://www.yeguozi.com/