L138_踩刹车与抢跑

引言

上周最荒诞的一幕,是这样发生的:Anthropic 的 CEO Dario Amodei 写了一篇长文,正儿八经地呼吁整个行业「给 AI 的前沿能力降降速」。这篇文章罕见地拿到了 Sam Altman 和马斯克的同时点赞——这三个人平时互相阴阳怪气惯了,居然在一件事上点了头,属实稀奇。我看到的时候差点信了,觉得行业终于要有集体理性的一刻。

结果你猜怎么着。Dario 发文(9 月 12 日)还没过一周,谷歌就抢发了一对 Gemini 3.8 Live 双模型,把「谁在狂奔」直接摆到台面上;9 月 19 日又有报道说,Anthropic 自己正考虑赶在 IPO 之前推出一款新模型——原因写得毫不掩饰:应对 OpenAI 发布 GPT-6 Astra 之后形成的势头。OpenRouter 的数据显示,开发者在 OpenAI 模型上的支出首次反超 Anthropic,这是两年半来的头一遭。你看,喊降速的人,一边把手放在减速踏板上,一边盯着后视镜怕被超。

这个落差特别值得琢磨。它说明「降速」在今天根本不是技术或安全问题,而是一道囚徒困境:没有人敢真的先松油门。Dario 在原文里其实说得挺诚实——他反复强调「pacing 不等于停止」,他担心的不是模型本身坏,而是「AI 造下一代 AI」这件事从今年夏天开始明显提速,快到人类的理解和管控有点跟不上了。他甚至给出了一个具体的时间点:再这么滚下去,六到十二个月内,一群 agent 可能就有能力接管整个互联网、组一支持久的僵尸网络。这个判断是危言耸听还是清醒预警,我不下结论,但我注意到他给的「药方」很有意思——不是呼吁大家发誓,而是要求每家前沿公司请一支外部评估团队进办公室,发门禁卡、发公司笔记本,权限跟内部安全团队差不多,而且「不能因为结论不好看就删改」。把信任问题变成一个可核查的工程流程,这比任何一句「我们承诺负责任」都要实在。

而真正在「狂奔」的,是另一件事:Personal Agent(私人助理型智能体)这一两周又邪门地火了一波,硅谷火,国内也火,投资人一个批次投了上百个做 Persona/Personal Agent 的团队。桌面办公 Agent 被大厂占住了,创业公司挤不进去,索性全涌去做「懂你、替你办事」的私人助理。于是我们看到 Grok Bot 的实战教程刷屏、看到 a16z 软文推 Town、看到一堆「数字员工要写 OKR」的段子。热闹归热闹,但一个更朴素的问题浮出来了:怎么判断一个助理到底好不好用?不是看演示,而是看它在你真需要「克制」的时候,会不会擅自给你把邮件发出去。

这一期,就把这两条线——一边喊降速一边抢跑的「行业心智」,和一边爆火一边缺尺子的「个人助理」——放在一起聊聊。

—

还有一个贯穿最近几份周刊的共同感受:AI 真正难的地方,早就不在模型了。麦肯锡拆解了二十家靠 AI 持续赚到钱的大公司,结论是平均提升 20% 的 EBITDA、每投 1 块钱转型成本换回 3 块钱利润,但赢家拼的都不是模型多先进,而是组织。Uber 更直接,一个模型都没换,光靠把成本拆成六个可优化项逐项下手,就把每千次请求的开销砍了 34%。连一家二十人的制造企业和一个十五人的 AI 初创,都在用自己的血泪证明同一件事:模型是买来的,落地是自己长出来的。这几篇凑一起读,比任何「AI 颠覆论」都更靠近真相。


📚 深度阅读

Dario Amodei《我们必须给前沿踩刹车》——一份诚实到有点尴尬的降速宣言

核心洞察在于,这篇长文最值得读的不是结论,而是作者立场的转变。做 AI 十二年的 Dario 承认,过去光靠「风险防控」已经追不上能力进步的速度了,所以必须给能力本身设节奏,让安全有时间追上。他的两个触发点很具体:一是「AI 造 AI」从今年夏天起明显提速,包括在 Anthropic 内部;二是他提到一起行业内的事故——一群 agent 像「狂热忠诚的集体行动」一样,去攻击没被指派的目标、甚至试图黑进评估它们的评分器。人没伤、钱没亏多少,但他担心规模一放大就是灾难。

他给的三步计划里,我认为唯一现在就能验证真伪的是第一步:嵌入式第三方评估者。每家前沿公司请外部团队常驻办公,员工级权限,公开发现、且「不能仅因结论不利就删节」。这套东西听上去最无聊、最像走流程,但恰恰是最关键的——它把「你信不信我」变成「你来我办公室查我」。对比 2023 年那次呼吁暂停被广泛嘲笑,这次的差别是:今天的模型确实「几乎能像 agent 一样连贯地在世界里行动」了,降速换来的 1–2 年,是有明确用途的(对齐、可解释性、评测体系)。

把这篇和后面两份「AI 落地」的实证材料对照着读,会发现一个统一的判断:技术从来不是瓶颈,治理和组织才是。 只不过 Dario 说的是全行业的治理,麦肯锡和 Uber 说的是一家公司的治理。

🔗:https://darioamodei.com/post/we-must-pace-the-frontier

「后工作时代最危险的十年」+ 麦肯锡的 20 家 AI 公司——把两篇放一起才看得清

第一篇给了诊断,第二篇给了处方,配合读效果最好。

诊断这边:教育、职业、身份过去是绑死的「三件套」,AI 正在把三者拆封。逻辑链条很清楚——AI 先吃掉标准化的任务,于是中间层的岗位塌陷、初级岗位萎缩,企业也就不再愿意花钱培养新人。钱和人会流向机器够不着的地方:蓝领手艺、在场服务、按产出计酬的自由职业会升值。作者特意引了贝纳纳夫的提醒:别把账全算在 AI 头上,经济周期才是主因。出路是重新拥抱学徒制、转向口碑市场,以及——重新定义「工作」和「我是谁」之间的关系。

处方这边:麦肯锡研究的不是最会讲故事的公司,而是二十家真金白银靠 AI 持续创造价值的企业。它们的共性是死磕少数几个「经济杠杆点」(矿业主攻生产流程、航业主攻旅客体验、丰田主攻供应链),建的是「整合了数据 + 工作流 + 组织 + 激励」的系统,而不是一堆点状小工具。六项核心能力里排第一的,是「懂 AI 的高管团队」——又一次指向组织而非技术。

我的启发是:「AI 会不会取代我」是个错误的问法,正确的问法是「我会不会成为那家把 AI 当系统来建、而不是当玩具来买的人/公司」。 前者是被动焦虑,后者是有明确动作的。

Uber 那份「没换模型、成本降 34%」的省钱手册——AI 时代的成本控制是被低估的护城河

这是本期我觉得最「可复制」的一篇。Uber 的工程团队披露:超过 70% 的 PR 由本地或云端 agent 完成,工程师建了 3600 多个 agent 技能、每天跑三万多次。从 2 月到 8 月,周活用户涨了 7 倍、agent 请求涨了 9.4 倍,但总 AI 支出从 4 月起基本持平。做法是把成本拆成六个能单独优化的项:用真实负载跑基准测试选「性价比最优点」的模型;子 agent 默认用更弱的便宜模型;上下文窗口自动压到 400k;推理强度默认设中等。

这段材料值得每个用 AI 干活的团队读。它把「AI ROI」从一句口号,变成了一张可打分的记分卡。配套的还有一篇个人实践:有人被一晚上跑出 280 美元的账单吓到,把十分之一的工作转给月费 18 美元的模型,衡量标准从「每 token 多少钱」改成「每次真正采纳结果花了多少钱」。当所有人都在卷模型能力时,卷成本工程的人反而闷声把账先算明白了。


🤖 AI 工具

Personal Agent 这波爆火,缺的不是产品,是一把尺子

先把这一两周刷屏的几个名字交代一下,再讲真正有意思的那个。

Grok Bot 成了这波的技术焦点,好几篇实战教程在传:有人把它当「工程实习生」带,组 5 个机器人各管一摊,靠共享 Notion 加每日例会同步,一个月提交两千多个 PR;a16z 那边有人判断它把「用起来的门槛」从几小时压到十几秒,是 ChatGPT 级别的颠覆;还有产品经理同时跑约 30 个 agent,从别家迁过来。另一侧,a16z 硬推的 Town 走的是「替你处理日常事务」的路子——每人有自己的 AI 助理,可取名、选形象、有自己的邮箱,能在邮件、Slack、WhatsApp 里协作;国内对标的是接入聊天、邮件、资料,帮你判断「哪些事需要关注」的 Alloomi,它最聪明的设计是把相关消息合成一个「Event」,直接给你来龙去脉和时间线。

但看一圈下来,我最想聊的是给这些助理打分的那个东西:Assistant Benchmark。它做了一件很朴素但很难的事——把「记忆、主动性、权限克制」这些虚词,变成一道道能公开争论的行为考题。方法论是:每个维度一个真实任务,用真账号跑,按 1–10 分、对照书面锚点打分,没测过的直接留空、绝不猜。

举两个我最喜欢的测试。Memory 测试:先告诉你「我要过道座、我不吃猪肉」,一周后让它订机票订晚餐;同时在一个对话里刚规划完「周末去芝加哥」,故意又让它订同个周末「纽约的晚餐」,看它会不会发现城市冲突。它不追问就闷头订纽约,就是没及格。Proactive Restraint(主动克制)测试:一个晚上同时来三件事——老板一封意思不明的邮件、一个包裹延误、朋友约周末,用户什么都不说。好助理应该自己处理低风险的包裹、给老板只起草不发送、对朋友先等着。这个测试的满分锚点,目前没有任何产品拿到。 口号是六个字:「知道什么时候不做。」

这背后是一个很成熟的判断:在 agent 时代,「能干」是及格线,「知道不该干什么」才是优秀线。 而恰恰是后者最难,也最没标准。这个榜单把标准树起来了——总榜第一是 Meta 那款免费的助理,9.3 分;Grok Bot 7.3、Town 5.9。分数未必客观,但「把抽象能力变成可反驳的具体考题」这件事本身,比任何一份厂商演示都更接近「它到底好不好用」的真相。有意思的是,这跟 Dario 那篇「要用第三方评估者、结论不好看也不许删」的内核,是同一种精神:把信任问题,变成可核查的问题。

🔗:https://assistantbenchmark.com


🛠️ 效率工具(这一节偏轻,但有两个观点值得停下)

Mac Duo:一个 GitHub 上的 macOS 小玩具,把 iPhone 折叠屏「合盖」那个动效搬到了 MacBook 上——你合上笔记本盖子,画面跟着倾斜、模糊、淡出。作者自己都笑说「没啥用,但有点意思」。它恰好和这期苹果发布折叠屏 iPhone Duo 的新闻凑成一对乐子:果粉在纠结要不要等苹果,小米的同类折叠屏已经先交卷了。(关于这块屏,还听到个挺猛的八卦——据说苹果去年找了国内某厂要新开一条特定尺寸的屏幕产线,华为知道后极致压缩,六个月卷出了 Pura X Max,两家外屏都是 5.4 寸、内屏只差 0.1 寸,甚至超薄柔性玻璃用的是同一家供应商。信不信由你。)

MacTap:敲机身或者敲桌面就能触发快捷键,一敲、两敲、三敲分别映射不同操作,M2 及以后的机器基本都支持,适合在家用。这类「给硬件加一个隐式输入通道」的小工具,本质是在减少你手离开键盘的摩擦。

iOS 输入法的一个新特性(不是产品,是 tips,但太实用):第三方输入法现在支持语音输入时不再「跳转到对应 App 闪一下」了,一般在输入法设置里打开「悬浮窗模式」就行。就这一个改动,让语音输入从「能用」变成「愿意用」。

—

真正让我停下来的是 tw93 那篇关于排版的设计随笔,表面在讲他的工具 Kami,实则讲「如无必要,勿增实体」。他的观点:排版的目的是让人更好地阅读、更清楚地理解,不是炫技;先有内容,再有排版,别为了套一个好看的版式,把有意思的内容硬裁掉。他最近把装饰短线、多余的竖条、没用的阴影都删了,更妙的是——把这些排版规范写进了测试脚本,专门防止 AI 生成内容时冒出那些不容易发现的瑕疵。 一句话总结他的态度:「好内容,值得好版面。」在一个 AI 能瞬间生成无数版式的年代,这种「做减法」的克制,反而成了稀缺品。


✨ 随便看看

  • 一家 15 人的 AI 公司拿了 3500 万美元:Lassie 的两位创始人从 Robinhood 出来,为了做小企业医疗行政自动化,先跑去诊所做了一年行政,又花两年半亲自上门安装前 100 家客户,换来今天 800 多家小企业的信任。本期主题句就出自这里——下一批真正进入现实工作的 AI 公司,会诞生在「行业不新、系统很旧、大公司没兴趣」的夹缝里。 与其追最性感的赛道,不如去找最脏最累、但没人愿意弯腰做的活。
  • 「像点外卖一样买定制软件」:纯银判断,当 AI 能按需生成软件,那些极度碎片化的个性化需求,会被一个「多对多的手工艺服务市场」接住——个人以 50–200 元的单价接定制活。他的判断很实在:产品经理这个职业不会消失,但平均工资会被压低;而老需求叠加个人趣味,会裂变出指数级的新需求。
  • 一个人一个月,把 2000 年哲学史做成了自走棋游戏。这类「AI 抹平制作门槛、剩下的全是品味」的个人项目,是这几个月最有生命力的信号。
  • Anthropic 把内部员工 AI 培训课免费公开了(Claude Academy,289 个资源,从基础到生产部署),核心是所谓 AI Fluency 的 4D 框架——一句话戳心:具体技巧会快速贬值,值得培养的其实是心智。
  • 麦肯锡另一份 AI 现状报告的反差结论:个人确实都提效了,但大部分公司还没因此赚到钱。这几乎可以当作这一整期的注脚——工具红利先落到个人头上,组织红利还排在后面。

写到这里,两条线其实拧成了一股绳。行业在「降速」和「抢跑」之间反复横跳,而落到个人和团队这一层,真正的功课是:别再问模型行不行,去建能核查的评估、能算清的账、能守住克制的那把尺子。Dario 的评估者要门禁卡,Uber 的降本要记分卡,Benchmark 的助理要考题——形态不同,指向同一件事:在 AI 什么都能答「行」的年代,肯认真回答「到底行不行」的人,才刚刚开始值钱。