L140_当Agent成为默认前提

这周我干了一件挺能说明问题的事。
我给自己那个半死不活的 side project 接了个 Agent,想让它帮我把散落各处的用户反馈自动归类、打标签、每周汇总一次。指令写完,我盯着屏幕等它「思考」,心里居然有点紧张——像小时候第一次把作业交给一个不太熟的同学帮忙检查。结果它两分钟就跑完了,分类得比我预想的干净。我愣了两秒,然后第一反应不是高兴,而是一种很微妙的空落:这件事,我上周还得琢磨半天怎么排期,今天它两分钟就干完了,那我到底还剩下点什么?
那个下午我翻了一堆东西,越翻越确认这不是我一个人的错觉。整个行业这周像是约好了一起把话挑明:智能正在变得便宜,Agent 正在变成空气。 便宜到你不会为它单独付钱,普遍到你不会把它当成一个卖点。而一旦某样东西变成默认前提,稀缺的东西就必然换一个地方待着。
—
先把「便宜」这件事坐实。就在 9 月底到 10 月初这一周,价格战打得像不要钱:Anthropic 把 Claude Haiku 5.5 的运行成本压到上一代的四分之一,顺手把 Sonnet 5.5 的缓存读取价腰斩到每百万 token 一毛钱;Google 放出 Gemini 4 Argon,单次输出上限从 6.4 万 token 干到 100 万;OpenAI 在 DevDay 上把 ChatGPT 从聊天框升级成 Agent 平台,还配了个成本只有旗舰五分之一的 GPT-6.1 Sol;Mistral 干脆开源了万亿参数的 Large 4。四条新闻指向同一件事——推理成本在加速塌陷。
a16z 那份《State of Markets》给这个现象起了个学名,叫杰文斯悖论:「智能越便宜,对算力的需求只增不减,反过来推高 GPU 价格。」翻译成人话就是,便宜不但没让大家少花钱,反而花得更多了,因为你能做的事一下子多了一个数量级。
—
然后是这周我觉得最值钱的半句话。
有个叫 Chris Lu 的人,把 YC 2026 夏季批次的 236 家公司、470 位创始人拉出来做了个数据分析。里面有个数字特别扎眼:在一句话自我介绍里用「Agent」这个词的公司,从春季的 27% 掉到了 19%。 你以为大家不做 Agent 了?恰恰相反。他的原话是——「没有人停止构建 Agent,他们只是不再把这个词放在最前面。」Agent 现在是默认假设,不再是创业命题本身(it’s the assumption now, not the thesis)。
这话我反复读了好几遍。它精确地描述了我那个下午的空落感:当「我做了个 Agent」不再能解释你是谁,问题就自动升级成了——那你到底把 Agent 跑在什么上面?用什么数据喂它?你拥有它干活的那门生意吗?
Chris Lu 给出的答案很硬核:优势正在转移到「套壳产品追不上的地方」——训练数据、环境、token、芯片、机器人。数据上,夏季批次做硬件的公司从春季直接翻倍到 45 家,做算力基建的 21 家,甚至有家公司专门「给算力经济做保险」。同一周,波士顿动力把前亚马逊 Alexa 负责人 Rohit Prasad 请来当 CEO,摆明了要把大模型灌进人形机器人。a16z 那句 «atoms are so back»(原子回来了),说的就是这个:当比特便宜到白菜价,值钱的重新变成了那些搬不动、复制不了、要真金白银砸进去的原子。
—
但这一期我真正想聊的,是另一半——信任。
因为「原子」这条线太宏大,离普通人有点远。而「信任」这条线,几乎渗透在我读到的每一个故事里。
a16z 刚发的消费级 AI 应用 Top 100 第七期,和 Menlo Ventures 的 2026 消费 AI 报告,罕见地得出了同一个结论:AI 用得很广,但用得很浅。 近一半美国人说自己用过 AI,但只有 25% 每天用;真正给三大模型付费订阅的消费者,只有 4.5%。Menlo 那份调研更狠——在他们测试的全部九个场景里,消费者无一例外都更偏好真人专家而不是 AI,非用户里 70% 根本不信任 AI 给的信息。
把「智能便宜」和「信任稀缺」这两件事叠在一起看,很多东西就通了。
Grok Bot 那个操盘手 Roman Ugarte 有句话,我认为是这周所有话里最戳的一句:「能 100% 完成工作的 AI 和只能做 90% 的 AI,感觉完全不同。」 因为那差的 10% 不是工作量,是心智负担——只要它做不到 100%,你就得一直挂着这件事,一直分神去盯它。而「一直盯着」的本质,就是不信任。flomo 那篇复盘更是把这个道理写成了血泪:他们早先靠外部渠道投递定时任务,失败率接近 99%,很多用户的任务被静默丢弃、排查无果,最后被逼着自己把 Agent 内置进 App——因为可靠性这东西,一旦漏了,用户对你的信任会连本带利地收回。
所以你看,当智能变得像自来水一样便宜,真正稀缺、真正能收费的,是「我敢不敢闭着眼睛把这件事交给你」。这是判断力,也是信任,两样都没有跟着产能一起通胀,反而因为太多、太快、太吵,在急剧通缩。
这一期,我想沿着「原子」和「信任」这两条线,把这一周读到、看到、被戳到的东西摊开给你看。
📚 深度阅读
236 家公司里,「Agent」这个词正在退场
如果说这周只能读一篇,我选 Chris Lu 对 YC 2026 夏季批次的拆解——它几乎是给「Agent 成为默认前提」这个判断做的尸检报告。
数据密度很高,但真正的洞察只有三层。第一层是结构迁移:模型以下的基础设施(能源、芯片、数据中心、训练、推理)占比从 8% 猛升到 20%,应用层从 55% 掉到 39%。创业者正在集体往下沉,往「重」的方向走。Scale AI 是被最多公司点名要取代的对象——8 家直接说要替代它,其他任何在位者被点名都不超过 4 次。
第二层是叙事的消失:交付型 Agent 公司从 45% 降到 33%,Agent 基础设施公司直接腰斩。不是不做了,是这个词不再是通行证。取而代之的四个新集群是算力建设(21 家)、推理降本(11 家,其中 5 家承诺砍掉 80% 以上的账单)、训练数据与强化学习环境。
第三层是「AI-native 服务公司」的崛起,这是我最想圈出来的:21 家公司不再卖软件,而是直接去经营那门生意——会计、保险、放射科、法律、货运、催收、量化交易。Chris Lu 的收尾堪称金句:这批公司「假设了 Agent,然后问的是——你把它跑在什么上面,用什么训练它,以及你是否拥有它工作其中的那门生意。」
我的启发是:这可能是「套壳创业」时代的正式讣告。当 Agent 能力被大模型厂商免费附赠,创业公司唯一能守住的护城河,要么是你脚下踩着别人进不去的数据与硬件(原子),要么是你干脆下场把整门生意做下来、对结果负责(信任)。夹在中间「用 API 拼一个更好看的界面」,会越来越难。
🔗:Chris Lu 原帖(X) | 中文全译(十字路口 Crossing)
AI 正把文化变成黑暗森林
这篇是这一周读得最后背发凉的一篇。导火索是数学界的一桩公案:纽约大学的 Tristan Buckmaster 和 Anthropic 的合作者,靠 Claude、Codex 在纳维 - 斯托克斯这个千禧年难题上推进了近一年;OpenAI 听到风声后,调动约一万个并发智能体,只用 88 小时就得出结果并完成了形式验证。然后,双方陷入了署名争执。
专栏作家由此提出一个让我脊背发凉的类比——AI 正把文化变成黑暗森林:暴露一个未完成的研究方向,等于向更强的竞争者发出狩猎信号。过去「藏一手」是个人性格选择,今天因为 AI 的吸收成本归零,隐藏从性格变成了结构。文中引了技术作家 Venkatesh Rao 的「死亡森林」概念:成熟的小圈子有自己的讨论节奏和判断背景,公开世界只告诉你「有什么」,却不让你进入「它是怎么变成这样的」,于是形成一道无需付费墙的信息结界。
我不完全同意「人人都该做面壁者」这个结论——作者自己也承认代价惨重:切断了知识生长的根,认知回路从来不只长在一个人的头骨里。但我认同它戳破的那个真相:当贡献可以被 AI 独立复现,保密只能保护时间差,保不住价格。 声誉和回报不会按贡献自动分配。它给的出路其实很朴素——掌握真实需求、参与持续合作、留下可验证的记录、争取合理的收益安排,并保留换工具、换渠道的余地。说白了,在一个复制成本为零的世界里,你唯一能积累的是「别人验证过的、属于你的一次次交付」,也就是信任的复利。
🔗:原文(虎嗅转载)
Grok Bot 一个月封神,靠的是「笨办法」
Roman Ugarte 在 Lenny’s Podcast 上复盘 Grok Bot 的爆发,信息量极大,但真正反直觉的是两条。
一是手动 onboarding 前 300 个用户。核心团队亲自给早期用户打 20 分钟一通的电话,一个个观察真实用法。为什么不规模化?因为「用户的困惑,就是优先级」——你亲眼看着一个人在哪一步卡住,那个痛点第二天就变成修复任务,这比任何数据看板都直接。二是发布前拼命删功能,最狠的一刀是砍掉已经做好的调试可见性工具。原则是区分「can now(能力)」和「now has(按钮)」——99% 的自动化是通过对 Bot 说一句话完成的,用户永远看不到配置界面。Lenny 在旁边补了一刀:「AI 很擅长告诉你加什么,很不擅长告诉你减什么。」
他把产品哲学叫「colleague-pilled」——遇到僵局就问:「一个人类同事在这种情况下会怎么做?」由此不展示工具调用和思维链、用长期记忆而非每个任务开新窗口。给新用户的第一句 Prompt 也很有意思:「翻一遍我的 Slack 和邮箱,建议五件你能从我盘子里拿走的事。」
这篇和 Chris Lu 那篇形成绝妙互文:Grok Bot 的成功恰恰证明了「Agent 不是卖点,信任才是」。它没有在功能上碾压谁,而是把「你敢不敢真的把活儿甩给它、然后不看」这件事做到了极致。
🔗:Lenny’s Podcast 复盘(小宇宙) | 中文深度复盘
🤖 AI 产品与公司
Kavak:一家「围绕 AI 重新设计」而非「采用 AI」的公司
a16z 播客请来了拉美最大二手车平台 Kavak 的首席产品与 AI 官,这可能是我听过的最激进的 AI-native 转型样本。
数字很吓人:每天为客户按需启动 10 万到 20 万个专属 Agent,每个跑在独立虚拟机里;96% 的客户交互、95% 的交易由 Agent 完成;销售转化率是人类团队的 2.1 倍;车贷审批从两个月压到 3 分钟内。最魔幻的实验是在墨西哥一座城市,把整座城的业务交给一个「AI CEO」管六周——它每天给一线员工派活、收语音汇报、动态调策略,原目标利润翻倍,实际提升了 50%。
但我最想引用的不是这些数字,是那句方法论:「6% 的改进来自把 AI 嵌进旧流程,10 倍的改进来自让 AI 重新定义流程。」 以及那句应该被裱起来的话——不要说「采用 AI」,要说「围绕 AI 重新设计公司」。Kavak 的架构选择印证了这点:它从「多 Agent 任务图」转向「一个客户配一个 Agent」,让每个 Agent 拥有完整记忆和长期目标。这又是一次「信任」的胜利——只有当 Agent 能像一个记得你全部历史的专属顾问那样工作,用户才敢把买车卖车这种大事交给它。
🔗:a16z Podcast: The Self-Improving Company
个人 Agent 的「信任基建」正在被抢建
一个容易被忽略但极其关键的信号:这一周,Meta 联合 Sierra 提出了一个叫 Personal Agent Protocol(PAP) 的开放标准,基于 OAuth,让消费者级 AI Agent 能被企业「安全地识别、认证并与之交易」。创始伙伴是 Shopify、Stripe、Walmart,v0.1 规范 10 月底发布。
同周,NVIDIA 也发了 Open Agent Safety Platform,把 Agent 的隔离和「kill switch」下沉到硬件层,100 多家机构参与。
这两件事放一起看,意思非常清楚:行业已经开始为「让 Agent 替你花钱、替你签约」这件可怕的事,铺设信任的管道了。 这恰好接住了 a16z Top 100 报告里那个尚未变现的巨大缺口——现在几乎所有 AI 收入都来自订阅和按量计费,只有 14% 的产品有广告,a16z 判断下一步的爆发点是「按购买行为而非按席位收费」的个人 Agent。换句话说,谁能让用户敢闭眼下单,谁就拿到了下一代商业模式的钥匙。Meta 的 Muse 不到一个月破 500 万下载,比当年 ChatGPT 和 Claude 都快,也是同一个风向。
🔗:Sierra: Introducing Personal Agent Protocol | a16z: Top 100 Gen AI Consumer Apps(第七期)
flomo:把 Agent 塞回 App,是一场关于「可靠性」的自救
这篇是我作为笔记工具重度用户特别有共鸣的一则。flomo 最近把 Agent 内置进了应用本体,你可以随时 @ 过往笔记、追问、反驳、联想,还自带全套定时任务推送。
但真正打动我的是它披露的两场硬仗。第一场是可靠性:此前通过外部渠道投递的定时任务,失败率接近 99%,部分用户的任务被静默丢弃、排查无果,团队最终决定不再等——把 Agent 直接做进 App,通知收归应用内,只为换来一条可观测、可重试的链路。第二场是成本:DeepSeek 涨价后高峰期消耗变成原来的 12 倍,已经开发完的模型切换功能被迫搁置,团队花了一个月把成本压回涨价前,还额外做了「重置卡」,承诺不管上游怎么涨,点数耐用度不变。
一个笔记工具,被「定时任务失败率 99%」逼到自己造 Agent——这件事本身就是「信任稀缺」最生动的注脚。用户对工具的要求其实很朴素:我说好每天早上八点提醒我的,你就得真的提醒。做不到一次,前面所有的智能都白搭。
🛠️ 工具与技能
花叔开源的两个 Skill:把「好」编译进代码
独立开发者花叔(alchaincyf)这周开源了两个 Skill,都很有嚼头,因为它们都在解决同一个元问题:AI 不缺能力,缺的是「知道什么叫好」和「知道什么是真的」。
第一个是 huashu-mac-use,让 Agent 操控没有 API 的 macOS 原生应用。它的座右铭我一读就笑了——「读随便读,写不打扰,每一步都留证据」。它按四层自上而下探测可操控层(结构化接口 → 辅助功能树 → 窗口坐标 → 像素),读取永不抢焦点,写入默认用事件注入实现「零打扰」,只有过了四道安全门才升级。硬停止线划得极清:发布、支付、删除这类不可逆动作,一律交还人类。这又是一次「信任工程」——它不追求 Agent 无所不能,而追求 Agent「不越界、可验证」。实测里,Claude Code 用它 33 分钟在 Blender 里建出了一艘邮轮模型。
第二个 huashu-report 更狠,是「给 AI 用的研究报告规范」。花叔跑了个 19 个 Agent 的工作流,扫描 2026 年 42 份顶级机构报告(斯坦福、麦肯锡、BCG、世界银行……),把「品位」拆解成可比较的结构指标。核心机制我强烈建议所有内容创作者抄走:「数字必须先进数据表」——动笔前先建一个 JSON,每个数字一条记录,含数值、口径、样本量、出处和 verified 标记,正文只能引用表里存在的条目,编译器会拦下所有幻觉数字。他还有句取舍判据特别好用:「把这句话删掉,读者对研究结论的判断会不会改变?不变就是工作日志,删。」
这两个 Skill 放一起,其实是同一个信念的两面:在 AI 什么都能生成的年代,可信才是最贵的产品力。
🔗:huashu-skills(GitHub) | huashu-mac-use | huashu-report
一个 Dota 前 100 的网吧老板,怎么用 AI 管 700 台电脑
这是本周我最喜欢的一个真实案例,因为它把「AI-native 服务公司」这个抽象概念,落到了一个特别具体的人身上。
郭剑楠,浙大物理系毕业,Dota2 打到国服前 100,在浙江开了 7 家网吧、近 700 台电脑、42 名员工、年营收 1500 万。但管理一直是他的噩梦:想看一遍完整经营数据,要在不同平台间切账号、登后台 28 次,光月报就花七八天。转折点是他把收银系统、美团、抖音的账号授权接进 AI,让它每天早上自动发经营日报、分析和营销建议。
最见成效的是运维:CPU 温度、显卡负载实时监测,异常自动生成钉钉工单,维修周期从一两周缩到一天;清灰也从全量拆机变成精准定位那 20 台过热设备。零食由 AI 读销售记录提醒补货或下架,员工培训做成了游戏技能树。现在 7 家店每月省两三万,他每天花一两小时就能管完,省下的时间——每周打 Dota,东南亚服 500 名上下。
我特别喜欢他做的一件事:一张「决策时间轴」,把每次采纳 AI 建议的执行结果和门店数据挂钩,过一两个月回头看成效。这才是普通人和 AI 协作最健康的姿势——不是无脑听它的,也不是无视它,而是把它当成一个需要你持续验证、用结果建立信任的同事。
✨ 随便看看
- GEO 加盟堪比诈骗:GEO(生成式引擎优化)最先跑通的生意,居然是向普通人招城市代理收钱。「零加盟费」背后,首次进货、算力预存、保证金总有一个名目把钱收走。最讽刺的是错配——代理能触达的餐馆、装修公司、小门店,恰恰最不适合做 GEO。「品牌承担效果风险,代理承担获客风险,总部先把钱收走。」🔗:36氪
- 情况又变,35 岁成香饽饽了:斯坦福研究(陈如雨等)发现,在 AI 暴露最高的职业里,22-25 岁年轻人就业已落后同龄人约 19%,而 41 岁以上群体的「互补型」用法反而伴随就业增长。机制很清晰:AI 更容易替代「可编码知识」,对实践中习得的「隐性知识」则呈补充状态。真正的价值不在年龄,在「经验里那些难以标准化、能转化为判断与行动的部分」。🔗:腾讯新闻
- 消费 AI「广而浅」的硬数据:a16z Top 100 第七期——首次上榜的新面孔只有 11 个(七届最少,榜单在固化);付费极端幂律,前 1% 用户月均付 903 美元,中位付费者只有 25 美元;ChatGPT 网页访问量约是 Gemini 的 2 倍、Claude 的 6 倍;只有 7 个产品同时登上网页、移动、收入三张榜。🔗:a16z
- Menlo:市场翻三倍,用户没怎么动:2026 全球消费 AI 支出约 400 亿美元,是去年 120 亿的三倍多;但美国成年人使用率只从 61% 涨到 64%。最扎心的一条——在全部九个测试场景里,消费者都更偏好真人专家;非用户中 70% 不信任 AI 信息。「消费者采纳有用的东西,但只留下他们信任的。」🔗:Menlo Ventures
- 84% 美国选民视 AI 为工人威胁:路透/益普索 10 月初民调,84% 受访者认为 AI「对美国工人构成威胁」,两党多数支持更严监管。同一周,2026 年科技行业累计裁员已破 22.5 万人。「AI 繁荣的另一面」这组硬数据,值得每一个从业者清醒一下。🔗:FourWeekMBA
- DeepSeek 逼近千亿融资、冲刺 2027 IPO:新一轮融资规模至少 800 亿元人民币(约 120 亿美元),腾讯、宁德时代领投。Bloomberg Intelligence 指美中顶尖模型的性能差距,已从年初约 15% 收窄到约 3%。国产大模型的「资本成人礼」。🔗:新浪财经
- AI 时代的「信任」正在被明码标价:OpenAI 推出隐形文本水印 textGrain 以合规欧盟 AI 法案,200 token 时检测率约 80%、400 token 时约 95%。当 AI 生成的内容多到无法辨认,「这段是不是人写的」本身成了一种需要被证明的稀缺品。🔗:MLex
写完这期,我回头又看了一眼自己那个 side project 的 Agent。它现在每周准时把汇总发到我邮箱,一次没漏过。
我好像不那么空落了。因为我想明白了一件事:它两分钟干完的,是「归类打标签」这个动作;而决定「要归哪些类、什么标签才对我的产品有用、这份汇总里哪条值得我停下来想五分钟」——这些它一样都替不了我。便宜的智能替我拿走了执行,却把判断和信任,更清晰地留回了我的手里。
这大概就是「当 Agent 成为默认前提」之后,我们每个人都得重新回答的问题:既然做出来不再稀缺,那你到底是谁,别人凭什么信你。
下期见。