OpenAI Codex 负责人 Alex Embiricos:AGI 的瓶颈是人,不是模型
20VC 对话 OpenAI Codex 负责人 Alex Embiricos:Codex、Claude Code 与 Cursor 谁会赢;编程自动化为何反而创造更多工程师;AGI 的真正瓶颈是人类的提示与验证速度。
本文译自20VC 旗下月度秀 20 Product,发布于 2026 年 2 月 21 日;主持人哈里·斯特宾斯(Harry Stebbings),对话 OpenAI 旗下 Codex 产品负责人亚历山大·恩比里科斯(Alexander Embiricos)。
这期对话的核心张力是:当 Codex、Claude Code、Cursor 把“写代码”变成近乎免费的事,稀缺的到底是什么?Alex 的答案不是模型、算力或架构,而是人类的提示速度与验证能力——AGI 的瓶颈在人。他还断言编程自动化会创造更多工程师而非更少、产品经理是“可选的”、OpenAI 内部几乎不再有人手写代码,并对 SaaS 末日论与投资人该往哪去给出了直言判断。
▍嘉宾:亚历山大·恩比里科斯 (Alexander Embiricos)
OpenAI 旗下 Codex 的产品负责人,领导这款编程智能体的产品开发与战略。
- 职业轨迹:加入 OpenAI 前曾创业(对话中自述经历过“为避免输而战”的至暗时刻);更早之前在 Dropbox 工作,亲历 Slack 崛起对文档协作的冲击,这段经历塑造了他“工具即参与系统”的产品观。
- 当前定位:在 OpenAI 负责 Codex 产品线,直接参与 AGENTS.md 开放约定、Skills 标准与智能体沙箱安全等行业标准的推动;对外的鲜明标签是“为个人造工具、让自动化被人拉进来”的渐进路线。
▍关于 Codex
Codex 是 OpenAI 的编程智能体产品家族,覆盖 CLI、IDE 插件、云端任务与 2026 年 2 月发布的桌面应用。
- 演进路径:2025 年首发云端智能体(给智能体一台云电脑);2025 年 8 月随 GPT-5 转向交互式编程后进入高速增长,公开口径增长约 20 倍;2025 年 12 月 GPT-5.2-Codex 带来“委托式”工作方式的拐点。
- 2026 年 2 月的跃升:发布 Codex 应用并随 GPT-5.3-Codex 巩固模型能力,同期向免费与 ChatGPT Go 用户开放部分能力,并投放超级碗广告。
- 开放策略:核心 harness 开源,发起 AGENTS.md 指令文件约定(除 Claude Code 外主流智能体均已采用),推动 Skills 中性命名标准;模型同时通过 API 提供给包括竞争对手在内的所有客户。
开场:为赢而战,而不是怕输
Harry: 欢迎来到 20 Product,我是 Harry Stebbings。20 Product 是一档月度节目,我们邀请最顶尖的产品负责人,分享他们打造一流产品与产品团队的技巧、战术与策略。今天真正的问题是:谁会赢?是 Codex?是 Claude Code?还是 Cursor?
坐上今天热席的是亚历山大·恩比里科斯(Alexander Embiricos),OpenAI 旗下 Codex 的产品负责人。这是一场精彩绝伦的对话,请拿出笔记本。我也想听到你们的反馈,欢迎写信告诉我你的想法,邮箱 harry@20vc.com。
Harry: 你已到达目的地。Alex,我太期待这期了。我之前在一个 PE 大会上,满脑子想的都是:幸好下一场是 Alex,这期一定会很精彩。非常感谢你能来。
Alex: 我也特别激动,谢谢邀请。
Harry: 开场问题有点怪,但请顺着我来,你会慢慢习惯我的英式脑回路。我很着迷于人的动机:驱动你的更多是对失败的恐惧,还是赢的快感与兴奋?
Alex: 我是个极致主义者,绝对是“赢”的念头比“输”的恐惧更能驱动我。但我向你坦白一件事:加入 OpenAI 之前我创过业,创业期间最黑暗的时刻之一——黑暗时刻有很多——是我意识到自己过去几个月一直在努力“避免输掉”。那一瞬间我惊醒了:天呐,这就是我不快乐的原因,大概也是公司做不好的原因。所以时至今日,我还得时不时把自己扳回“赢”的轨道上。
但比赢更能驱动我的,是我就是喜欢造东西,喜欢为人们造东西。我对今年无比兴奋,因为很多还不存在的好东西会被造出来,送到许多人手上。
编程自动化:工程师会更多,不是更少
Harry: 直接进入正题。埃隆·马斯克(Elon Musk)说过,编程会是最先被大规模自动化的职业之一。以你的位置和日常所见,你同意吗?
Alex: LLM 确实最早在编程领域展现出真正的实力,这点我同意。但“编程被自动化”是个很重的说法。举个例子:我们不再手写汇编、转向高级语言的时候,我们说编程被自动化了吗?并没有。我们只是能写出多得多的代码,结果对代码的需求反而暴涨,需要更多软件工程师。当然,他们过去工作的一部分确实被自动化了。同样道理——你知道 computer 这个词的起源吗?
Harry: 不知道。
Alex: 我可能把地名念错,印象中是布莱切利园(Bletchley Park)。当年那里摆满了破译德国恩尼格玛密码机的机器,有一群专人负责打穿孔卡、把卡片塞进机器、做大量的列表计算。我的描述可能粗糙,但核心是那是一段极度人力的工作。
甚至最早的电子表格软件,灵感也大致来自这样一间办公室:桌子排成网格,人们各自做表,再把单子传给下一个人。这些具体任务后来都被自动化了,但每一次,对产出的需求都爆炸式增长,于是需要更多的人来做这类工作——哪怕具体任务已经变了样。
“computer”一词最初指“计算员”——二战期间布莱切利园(Bletchley Park,英国密码破译中心)雇用了大量人力执行手工计算与打孔卡操作。电子计算机兴起后,这个词从“人”变成了“机器”。Alex 引用这段历史是要说明:自动化消灭的是具体任务,而对产出的需求扩张会创造新的岗位类别——“软件工程师”就是当年不存在的新词。
Harry: 所以你认为五年后工程师会更多,而不是更少?
Alex: 是的。词汇的含义会变迁——computer 如今指代别的东西,而我们现在有“软件工程师”这个词。我坚信未来会有多得多的建造者(builder)。我现在还观察到一个有趣的现象:人才栈在压缩(compression of the talent stack)。
今天你还是需要软件工程师,还是需要设计师。那需不需要产品经理(PM)?我自己就是 PM,这事儿可以开很多好玩的玩笑——我认为不需要。而且如今说到“工程师”,你脑海里的人可能比以前全栈得多。几年前,很多团队还分后端工程师和前端工程师;现在至少 Codex 团队基本不这么分了,大家都全栈得多。所以我认为人才栈会压缩,但“建造的人”不会消失。
“我坚信未来会有多得多的建造者。” "And so I definitely think we'll have many more builders."
▍点拨:这是对“AI 消灭工程师”叙事的正面回击,逻辑链是杰文斯悖论式的:单位成本下降,需求总量扩张,总用工上升。值得注意的是他把“工程师”改口为“建造者”——岗位定义本身在变,这是判断人多人少时最容易被偷换的概念。
Harry: 你为什么觉得这个世界不需要 PM?你可是吊了个胡萝卜出来。
Alex: 这确实是我的保留玩笑。首先,PM 这个角色极难定义。我倾向于认为它的职责就是被刻意留白的——你的任务就是去适配团队或业务的一切需要。一帮人拼命赶工的时候,产品经理能做的是退后几步、看看拐角后面有什么、搞清楚该做什么,和市场进入(go-to-market)团队的同事们协作,再当团队的头号啦啦队长和质量担当。
但我刚描述的这些——大概也就是我现在的职责——一个很强的工程负责人,或者一个对产品很有思考的设计师,同样能做。所以有产品经理往往是有用的,但在团队真正变大之前,你大概率不想要太多。
AGI 的瓶颈:人的提示与验证速度
Harry: 过去几天我把你“人肉”了个遍——读你的文章、推文、过往访谈,非常有意思。你说过一句话:AGI 的关键瓶颈是人类的打字速度和验证工作,而不是模型、算力或架构。话说完就撂那儿了。帮我理解一下:为什么瓶颈是人类的打字速度和验证工作?你到底想表达什么?
Alex: 好问题。瓶颈其实有好几个,这个大概是最标题党的一个。容我用苏格拉底式的方法聊:你今天用了多少次 AI?
Harry: 三十多次吧。
Alex: 好。再设想一下:如果完全不消耗你的任何精力,你觉得 AI 一天能帮到你多少次?
Harry: 我觉得是方方面面——未来每件事都会有推理(inference)在跑,一天 24 小时不停。
Alex: 没错。现在 OpenAI 内部和外部的工程师都跟我说:我让 Codex 一直跑着,从来不合笔记本;开会时它要是没在干活,我就觉得在浪费时间,得保证 Codex 永远有活干。这很酷、很振奋,但管理这些智能体(agent)、确保它们一直在工作,本身就很耗人。回到“一天三十次”——我们看 Codex 用户的使用频率,也就是一天几十次的量级。而我认为,算力预算允许的话,AI 一天应该帮我们成千上万次。
我们会走到那一步,但眼下的问题是——拿我自己来说:我天天干这行,明知什么事都该用 AI,却懒得敲那么多提示词,也想不出 AI 还能在哪些地方帮到我,所以最后的用量和你差不多。甚至到现在,我用 AI 做了件漂亮事——比如为咱们的这次对话做准备——我还会暗暗得意:不错嘛,又解锁了一个新用法。对你我这种对这个话题特别上心的人来说,这没问题。
但我不认为我们应该指望大多数人:为了从 AGI 受益,还得这么费劲地研究“怎么用这工具”。它对他们来说应该毫不费力。我们想要的世界是:用 AI 不需要研究怎么写提示词,一切都顺理成章,你甚至不需要意识到“AI 能帮上忙”。
它了解你、连着你的上下文,会适时地搭把手。这方面我觉得 Claude 的包装做得好,比如 Claude for Legal、Claude for Excel——接进去就能帮你搭 DCF 模型(我自己不做财务模型),做得比人徒手好。
“AI 一天应该帮我们成千上万次——算力预算允许的话。” "And I think AI should be helping us tens of thousands of times per day, you know, compute budget permitting."
▍点拨:从一天几十次到几万次,差着三个数量级。Alex 认为填平鸿沟靠的不是更强的模型,而是消除“想到要用、写得出提示词、验证得了结果”这三道人力关卡。这把 AGI 瓶颈从实验室参数拉回了产品与人因工程,是整期最有锋芒的判断。
Harry: 所以你的工作就是把提示词和人的动作产品化,把这个瓶颈消除掉?
Alex: 完全正确。我们的职责是确保模型有惊人的能力,然后最终走向高度产品化的世界:一个魔法输入框、语音输入,或者把 AI 直接拉进你的群聊,它就开始帮忙。但中间有一个非常有意思的过渡阶段,而我认为当下最大的价值恰恰在那里。
我的意思是:你可以针对某个特定市场,把 AI 的某个特定能力产品化——很多公司在这么做——但很难预判到底什么会成立、什么形态才对。之前你的播客来过一位嘉宾,说过一句我觉得很有意思的话:没有 FDE(前置部署工程师,Forward Deployed Engineer),企业根本落不了 AI。
Harry: 对,是 Invisible AI 的马特·菲茨帕特里克(Matt Fitzpatrick)。
Alex: 对。虽然我自己就在招 FDE——如果你是 FDE,欢迎来我这儿应聘——但我完全不同意那个观点。我认为我们要做的是“为人造工具”。你可以像 Fitzpatrick 说的那样,用 FDE 去自动化工作流,但那样你就被两件事卡住了:你自上而下的视野能覆盖多少,以及你的 FDE 编制能铺开多少。
而最让我兴奋的 AI 未来,是让每个人都觉得自己成了超人、被 AI 赋能。要做到这一点,我们需要的是为个人用户造的工具,让人人都用得顺手。当下最有意思的阶段,就是为“愿意琢磨怎么用 AI 的人”造东西。
我们要交付的——这也是 Claude Code 刚发布时的天才之处——是一个在任何场景下都超好用的工具,就在你的终端里,人们自发地去试验能拿它干什么。所以当我们思考 AI 走出编程之外时,最重要的不是把它过度封装成“AI 能力,但只给金融用、只给某个工作流用”,而是造一个开放得多的工具,让人可以创造性地拿它做任何任务。
前置部署工程师(FDE,Forward Deployed Engineer)由 Palantir 开创:工程师进驻客户现场,把平台能力定制成客户可用的工作流。AI 时代这一模式被 Invisible 等公司复兴,用来解决“模型能力有了、企业流程接不上”的最后一公里问题。Alex 反对的不是 FDE 本身——他自己也在招——而是“只有 FDE 一条路”的自上而下落地观;他主张同时把工具直接交给终端用户,自下而上地长出熟练度。
Harry: 但这不就把责任和心力推回给用户了吗?恰好回到你说的那个瓶颈——人的动作、人的不作为。你不定义任务,就把定义任务的责任甩给了人,而人恰恰缺乏定义任务的能力或意愿。
Alex: 对,所以我说它是瓶颈。我心里有三个阶段。第一阶段,让智能体先把软件工程和编程这件事做到极致,因为 LLM 恰好擅长这个。
第二阶段,我们会意识到:智能体想要更通用,会操作电脑极其重要;而且还会发现,所有智能体本质上都是编程智能体,因为写代码是智能体操作电脑的最佳方式。那就把这个超级灵活的形态开放给所有乐于探索和折腾的人。这一幕已经在 Codex 应用上发生了:Codex 应用是为建造者造的,但我们看到建造者拿它干各种跟编程无关的事。
第三阶段,等看清楚什么管用,再做你说的那种产品化——高度具体的功能,开箱即用。而我认为接下来几个月,我们会把这一、二、三阶段整个速通一遍。
企业落地:FDE 之争与浏览器这条暗线
Harry: 关于 FDE 和企业落地,我的质疑是:数据安全、数据敏感性、权限管理、访问授权,这些事情难得要命。而且恕我直言,人们——尤其在大企业里——远比我们以为的更迟钝、更没信心。你真的需要一个 FDE 进场,把各种横向方案逐一定制改造才能跑通。我说错了吗?
Alex: 如果你想直接从零到一、直奔某种“终极工作流自动化系统”的宏大愿景(我说“宏大”不带贬义),那你是对的——你得闯过所有安全关、合规关,这些都是真问题,还要对接各种数据系统、记录系统(system of record)和执行系统。是,这种活需要 FDE。
但我看到的是:凡是自上而下推的,最后都严重浪费了 AI 能帮这家公司的潜力。两条路其实可以并行:你把 AI 直接交给真正干活的人,他们会开始建立“AI 能怎么帮我”的心智模型,进而主动把 AI 拉进自己的工作流。打个比方:
想象你做客服工作,公司要在你的岗位引入 AI,自动化掉你工作中相当重要的一部分,而你从来没听说过 ChatGPT,也不被允许用它。在那种处境里,你对这个东西毫无直觉。而在另一个世界:你的部分工作正被 LLM 自动化的同时,你自己也在用 ChatGPT 干活——你对这玩意儿的脾性有直觉得多。
可以说,面对“自动化在加速”这件事,你会觉得自己有掌控感,能在一定程度上引导自动化往哪儿建,而不是面对一个如机械降神般从天而降、让人无力招架的东西。所以回到正题:这事是做得成的——你提的数据管控问题都是真问题。
但说到底,每一个工具、每一个功能、每一个工作流,最终都服务于某个具体的人、某家公司的一名员工,而这个员工是通过浏览器或文件系统接触这些工具的。一切最终都会落到一个界面上,而一个跑在你电脑本地的智能体,就能跟这个界面打交道。
OpenAI 正在做一款浏览器 Atlas,你可能会问为什么。原因有很多,但我认为关键的一条是:把浏览器端到端地攥在自己手里,我们就能为企业做出“安全的智能体浏览”——让智能体触达那些 FDE 还没来得及接通的系统。
Alex 提到的 OpenAI 浏览器 Atlas 于 2025 年 10 月正式发布,主打智能体模式代用户操作网页。截至 2026 年初,浏览器已成为 AI 厂商的必争之地:Perplexity 推出 Comet,The Browser Company 的 Dia 主打 AI 原生,谷歌把 Gemini 深度植入 Chrome。Alex 把 Atlas 解释为“企业级安全智能体浏览”的载体,说明 OpenAI 看重的不是浏览量,而是把智能体送进那些没有 API 的企业内网系统的通道。
速度与推理:Cerebras 合作意味着什么
Harry: 我有一堆问题得问你,趁没断线先倒回去一个。你前面说工程师不合笔记本,因为不想损失跟 Codex 一起建造的时间。你们和 Cerebras 合作了——Cerebras 显然是市面上最快的推理供应商。坦率说,这是双赢。对用 Codex 的开发者、对 AI 编程的未来,速度到底有多重要?
Alex: 简单说:超级重要。
Harry: 那这算不算一种推理垄断?你们有,竞争对手没有。
Alex: 纯属个人观点:我不认为世界会走向垄断。竞争压力太大了,最后会有多个答案。另外我透露一句:关于这项合作,很快会有新消息公布,我非常期待这类东西上线,会很棒。
但即便如此,GPT-5.3 Codex 这个模型本身就比之前的模型效率高得多,我们收到的反馈是,大家已经觉得它的速度非常有竞争力了。模型层面能做的优化很多,推理侧也有空间:我们最近上线了一项改进,API 侧模型服务提速 40%,Codex 里提速 25%。总之速度极其重要,而我们是全角度在推进——硬件、推理方式、模型本身,都在抓。
对话中“很快会有新消息”的 Cerebras 合作随后如期落地:2026 年 1 月,OpenAI 与 Cerebras 宣布达成多年期算力合作,公开报道的规模逾百亿美元,由 Cerebras 的晶圆级芯片为 OpenAI 提供低延迟推理产能。Alex 关于“不会形成推理垄断”的判断也与市场走向一致:推理供给在 2026 年呈现多极化,英伟达 GPU、Cerebras、Groq、各家自研芯片与云厂商同场竞技。
Harry: 你前面提到把工具交到用户手里,咱又聊到推理。我的好朋友杰森·莱姆金(Jason Lemkin,SaaStr 创始人)有个观点:推理就是新的销售与市场。你不再养销售和营销团队,而是把钱花在推理上,让用户快速上手、立刻看到价值;销售和营销团队会就此消失。算是 PLG(产品驱动增长)的下一代形态。
Alex: 这个说法我有点难以苟同。在这个人人都能造东西、造东西越来越容易的新世界里,什么仍然难?我认为是跟客户搞好关系、真正知道他们要什么——这件事一如既往地难,甚至更难了,因为市面上可选择的东西更多了。还有造对的东西、做出极高的品质,这些也难。
回到销售与营销:我不认为它会消失。正如我说的,随着每个市场里的软件越来越多、竞争越来越激烈,这件事其实变得更难了。
委托时代:OpenAI 内部不再手写代码
Harry: 你们内部今天有多少代码是 Codex 写的?我记得 Boris(译者注:Boris Cherny,Claude Code 负责人)说过,他们那边几乎是百分之百。Codex 在你们内部用到什么程度?
Alex: 先说我自己和周围的人,再说团队。我认识的人基本都不再打开编辑器了。这是一个阶跃式的变化——过程是渐进的,但对外部市场来说,标志性节点是 GPT-5.2 Codex:模型突然之间能跑更久、端到端处理任务、管理自己的上下文、遵从指令。我们看到了这个拐点,这也是我们做 Codex 应用的部分原因。
在 GPT-5.2 Codex 之前,我们用来写代码的 AI 功能是 Tab 补全,或者跟模型结对编程——那种模式下,你人还是得守在笔记本前、手不离键盘,它出去干点小活,但你得在那儿盯着、掌舵,它只是替你处理小环节。
去年 12 月 GPT-5.2 Codex 发布前后,我们切换到了另一种方式:这个任务我整个委托(delegate)给它——先跟它一起定计划、确认我们都认可规格,然后放手让它去做。这是完全不同的工作方式,而且此刻还在变。
我们上周发布 Codex 应用,部分原因就是想要一种让“委托”而不是“结对”符合人体工学的形态——而且可以同时委托给多个智能体。所以在 OpenAI 内部,变化也是天翻地覆的。我给不了你百分比,但可以说绝大多数代码已经是 AI 写的;而且大多数人可能连 IDE 都不打开了。
就算打开,也是你想亲自把守某个界面——比如亲手打磨两个模块之间的接口,然后让 AI 把其余部分填上;或者你想跟它一起打磨计划,再让它落实。代码本身,人已经不再手写了。
Harry: 24 个月之后,IDE 还会是技术栈的一部分吗?
Alex: 看你怎么定义 IDE。正式定义是“集成开发环境”——这个词弹性大到什么都能往里装,没什么讨论价值。按那个口径,答案是有,你甚至可以说 Codex 应用就是个 IDE。
我不这么认为。在我脑子里,IDE 是一个强大的编辑器。我们特意没给 Codex 应用做编辑功能,就是为了让你一眼看明白它的用法:它有大量为管理多个智能体、委托任务、审查改动而设计的交互;它还突出支持 Skills(技能)——一个开放标准,特别适合干编程之外的活,比如分诊任务、盯部署。但它没有文本编辑。
Harry: 假设产出的代码很大比例都是 Codex 写的,那代码评审怎么做?内部评审也是 AI 负责吗?
Alex: 这里有几层。首先,规格和计划变得比以往任何时候都重要——从架构层面想清楚代码该怎么工作。我们最近上线了一个很显眼的计划模式(plan mode),玩法跟别人不太一样:智能体先跑开,提出一份相当长的实施方案,然后反过来问你同不同意它的做法、要不要插手。
这很像团队里来了个新工程师、还不熟代码库——开工前得先给全团队提一份 RFC(征求意见稿)。虽然这不是正式意义上的代码评审,但我认为“评审计划”正在变得越来越重要,因为我们正在进入与智能体协作的委托时代。这一点被低估了。
然后才是狭义的代码评审。我常听到大家——尤其是开源世界——抱怨大量“AI 泔水”(AI slop):有人往开源仓库乱提 PR,质量一塌糊涂,提交的人可能自己都没测过、更没评审过代码。这确实是个问题。
Codex 社区的通行做法是让 Codex 评审自己的 PR 或改动,它在这方面强得惊人——我们专门训练过它做代码评审,包括把反馈打磨得信号量极高:误报极少,所以它有意见时你真能信。
我们不仅鼓励团队和外部用户“让 Codex 评审一下”,还可以配置成自动评审——现在 OpenAI 内部几乎所有代码,只要推进 git 仓库,就会被 Codex 自动评审。还有个好玩的事,留给还没用过或者最近没用过 Codex 的人:很多人见识我们模型实力的方式,是让 Codex 去评审别的模型写的代码。评审完他们基本就一个反应:靠,我是不是干脆直接用 Codex 写代码得了。
“代码不再由人写”的乐观叙事背后,有一笔被低估的隐形负债:验证债务。当 Codex 同时承担写代码和审代码,评审者与作者同源,系统性盲区会被自我确认而非被发现——这与审计独立性原则相冲突。AI 泔水淹向开源仓库只是前奏,真正的考验是:当无人再逐行读过生产代码,谁来为罕见但致命的故障负责?Alex 自己也承认“确认我们在做对的事”这类瓶颈投入不足,这恰恰是乐观故事里最贵的部分。
留存之战:开放标准与竞争格局
Harry: 你刚才那句很有意思——“还没试过的人、或者想回来看看的人”。你怎么看这个品类的留存(retention)?我记得 YC 合伙人汤姆·布洛姆菲尔德(Tom Blomfield)几个月前发过一条推文,具体说的是 Cursor、Claude Code 还是 Codex 我记不清了,但那个观点一直粘在我这颗奇怪的脑子里:在不同供应商之间切换,实在太容易了。用户到底有多粘?你怎么看留存?
Alex: 我们在 Codex 上走了一条反直觉的路:把它做得极其开放。Codex 的核心 harness(智能体运行框架)是开源的,而且我们一直在让别人更容易切换。
比如去年 Codex 刚发布时,我们确立了——“确立”这个词都太重了——其实只是约定俗成地推了一个叫 AGENTS.md 的约定:一个放智能体指令的文件。我们没有叫它 codex.md,就是希望所有智能体都能用。现在除了 Claude Code,几乎每家智能体都在用 AGENTS.md,这很棒。
就在上周,我们还推动把 Skills(给智能体的指令和脚本的标准)放进一个叫 agents 的中性命名文件夹,而不是叫 codex 之类。结果又是——除了那个“惯犯”——所有人都跟进了。给开发者充分的选择权,我认为是大好事;我们还想让人尝试不同东西变得更容易。
不过话说回来,编程任务有个特点:相当封闭自足。打个比方,它像电视剧的“单元剧”——你进来,有一份任何智能体都能读的 AGENTS.md,有一套任何智能体都能用的 Skills,你让智能体写段代码,它产出一个补丁,补丁进 Git。两头都是厂商中立的,所以现在切换起来非常容易。
但随着智能体开始干写代码之外的活——更通用的工作,先是服务软件工程师,再扩展到所有建造者——它们就得开始对接其他系统。当你的智能体开始跟 Sentry 对话、跟你的 Google Docs 对话,我认为粘性就来了:因为“把智能体接上这个系统”本身就是个有粘性的决定。
企业如果信任一个智能体访问这些工具,就需要真正可靠的安全护栏、沙箱和管控——你不会想把这套东西配第二遍。我们在做 Codex 时就知道这一天会来,所以我们的沙箱方案是业内最保守的——沙箱(sandboxing)就是在操作系统层面对智能体能做什么的一套管控。
我很推崇《七种力量》(7 Powers)这本书,写得精彩,讲的是企业积累价值与持续性的七种方式——用户粘性与留存,正是其中一种力量。
Harry: 假如我们跟 Codex 是一个战壕的,怎么设计出能留人的行为模式、机制、玩法,让人留在 Codex,而不是一有更强的模型就跳去 Cursor 或 Claude Code?
Alex: 这问题有意思。一方面我们当然在经营一门生意,会想这些。但我们的使命是安全地把 AGI 的益处带给全人类。所以 Codex 团队有些事,外人很难理解——
Harry: Alex,打住。使命我懂,但你的工作是 Codex 的成功。
Alex: 我明白。我们的工作是分发智能(distribution of intelligence)。我们在全力打造 Codex,但有一件事很多听众很难理解:我们投入巨大精力训练这些模型,然后把这些模型卖给我们的竞争对手。
“我们的工作是分发智能。” "Our job is the distribution of intelligence."
▍点拨:Harry 用商业逻辑追问“你的 KPI 是 Codex 赢”,Alex 把回答拔高到“分发智能”。这不是公关辞令——OpenAI 真的把模型卖给竞争对手。它揭示了一种奇特的竞争姿态:在模型层做全行业的军火商,在产品层才下场争胜。理解了这句,才能理解 Codex 为什么敢把 harness 开源、力推 AGENTS.md——标准化越彻底,模型层的军火生意越好做。
Harry: 站在我们的角度——作为风险投资人,这实在太难理解了。你知道这一点的吧。
Alex: 完全知道。这就是 OpenAI 作为一个工作场所极其有趣、极其不寻常的地方。我们下的棋非常长:竞争对手变强,我们就学习,这对我们反而是好事。所以我们一边拼命做大 Codex——
Harry: 你们能学习,是因为对手是开放的?要是他们闭源进步了,你们不就没得学了?
Alex: 我不这么看。就说最近的一堆发布吧——今天早上我还转推了 Warp 的一个新发布,跟他们没有任何关联,但他们把“智能体云端干活和本地干活同时进行”这件事的框架搭得很妙,对我就是启发。各家公司的这些发布我都看。
这个领域最酷的一点是:大家其实殊途同归,不可避免地收敛到同样的结论,然后各自把它建出来。而在 Codex 团队,我们手里有几张巨大的王牌:ChatGPT 带来的巨大分发优势;自己训练模型、让模型在我们的 harness 里表现出色、又让 harness 为新模型量身优化的能力优势——而且别人拿不到这些模型的早期访问权。
所以我们是在争胜的,优势很大;但同时也在下长棋——把模型提供给所有人,推动开放标准,让我们推的东西人人都能用。
用芒格的生态系统与激励机制框架看 Codex 的开放策略:表面上是放弃锁定——harness 开源、AGENTS.md 中立、Skills 中性目录——实质上是在争夺标准制定者位置,这是《七种力量》里流程能力与网络效应的混合护城河。巴菲特会问:转换成本在哪里?Alex 自己给出了答案:现在的编程任务是“单元剧”,两头厂商中立、切换免费,真正的粘性要等智能体接通 Sentry、文档这类企业系统后才产生。OpenAI 的算盘是趁标准期圈下最大用户基数,等粘性时代到来时完成收割——典型的“先规模、后锁定”的耐心资本打法。
Harry: 那我能问问:决胜的决定性因素是什么?我知道我在用风投的语言,而你格局更高、更开放自由,但我还是要追一句:到底是市场进入(GTM)——毕竟全世界最大的企业都想跟 OpenAI 合作,我在你们销售团队有不少朋友,你们从大品牌拿到的主动上门需求多得惊人——是靠无敌品牌的市场进入,还是靠产品执行力、靠 Codex 本身是个炸裂的好产品,还是靠算力、推理速度,靠真实的算力优势?哪一个才是决胜手?
Alex: 好,如果从 OpenAI 的公司层面讲——这显然远超我的职级——我会说是算力优势和拥有最好的模型。而要实现这一点,我们又需要建起能创造收入的生意。还有个很有意思的发现:Codex 团队是研究和产品合在一起编制的,所以做出成功的产品本身,就会反过来制造压力,逼模型更快改进。这是公司视角。
切换到产品视角,我认为最重要的一件事,是做出人们真正想用的好产品。就像我前面说的,我们坚持为个人造产品,让人先把产品用熟,再把自动化拉进来。这可能反直觉,但我相信它比纯粹从企业工作流切入的路线,带来的影响力大得多。这本质上是个产品执行力的问题。
产品路线跑通了专业消费者(prosumer)市场,轮到企业市场时,市场进入这一侧就非常关键了。我交过学费的一课是:如果我们走进一家企业只是说“嗨,我们来了,东西随便用”,是行不通的。其中有大量教育工作要做,还有大量配置要支持,还要帮整个团队建立认知。所以企业的打法更像是:进场、宣讲、见到开发者体验负责人之类的角色、搞清楚他们希望团队怎么运转,然后给他们工具,把那套运转方式推广到全团队。
北极星指标与界面的未来
Harry: 刚才你说到“收入”这个词——收入是衡量生意的指标之一。那你的成功指标是什么?当你跟萨姆·奥尔特曼(Sam Altman)、Brad(译者注:Brad Lightcap,OpenAI 首席运营官)或随便哪位坐下来汇报“我们在为什么优化”时,你用的北极星指标是什么?
Alex: 首要指标其实不是收入,是活跃用户。
Harry: 怎么定义活跃?日活?
Alex: 我们看周活跃用户(WAU)——这个人有没有真的在产品里走了一轮,比如发出过一个提示词。
Harry: 周活够高频吗?听着不错,但如果这东西真要取代 IDE,日活不是更合适?
Alex: 日活很快就会更合适,我们只是沿用周活这个内部惯例。起步阶段它够用,但我接受这个批评——可能确实该切日活。
我们要走向的世界是:遇到任何任务,你的第一反应是“找智能体帮忙”。想想谷歌搜索:任何事,进这个输入框,就能被带到对的地方;然后是 ChatGPT:任何信息,进这个输入框敲出来,就能拿到答案。
我认为今年我们会看到下一阶段:任何要做的“事”——不只是查信息——我都到这个输入框来,然后有事情发生、有忙被帮到,哪怕不是整个任务、哪怕只是一小部分。
“任何要做的事——不只是查信息——我都到这个输入框来,然后有事情发生、有忙被帮到,哪怕只是一小部分。” "...for any task I need to do as opposed to just get information, I go to this text box or this input and something happens that helps me, even if it's not the full task, even if it's only a small part of it."
▍点拨:这是从信息入口到任务入口的范式声明:谷歌解决“找到地方”,ChatGPT 解决“得到答案”,下一个输入框要解决“办成事情”。“哪怕只完成一小部分”这个退而求其次的表述很关键——它把“智能体没用”的反驳化解为“帮一点也是复利”,也解释了为什么日活会比周活更诚实。
Harry: 你又说到聊天界面——抱歉我思维跳脱,我妈陪我在伦敦散步都得迁就我这套躁狂式、单元剧式的脑回路。我对聊天界面很着迷,因为它对忙碌的人类来说是个看似极高效的输入方式。但我前几天跟 a16z(Andreessen Horowitz)的 GP 阿尼什·阿查里亚(Anish Acharya)聊完,他说:不不不,聊天框是奥尔特曼和马斯克造出来的东西,只对高效人士好使;地球上大多数人要的是基于浏览器的发现、交互和 UI。你觉得聊天会是下一波 AI 与人交互的持久界面吗?
Alex: 简单回答是:会。但其实有两个组成部分。
想象未来——随便找部科幻片:AI 长什么样?我相信科幻是未来的好预言家,而且它通常很简单,因为那是故事,而简单往往是对的。未来大概就是:一个存在,我想怎么跟它说话就怎么说话,想聊什么聊什么。我不该还得先“导航”到某个地方才能跟编程 AI 协作,再换另一个地方找销售 AI,还得先声明“我现在要跟销售的那个说话了”。就是跟一个东西说话,它就来帮忙。
所以我认为,聊天或语音——对话式界面——会是一切的支柱:你可以跟它聊任何事,可以把它拉进任何群聊,让它自己发现怎么帮你。但如果你是某个领域的重度玩家,你大概不想被“传话”隔着——好比你有个行政助理,但你们只能通过说话协作,那也太烦了。到某个节点,你会想直接打开纪要自己看、自己改。
所以我认为会是“聊天+按需定制的图形界面”的组合。拿我自己说:播客准备我可能就靠聊天完成;但真要看产品、看代码,我会打开 Codex 应用钻进去。换作一个营销人员,他可能就靠聊天问产品问题——他才不会为了问问题专门下载 Codex 应用——但他可能有一个专门看广告数据分析的定制 GUI。
Harry: 完全理解。不过我刚才的设想里其实偷偷假设了终端消费者会出现在链路里。我想问的是:你怎么看智能体对智能体(agent-to-agent)的体验、为智能体设计体验?比如我们聊进大企业——举个最无聊的例子:费用报销审批。我的智能体替我为旧金山之行提交报销单,OpenAI 合规部门的智能体在另一侧做审批。你怎么看这种范式转移?
Alex: 有意思。说实话,我也不确定那会长什么样。我最快的回答是:我们在做 Codex 时发现,对智能体最友好的界面,往往也是对人类最友好的界面。
有人问“怎么让代码库对智能体更高效”,答案常常是:你自己看过吗?对人好用吗?举个具体的例子:跑测试。大多数测试运行器默认把全部输出一股脑吐出来——作为人,你得翻成百上千行才能找到挂掉的那一个,烦死了。结果证明这对 AI 同样糟糕。把它过滤成只输出失败的测试:对人更好,对智能体也更好。
所以智能体之间的交互点,大概率会和“有人类在环”时高度相似。这是好事——意味着你可以一个系统一个系统地逐个替换。
数据护城河与消费级下探
Harry: 我在 LinkedIn 上预告这期节目,有位来自另一家公司的优秀投资人——就像《哈利·波特》里的伏地魔,“那个不能提名字的人”,我可不想让奥尔特曼灭了我——你去问他:你怎么看编程数据护城河?Anthropic 是不是已经把所有数据都拿到手了?
Alex: 就我们看到的情况而言——这方面我会让研究团队说了算——我们觉得数据足够做出非常好的编程模型。
我反而觉得现在更有意思的数据在别处:进入知识工作任务之后,那种数据互联网上基本不存在。于是你会开始有些很有意思的头脑风暴:怎么让模型擅长这些事?也许得付钱请人模拟做任务,为模型采集轨迹;也许该去收购那些已经不做业务了、但手握大量数据的公司——比如像 Slack 那样的。我认为,知识工作这类任务分布,比编程难得多了。
Harry: 你说到“不存在的数据”特别有意思。那你怎么看跟数据供应商的关系——Mercor、Turing、Invisible 这些?你们会在上面砸十倍的钱,还是会说“数据花得太多了,我们自建、自己采”?
Alex: 我们的思路只有一个:怎么最快就怎么来。把这套能力建到内部,时间成本极高,而我们团队很小。所以到目前为止我的观察是:凡是需要大规模跑的数据采集行动,我们通常会请这些公司中的一家来帮忙。
Alex 点名的 Mercor、Turing 与 Invisible 代表 AI 数据供应链的三种形态:Mercor 以专家网络起家,为模型提供人类反馈与领域知识标注;Turing 从 IT 外包转型为数据与模型评估服务商;Invisible 把“流程拆解加人机协作”打包成企业 AI 落地服务。当互联网公开文本被吃得差不多,知识工作轨迹数据成为新的稀缺资源,这类公司由此成了模型厂商的关键外脑。
Harry: 消费侧呢?我们聊了企业侧、开发者体验和开发者关系。一两年之后,你会在低端消费市场上跟 Lovable、Replit 竞争吗?还是说这生意你不碰——Codex 不是给普通人做“关于我”主页、给小企业自建官网的?你怎么看消费级?
Alex: 目前我感觉谈不上直接竞争。不知道你看没看我们的超级碗广告,广告语就一句:You can just build things(你只管动手造)。通过 Codex 应用我们发现,很多技术背景不深的人也开始造东西了,造的都是很“Hello World”的小玩意儿。
所以我认为在使用场景上会出现一些重叠:人们会直接打开 Codex——反正它就在自己的 ChatGPT 里。上周还有一个大消息:我们开始向免费版 ChatGPT 以及 ChatGPT Go 套餐的用户也开放一部分 Codex 能力。这对“让所有人都用得上”是巨大的一步。
所以一定会出现这样的情况:拿着免费 ChatGPT 套餐的人进来,随手造点简单的东西——换作以前,他们可能会去找某个专门的工具。
复盘:20 倍增长、SOTA 与市场终局
Harry: 有没有什么你特别想换种做法、但因为种种原因做不了的?
Alex: 我感觉这几周我们顺风顺水的。眼下发生的一切,我都挺兴奋的。
Harry: 嗯。这就有意思了。你说“这几周顺风顺水”,我也有同感。团队能感到风向的变化吗——无论是上行周期还是下行周期?
Alex: 绝对能,我们对这个极其敏感。回看 Codex 的历史:去年我们发的第一版是个让人们兴奋不已的构想——给智能体一台云端的专属电脑,想要多少有多少,并行替你干活。想法很棒,但说实话,实际效果不如我们后来发的东西。
随后从 8 月的 GPT-5 开始,我们在交互式编程上猛冲——那是市场上竞争的主战场——我们一路狂飙。公开口径的数字是:8 月以来增长了约 20 倍;到年底,从 12 月到现在又翻了一倍,具体数字我记不准了。那段时间算是贴身肉搏。
而上周我们感受到的变化是:GPT-5.3 Codex 让我们确信自己手握最聪明的模型。之前用户反馈我们的模型偏慢、协作起来不够有乐趣、干活时不善沟通,我们都一一解决了——哪怕跟那个比我们早发布 20 分钟的竞品模型比也是如此。说得损一点:对方也就当了 20 分钟的 SOTA(state of the art,最先进水平)。
另外,Codex 用户体验的反馈一直很多:我们最受欢迎的形态是 IDE 插件,而 CLI(命令行界面)打磨得不够。但应用一发布,市场反馈异口同声:体验质量真的高——简单,一种反直觉的简单,大家就是喜欢。连我们最尖刻的批评者都被转化了。再叠加超级碗广告、叠加免费开放。
所以回到你的问题“最想换种做法的事”,我有两个答案。第一,我想杀回云端。去年我们从云端智能体转向交互式编程时,逻辑很简单——其实就是我前面讲 FDE 的那套道理:在你的终端用户还没用熟工具、还没法顺手使唤它之前,就超前跳到工作流自动化,中间是断层的——那只是个空中楼阁式的构想,除了最顶端的重度玩家谁也用不起来。
但一旦有了这样的基本盘:用户每天都用你的工具、调教它,每用一次它就更好——这时再跨到“让它在云端独立运行”,台阶就小得多了。所以我认为是时候重新把云端产品做起来,并跟本地产品做到丝滑的一体化——现在已经有一部分打通了。
第二件事,是我要更多地盯瓶颈。代码生成本身,现在基本已经不叫事了;难的是你前面提到的代码评审那类问题:怎么确认代码质量是好的?怎么确认我们在做对的事?我认为这些瓶颈至今仍被低估、投入不足。
我们要走向的世界是:你有一个不被卡脖子的智能体,你信任它能完全拥有一个微系统或内部工具,能跑完整个迭代闭环——包括吸收用户反馈——全程不需要人工评审。这是个真正难解的问题,既是智能层面的,也是安全与管控层面的。
Alex 给出的增长口径——8 月以来约 20 倍、12 月至今再翻倍——与外部观察一致:2025 年下半年 Codex 在交互式编程上对 Claude Code 发起贴身追赶,2026 年 2 月应用发布并叠加免费开放后,官方披露的用户数据延续了这条陡峭曲线。“对方只当了 20 分钟 SOTA”也有出处:GPT-5.3-Codex 与 Anthropic 的同期旗舰编程模型同日发布,双方基准互有胜负,“当日反超”成了那轮发布大战的经典桥段。
Harry: 我们该给基准测试和评测(benchmarks & evals)多大权重?
Alex: 这答案可能让你不爽:给一些。在我看来,它们确实能较好度量智能,所以在“智能”这个维度上你可以给权重——尤其在评测还没饱和之前,基准上的显著进步非常有参考价值。
但你必须把它跟“用起来什么感觉”搭配着看,而感觉这东西很玄学(vibes)。不管内部讨论还是跟模型客户聊,我总会惊讶于“跟模型协作的感觉”这件事,大家的评价有多凭感觉。
生活本身就多凭感觉啊。我常跟年轻人讲一个道理:人愿意跟自己喜欢的人共事——同样,人也愿意跟自己喜欢的模型共事。
“我常跟年轻人讲:人愿意跟自己喜欢的人共事。同样,人也愿意跟自己喜欢的模型共事。” "People want to work with people they like is the lesson that I give to kids. People want to work with models they like."
▍点拨:在基准分数之外,Alex 给了手感(vibes)一个正式位置。这句话看似轻巧,实则点破了编程智能体竞争的一个真相:当能力进入同一量级,选择就滑向体验与“性格”——响应速度、沟通方式、犯错时的姿态。模型也有雇主品牌,这是参数表永远抓不住的留存变量。
Harry: 说说市场格局。作为投资人,我得推演这个市场的终局。你怎么看?是 Uber 对 Lyft——绝大部分市场归 Codex 或 Claude Code 一家?还是 AWS、Azure、谷歌云式的三分天下、各占三分之一?
Alex: 我认为长期来看,最终可能是少数几家吃掉绝大部分价值。原因如下——这话可能有点冲:我认为我们正处在一个临时阶段,智能体恰好很擅长编程。回头看去年,也许更多人以为智能体当时在别的领域也能做得很好,但并没有发生。
所以整个行业目前跑通 PMF(产品市场契合)的只有编程智能体,外加客服等极少数狭窄场景。但我认为这只是暂时的。随着时间推移,我们会拥有什么都能干的智能体——就是我前面说的“超级助手”:你跟它聊什么都行,只有当你恰好深耕某个职能时,才会打开那个专门的界面。
在那个世界里,你不会想要公司里有 12 个智能体、员工还得自己研究该找哪个说话——那样他们永远形不成肌肉记忆式的熟练度;不熟练,就不会把自动化拉进自己的岗位。而如果有一个东西你可以跟它聊任何事,入职引导就一句话:“有事找它聊。”人们会形成条件反射,它会变成工作的引力中心(center of gravity),人们会主动把自动化往里拉。所以我认为那个未来合理得多。而作为 ChatGPT 的建造者,我们的位置得天独厚。
再打个可能有点牵强的比方:我以前在 Dropbox 工作,那是 Slack 崛起之前,我们一度纠结:用户到底该在 Dropbox 里给文档写评论,还是去 Slack 里聊这份文档?在 Dropbox 里评论明明更优——比如在视频的正确时间戳上留评、在文档对应位置留评。
但我们看到的是:Slack 就是人们聊天的引力中心,没人想在文档上评论,我就想 Slack 你。哪怕效率更低,事情还是不可阻挡地涌向 Slack。职场上我认为也会如此:如果有一个几乎什么都能用的智能体,它就会产生巨大的引力——人人都在交流自己怎么用它,团队之间分享最佳实践,黑客松都围绕怎么把它用到极致来办。最后剩下的,就是这么寥寥几个。
SaaS 末日论与投资地图
Harry: 你刚才说,除了编程和客服这类,智能体的应用还没真正铺开。我的问题是:我今天是个投资人,想找的是价值能随时间沉淀、又能给客户提供极好产品的公司。现在市场上有一种信念:今天大型 SaaS 公司的收入持久性是零,SaaS 已死——因为你们这些模型厂商,OpenAI、Anthropic 们,要来抢我们的午餐了。你给我什么建议?
Alex: 东西终究是为人造的,不然意义何在?SaaS 工具也是为人造的。所以我的问题是:这家 SaaS 公司是否握有与另一端那个“人”的关系?握有的话,我猜它不会消失。它是否握有某个真正重要的记录系统?握有的话,大概率也不会消失。
甚至可以说,这两样东西——与人的交互、记录系统——比以往任何时候都更值钱。反过来,如果这家 SaaS 公司只是一层“胶水”,两样都不占?我不是这方面的专家,但我会替这类公司捏把汗。
Alex 对 SaaS 末日论的回应,本质上是一套巴菲特式护城河盘点:客户关系对应品牌与心智份额,记录系统对应高昂的转换成本——两者占其一,公司大概率活得下来;两样都不占的胶水层,正是芒格所说没有护城河、只靠差价活着的生意,在 AI 压薄开发成本的时代最先被挤出。这个二分法对投资实操很友好:判断一家 SaaS 公司,先问它握的是“人”还是“账”,两样都没有,就别听增长故事。
Harry: 按这个逻辑,Salesforce、ServiceNow 跌了百分之二三十四十,怎么讲?
Alex: 我认为被严重夸大了。确实有些公司该跌——说句客气话,Dropbox 的处境就非常难。但你看 Monday.com 这类公司:他们的大头市场是中小企业和个人用户,这些人能不能用氛围编程(vibe coding)搓一个待办清单出来?能。划算吗?等你定制完、打磨完,其实并不划算。
而且说实话,待办清单这玩意儿本来就很平淡:加任务、完成任务、看历史任务、分配给新成员,没什么难度。所以人们会直接续费接着用。我认为恐慌被严重放大了,这是市场典型的膝跳反应。
Harry 提到的 SaaS 抛售确有其事:2026 年初 SaaS 末日论发酵,Salesforce、ServiceNow 等大盘股自高点回撤两到四成,市场担忧模型厂商会吞噬应用软件层。从后续几个财报季看,Alex“被严重夸大”的判断方向基本成立:头部 SaaS 公司的续费率与净留存并未如末日论预言的那样崩塌;真正持续承压的恰是他点名的那类——不握客户关系、也不握记录系统的中间层工具。Dropbox 的转型则仍在拉锯中。
Harry: 我倒是认为你们会来抢客服这块——我可不想待在那个品类里。
Alex: 我认为这会改变你该投什么样的创始人。作为一个做产品的人,我个人很喜欢之前那个阶段:你可以只投“能把产品做好”的人,完全不用管他有没有客户洞察、市场打法或分发的章法——因为把产品做好曾经太难了。
但我认为那是异常态。看现在:也许那种创始人不再是你该投的人了,因为把产品做好相对容易了,你得回到投那种把分发想透了、对特定客户有深厚领域认知的创始人。
Harry: 再问一次:如果你加入我的团队做投资人,你会怎么看值得投的方向——那些能沉淀价值、又不会被模型厂商威胁的公司?毕竟你们进医疗、进编程(Codex 再明白不过)、进客服——你们不去哪儿?Claude Code 不去哪儿?
Alex: 我很想直接说“我不知道”。现在做投资确实难,市场太动态,说不清。
Harry: 现在做投资是真的难。
Alex: 我的答案其实有两条:第一,找有实体基础设施的东西——你们不会去做能源供给,OpenAI 也不会。第二,金融科技和银行对接——那些盘根错节的金融产品。我不认为 OpenAI 会去东南亚跟 500 家银行一家家建关系。
人才战、完美契合与给学生的建议
Harry: 我基本同意。归根到底就是:你是否在一个错综复杂的市场里,客户关系和市场认知就是一切——这种生意依然很好。再聊聊人才战有多惨烈?从英国看旧金山,我跟被投公司都说:在欧洲建团队吧,湾区根本招不到人、也留不住人。我说错了吗?
Alex: 人才战现在惨烈到极点。OpenAI 的品牌当然极强,能吸引大量人才,但即便如此,遇到真正想要的候选人,我们还是要花大力气去“关单”——连我们都不敢说要谁有谁。
Harry: 问一句:以现在的入股价格,股权对最顶尖的人才有吸引力吗?
Alex: 至少没人跟我说过相反的话。
Harry: 你在多大程度上追求“完美契合”,而不是“够用就行”?
Alex: 前面我开玩笑说 PM 可有可无——其实不对。你还是需要产品人,但他们必须是完美契合;不契合的人进来,可能弊大于利。这意味着我们的挑剔程度,远高于我在其他岗位上的时候。
Harry: 假设我是个计算机系学生,在斯坦福、帝国理工、剑桥、苏黎世联邦理工,随便哪所名校。以你今天知道的一切,你会给我什么建议,帮我走好职业生涯的下一个五年?我想在明年进入职场时,成为对 AI 生态有价值的工程师。
Alex: 从根本上说,当工程师从未像现在这么好过:你手里的工具强大到能完成惊人的工作量;加入一家新公司、接手一个复杂代码库时,上手速度也从未这么快——你可以就代码库问 AI 无数个问题,让它把原本要研究好几天的改动方案规划出来。所以首先,我非常建议保持乐观——这是你入职后的能力面。
另一个问题是怎么拿到这份工作。正因为造东西从未这么容易,稀缺的东西变成了:能动性(agency)、品味和质量。我强烈建议你就是动手造东西,用作品展示你的能动性和品味,造出高质量的东西,然后分享出来。
我们收到很多求职投递,有走官网的,也有社交平台上找来的。只说我个人的偏好:有人带着有意思的想法、附上一个有意思的项目链接写给我,这比一份标准简历抓我眼球得多。
Dropbox 的一课与利润率之问
Harry: 快问快答前最后几个问题。你前面提到 Dropbox——Dropbox 的校友圈太厉害了,走出来的人才密度惊人。你在 Dropbox 学到的、至今塑造你在 OpenAI 思考方式的最大一课是什么?
Alex: 这题我不用想。就是我前面跟你讲的那个:为终端用户造工具时,你必须把工具当成一个“参与系统”(system of engagement)来设计。如果人们不想用你的工具,如果它不是完成一件事最自然顺手的路径,人们就是不会用。这一课我是看着 Slack 一飞冲天时学到的。
所以现在我们造智能体时,我反复掂量这一点:如果把智能体纯粹做成“工作流自动化”,那推起来永远像拔牙——你得请埃森哲进场、派 FDE 部署,举步维艰。
但如果你造出一个人们就是爱用的系统——哪怕他们一开始只用它完成部分任务——他们会越用越熟,你会随时间接通各种工具,然后一级一级把自动化加进去。当然,这两条路并不互斥。
记录系统(system of record)与参与系统(system of engagement)是企业软件的一对经典分类:前者是数据最终的权威存放处,如 Salesforce 之于客户数据;后者是人日常实际花时间的界面,如 Slack 之于沟通。Alex 从 Dropbox 学到的一课是:参与系统对记录系统有引力——哪怕在记录系统里评论更高效,人还是会涌向自己天天打开的那个工具。智能体时代,谁能成为工作的参与系统,谁就有资格向记录系统收租。
Harry: 那搁今天,你到底要怎么让 Dropbox 重振增长?
Alex: 至少我在 Dropbox 那会儿,我们的独门绝技是桌面软件。桌面软件这东西很妙——它其实从来没过时过,但总之,现在它彻底回来了。因为如果你要解的是生产力和知识工作的问题:是的,到处都是要对接的记录系统,但一切最终都发生在用户的电脑上——要么在浏览器里,要么在本地的应用里。
我确实认为,智能体在职场的生产力红利,最快的路径是先在用户的电脑上接住他们、用他们手边现成的东西开干——不需要先派 FDE 去搭什么——然后再随时间接通各个系统。
所以假如我是 Dropbox,我会想:怎么把我们在“做极好的桌面软件、在你电脑之上做协作层”这件事上的独门积累,拿来为生产力智能体赋能?这个方向有点宽,但我认为切入点就在这里。
Harry: 好,我喜欢这个答案,谢谢你认真回应。快问快答前最后一题,说话算话。我成长于一个“利润率至上”的世界:软件的高利润率美妙绝伦,这正是软件成为绝佳投资品类的原因。而我们现在看到的,是推理密集型生意完全不同的利润率结构。我该在多大程度上把这放下,相信成本会降、token 价格会降,关键是使用量和用户热爱、利润率会随后到来?还是说利润率真的至关重要,必须死盯?
Alex: 我认为两件事同时成立:成本会显著下降;而且如果今年是智能体在职场大规模铺开之年,那也必然是它们被接通到各个系统之年——而接通是有粘性的。所以我把今年看作一场卡位赛。你要赢下这场比赛,为此在利润率上暂时吃点亏,我认为可以接受。
“先烧推理抢粘性、利润率以后再说”是本轮 AI 叙事里最流行、也最危险的逻辑之一。反向的问题是:如果 token 成本下降的速度赶不上用量爆炸的速度,或者竞争对手用同样的亏损补贴跟进,卡位赛就会变成多方共输的消耗战——历史上打赢补贴大战的公司,赢的都不是补贴本身,而是补贴期结束前就建成的结构性优势。Alex 把赌注押在“接通系统产生粘性”上,这个赌注成立的前提是接通速度足够快;对企业客户决策链冗长的现实而言,这个前提并不便宜。
快问快答:改过的主意、敬重的对手与十年愿景
Harry: 好,快问快答:我说一句短陈述,你给我第一反应。过去 12 个月,你在哪件事上改主意改得最多?
Alex: 加入 OpenAI 的时候——那比 12 个月稍早一点——我以为一年之内,我们所有人都会对着电脑屏幕共享画面跟智能体闲聊。完全错了。多模态模型的进展比我预期慢——多模态就是能处理视频和音频的模型。
实际发生的反而是:通过代码来操作电脑的智能体成了正道。对我来说,这是一次彻底的认知重构——把 AI 的益处带给普通人的路径,主要不在视频和音频。
Harry: 你最敬重哪家不太知名的竞争对手?为什么?
Alex: 第一个想到的是 Amp——Sourcegraph 团队做的。他们的产品口碑极好,出了名的“小个子打出重量级拳”。
但我同样敬重的是另一件事:他们参与发起了围绕 AGENTS.md 和 agents/skills 目录的整个标准化运动——就是我前面说的、让用户更容易同时管理多个智能体的那套东西。AGENTS.md 是我们放的,他们放的是 agent.md(单数)。而最早是 Quinn(译者注:Quinn Slack,Sourcegraph CEO)一条推文点燃的整件事:“你们把 agents.md 这个域名买下来,我们就统一用你们的拼写。”
事虽小,却启动了整个标准化进程,我认为它对社区意义重大。
Harry: 你觉得外界对 Anthropic 广告的回应,得体吗?
Alex: 回应有很多种。我听到的那个——当然我觉得对的那个——是这么说的:一家公司对未来的叙事相当消极,而另一家公司,也就是我们 OpenAI,非常积极,就是告诉人们“你可以动手创造,也可以大胆梦想”。我觉得这个回应漂亮极了。
Harry: 你在 Codex 做过的最艰难的产品决策是什么?
Alex: 我可以告诉你最“痛”的那个。有段时间 Codex Cloud 实际上是不限量的——不是免费,你得订阅 ChatGPT,但用量不限。每多维持一天,我们就清楚以后收口会更难,但当时我们一心扑在 PMF 更强的战线上,把这个决定一拖再拖。
等到我们终于把不限量收回到合理额度时,用户炸了。其实只是一小撮用户认为一切都该永远“准免费”,但那股反弹波及面极广——社交舆论可不分青红皂白。我付学费学到的教训是:不限量的口子,不能开太久。
Harry: 兄弟,定价这玩意儿——还有老用户价格豁免(grandfathering)——是真的难。下一题:我们今天在工程或产品上的哪个做法,五年后你回头看会惊呼“天呐,我们当年居然这么干”?
Alex: 第一个是手改代码。第二个可能更冲一点:手工管理系统的部署和监控。我基本认为,大公司会花很长时间才转到新范式,但很多创业公司可能会直接在一个全新的技术栈上起盘——一个完全由 AI 管理的技术栈。
先说清楚:这套栈现在还不存在。它会长成这样:从第一天起就为智能体设计好强确定性的护栏,限定它能做什么,还有回滚部署之类的一整套管控。
我们终将走到那样的世界:你开公司的第一步,是领一个智能体、让它开工;然后再加更多智能体;再往后,也许你才把联合创始人加进这个“与智能体协作”的服务里。到最后,你的主力沟通工具可能就是你的智能体协作工具;你不再亲手扶着那条痛苦的持续集成与部署流水线,而是让智能体们去干活。
Harry: 这问题有点怪,但我很好奇:智能体的护栏由谁来提供?智能体在企业里哪儿都能去——是你负责提供护栏,还是会有第三方站出来说“Alex,那边是人力资源,你不能进;那边是市场营销,你不能进”?护栏供给这件事,该由智能体厂商做,还是第三方做?
Alex: 我认为两种都会有。我们自己在智能体护栏上投入巨大:对编程智能体做操作系统级沙箱的,基本只有我们一家——比如 Windows 上根本没有现成的,是我们在做,而且以开源方式做,希望别人也能用。
ChatGPT 支持连接器(connectors),比如接入你的 Google Docs,围绕“智能体能对你的文档做什么”,我们也做了大量护栏。这只是两个例子,我们在这上面想得很多。但我也认为,光靠我们大概不够:会有第三方针对非常具体的公司需求提供非常定制化的东西。最后大概率是两者混合。
Harry: 最后一题,朋友。放眼十年,最让你兴奋的是什么?
Alex: 这事大概率用不了十年。我加入公司时带着一点个人使命感:哪怕用一年半之前的模型,能力过剩(capability overhang)就已经巨大——这些东西本来就能帮到人,只是我们还没把对的产品造出来。结果是像我这样的人得到的益处,远多过我奶奶那样的人。
最让我兴奋的,是找到一种 AI 的形态,让它能帮助每一个人——不管他在不在科技行业,尤其是不在科技行业的人、尤其是年长的人。我脑子里那个具体的画面是:某一天,我们把一个智能体加进家里的 WhatsApp 群,它就开始对全家人有用,而任何人都不需要为此多费一点脑筋。实现路径也许有很多条,但具体到我奶奶,这是最显而易见的一条。
“某一天,我们会把一个智能体加进家里的 WhatsApp 群,它就开始对全家人有用,而任何人都不需要为此多费一点脑筋。” "...at some point we'll like add an agent to like our family WhatsApp or something and it'll just start like being useful to the family without anyone having to think harder about it than that."
▍点拨:全期最朴素也最有野心的一幅画面。它把能力过剩问题翻译成了每个家庭都懂的场景:AI 的终极形态不是更强的工具,而是不需要被“会用”的存在——进群、开口、帮上忙。对评估 AI 产品的人,这也是一条简明的试金石:你的产品是要求用户升级自己,还是直接把能力送到用户原地?
Harry: 兄弟,太谢谢你了。谢谢你忍受我东拉西扯的提问和这颗单元剧式的大脑,你太棒了。
Alex: 也谢谢你包容我东拉西扯的回答——咱俩彼此彼此。
这期对话收敛出六个关键判断,每条以 Alex 自己的论点开头,行动含义跟随其后:
- AGI 的真正瓶颈是人类的提示与验证速度,而不是模型、算力或架构。 组织引入 AI 时,最值得投资的不是更强的模型,而是消除员工“想到用、写得出、验得完”这三道摩擦力——把使用成本降到接近零,价值才会从一天几十次走向成千上万次。
- 编程自动化会创造更多建造者,而不是消灭工程师。 别按岗位消失做人才决策,要按人才栈压缩做:培养全栈能力,让工程师向上扩展到产品与判断,而不是守着前后端的旧分工。
- 先让个人用熟,再让自动化长出来。 无论企业落地还是做产品,自上而下的宏大工作流改造都会浪费 AI 的潜力;正确的次序是把工具交到干活的人手里,等熟练度形成,自动化会被用户自己拉进来。
- 写代码已经免费,贵的是确认“做对的事”。 把工程投入从代码产出转向规格、计划评审与验证体系——计划评审、自动化代码评审、测试信号质量,这些瓶颈层才是下一个竞争高地。
- 判断 SaaS 公司先问两样东西:握不握得住“人”,握不握得住“账”。 客户关系与记录系统占其一者大概率存活,两样都不占的胶水层最危险——SaaS 末日论对中间层是预言,对两头是噪音。
- 粘性时代才刚开始,今年的竞赛是接通。 编程任务本身厂商中立、切换免费,真正的锁定发生在智能体接通企业系统的那一刻;用短期利润换接通速度是值得的交换,但前提是接通确实在发生。