LMArena的17亿美元评估愿景 (Anastasios Angelopoulos)
本期对话 LMArena 联合创始人 Anastasios Angelopoulos,探讨他们如何从伯克利地下室的学术项目,成长为获得1亿美元融资、估值达17亿美元的独立大模型评估平台。
本文译自Latent Space 播客,发布于 2026 年 1 月 6 日。本期对话由 Swyx 主持,对话 LMArena 联合创始人 Anastasios Angelopoulos。
成立于加州大学伯克利分校(UC Berkeley)地下室的 LMArena(前身为 LMSYS Chatbot Arena),在本期录制时刚完成 1 亿美元融资;节目重发前又宣布完成 1.5 亿美元 A 轮融资(Series A),估值达到 17 亿美元($1.7B valuation),年化消费收入达 3000 万美元(约合 $2.5M MRR)。作为大模型独立评估的黄金标准,LMArena 拥有超过 2.5 亿次真实用户对话,每月新增对话达数千万次。本期访谈深入探讨了 LMArena 的孵化历程、学术与商业化转折、面临的“排行榜错觉”争议,以及向医学、法律、金融等专业垂直领域及多模态领域的扩张愿景。
▍嘉宾:Anastasios Angelopoulos LMArena 联合创始人兼 CEO。在加州大学伯克利分校(UC Berkeley)攻读博士期间,共同创立并推动了 LMSYS Chatbot Arena 项目,并最终将其剥离孵化为独立的评估服务公司。
▍关于 LMArena 前身为伯克利研发的 LMSYS Chatbot Arena,通过真实用户在盲测中对两款匿名模型进行对比投票,利用 Elo 评级系统计算大模型的综合能力排名。目前,它已成为整个 AI 行业公认的、防刷榜(overfitting-resistant)的大模型能力评估风向标。
伯克利地下室的孵化历程与公司化抉择
Swyx: 我们邀请到了来自Arena的Anastasios。我不太清楚你的姓氏怎么发音……是不是Angelopoulos?是的。恭喜你们取得的成功,你们拿到了Arena这个账号名。
Anastasios: 是的,我们拿到了。谢谢,这是个重要的品牌时刻。
Swyx: X现在变得更加商业化了,所以显然是你们买下的。不过至少你们现在有了一个固定的阵地。去掉了“LM”之后,感觉确实不一样了,不知道你对此有什么感受。
Anastasios: 一开始保留“LM”是因为我们起初是LMSYS,源自伯克利大学的LMSYS组织。后来我们决定拓展一下领域。我们是第一个名为Arena的平台,所以想把这个品牌确立下来。
Swyx: 上次邀请你们参加节目时,你们还没有真正拆分出来。我当时跟Alessio通话说,这些人要开公司了。那时我还不知道,也许你们当时已经创立了。我和Anj聊过,他说他是你们的创始CEO。很多人不知道这点。Anj是个非常有趣的人,我们安排了对他的播客访谈。他做的远比普通的风投要多。他确实做到了,对我们来说也是不可思议的。你想不想分享一下你们做过的事情?
Anastasios: 当然。公司一开始是作为Anj的孵化项目启动的。他在伯克利发现了我们,把我们从地下室里找出来,觉得我们做的东西有前途。他很早就开始和我们合作,给了我们一些资助。A16z不是唯一这么做的,我们也从红杉资本那里获得了很好的资助。Anj对我们特别支持,甚至在我们决定创业之前,就提供资源让我们继续开发Arena。在这个身份下,他为我们成立了一个实体。他当时说,如果我们不想创业,随时可以退出。这真的很不可思议,是他非常激进的一项投资举措。因为无论他花多少钱,我们都可以直接走人,让他一无所获。但他明智地知道,对Arena来说,最正确的做法就是把它变成一家公司。这是我们实现规模化的唯一途径,而且Waylon Yon和我最终也会看到这一点,并对接手创业感到兴奋。事实证明也确实如此。
Swyx: 肯定有一个时刻你们自己也在犹豫。你们当时也有其他机会。对你来说,决定性的因素是什么?
Anastasios: 很明显,要扩展我们正在构建的东西,唯一的办法就是成立一家公司。这个世界非常需要像Arena这样的东西。Arena是一个基于真实的有机反馈,在真实用户和真实使用场景中衡量、理解并推进前沿AI能力的地方。为了实现必要的规模和分发渠道,以及保证平台的质量从而有效地达成目标,我们必须成立一家公司。我们也考虑过其他选择。我们是继续把它当作一个学术项目来做?还是做一个非营利组织?但在这些架构下,我们觉得无法获得完成使命所需的资源。
▍Chatbot Arena 的 Elo 评级机制:Elo 评级系统原本是用于国际象棋等竞技对决的计分方法。在 Chatbot Arena 中,用户输入提示词,两个匿名模型(如 Model A 和 Model B)生成回复,用户投票选择更好的那一个。Arena 根据每场“双盲对决”的胜负结果,利用 Elo 算法动态更新模型的分数。这种基于人类偏好(RLHF 类似的数据源)的动态评估能够有效应对静态数据集被刷榜和过拟合(overfitting)的问题。
1亿美元融资的去向:推理成本与顶尖人才招募
Swyx: 所以你们筹集了1亿美元?这可是一大笔资源。这太棒了。这些资金用来做什么呢?我代表所有关注Arena的人问一句,你们打算怎么花这笔钱?
Anastasios: 首先,我们不一定要把所有钱都花光。公司里资金的作用是给你试错的机会。它意味着你有足够的资源,如果第一次尝试失败了,你还能继续下注。所以这并不是说我们会把钱全花完,当然要负责任地使用资金。话虽如此,平台的运营成本非常高。我们为平台上所有的模型推理费用(inference cost)买单。有人问我们是不是按市场价付费,有没有拿到折扣?我们确实有折扣,但这都是标准的企业折扣,和其他客户享受的待遇是一样的。
▍从学术项目到商业实体的第一性原理:学术界和非营利组织受限于计算资源和带宽限制,难以承载每月数千万次对话的实时推理(inference)。LMArena 选择商业化剥离,并不是为了追求单纯的利润,而是只有通过商业实体融资,才能持续为平台上所有模型的高昂推理成本(inference costs)买单,并招揽顶尖的 React 前端和 ML 基础设施工程人才。
平台规模与用户画像:数亿次真实对话的价值
Swyx: 不知道你们是否能透露一些数据。我看到了投票数量,但不知道这相当于每月的多少Token。如果能推算出来就好了。
Anastasios: 具体Token数量我得估算一下。不过我可以肯定地说,目前平台上的投票数已经超过了五六百万。自平台上线以来,可能已经产生了2.5亿次对话。现在每个月大概有千万级别的对话在平台上进行。它是目前面向大语言模型(LLM)的最大的消费者平台之一。当然,除了ChatGPT这种体量之外。这带来的好处是用户群体非常多样化。即便在这样的规模下,我们平台上依然有25%的用户是从事软件开发相关工作的。我们是怎么知道的呢?因为我们要么进行用户问卷调查,要么分析进入平台的提示词(prompt)分布情况。我们还做了一个叫做“专家竞技场(Expert Arena)”的项目,试图了解访问平台的专家分布情况。
Swyx: 其中很多可能是未认证用户的访问。
Anastasios: 确实如此,但现在大约一半的用户是登录状态的。所以我们有能力去了解他们。我们也在平台上进行调查,这能让我们更多地了解真实用户是谁。当然,调查总是存在反馈偏差(response bias)。
Swyx: 所以看待这些数据时必须有所保留,但不可否认它的价值。如果大家不知道Anastasios的背景,他可是修正反馈偏差方面的专家。此外,这个领域还有其他参与者,比如Artificial Analysis这家初创公司,还有一些做加密货币的人创立的项目。
LMArena vs Artificial Analysis:两种不同的评估维度
Swyx: 我不知道你们有没有和他们交流过,探讨潜在的合作。我之前和这两组人都聊过,除了他们,我还有遗漏其他主要玩家吗?
Anastasios: 没有了。我觉得根据你对这个词的定义,他们确实是几家比较大的玩家。Artificial Analysis显然在不同AI系统的分析领域占据了巨大的市场关注度。
Swyx: 是的,他们告诉我他们的目标是成为AI领域的Gartner。
Anastasios: 没错,那是他们的目标。我认为他们瞄准的是咨询市场。据我了解,Artificial Analysis是由一个顾问团队在做这些事。他们是一群很棒的人,专注于那个特定的市场。他们的平台与我们的不同之处在于,他们的分析是基于汇总公开基准测试(public benchmarks),并将其转化为分析数据,以及独立重新运行测试。这确实很重要。他们利用这些数据编写报告,让业界了解各种模型的表现。他们也有评测平台(arena),但不是基于真实用户使用的。区分我们和他们的关键在于,我们的用户是在输入自己的用例,提出自己的问题。这提供了一种他们平台所不具备的真实感。当然,他们专注于略有不同的领域,我觉得这些平台在发展方向上会有所分化。
Swyx: 是的。有时这是唯一可行的方式。例如,Artificial Analysis的视频评测使用的是预先生成的视频,你不能输入自己的视频生成流程。没错,但我们是依靠真实的有机交互来做的。对于投票者来说,好处是不需要等待。但反过来说,你为什么要去评测呢?你真的在乎别人生成的视频吗?或许只是为了印证你自己的直觉吧。
Anastasios: 也许吧。可能你有兴趣去比较一下……我写提示词的水平就很差。
Swyx: 真的吗?我可不信。我写提示词的水平才叫糟,我都是通过例子来学的。别贬低自己了。这世界上肯定有很多写提示词比我好的人,这是事实。大家有各种各样巧妙的方法来给大语言模型写提示词。这确实很有教育意义。唯一的学习方式就是去看看别人的提示词和结果,然后发现自己不知道还能这么做。完全同意。
摆脱Gradio:全面转向React的前端演进
Swyx: 让我们回到Arena。我想说的是,我们资金的首要用途就是摆脱Gradio。
Anastasios: 是的。Gradio是一个极好的平台,它帮助我们扩展到了极大的规模,这很了不起。
Swyx: 你跟Hugging Face的人说过吗?
Anastasios: 当然。我们非常感激Gradio一路以来的支持。但最终我们需要转向React。
Swyx: 相信Hugging Face肯定希望你们留下。是有什么技术原因导致你们无法获得足够的性能吗?
Anastasios: 主要是开发变得困难了。我们想要使用React里的各种工具和高级功能。举个例子,假设我们想为带有通知的视频创建自定义加载图标。在React里怎么做?
Swyx: 这确实很难,我们会做一个自定义组件。
Anastasios: 我想Hugging Face的人肯定会说在Gradio里也能做到。也许可以,但懂它的开发者更少。我们该怎么招聘?还需要重新培训,人们对那个技术栈不太熟悉。
Swyx: 总之明年就全面转向React了。资金还有其他有趣的用途吗?
Anastasios: 主要是用于推理成本 (inference cost),支持平台的免费使用,当然还有招聘人员的开销。我们也有了办公室。
“排行榜错觉”争议与学术反击
Swyx: 这就是在旧金山的我们。今年我要谈论一件大事,你可能都听烦了,但对圈外人来说绝对是新闻。就是关于排行榜 (leaderboard) 错觉以及和Cohere相关的事情。我们总结一下他们的说法和你的回应。
Anastasios: “排行榜错觉”是一篇非常粗暴且不科学地批评LMSYS Chatbot Arena的论文。需要澄清的是,Cohere表现得并没有那么好,大概排在74位。这在排行榜 (leaderboard) 上也是个值得尊敬的位置。我甚至认为这不是Cohere模型开发者的本意,而更多是他们研究部门的行为。无论如何,这篇论文声称Arena在平台上进行未公开的私人测试。他们说模型提供商会发给我们预发布模型进行曝光,这在排行榜 (leaderboard) 上造成了所谓的不公平。例如,他们提到Meta曾和我们测试过一些模型。当然,我们不能透露所有细节,但这就是论文的主要观点。我们对该论文的回应已经在线发布了。我们本质上指出了论文中的一系列事实错误,质疑了其主张的有效性。你可以去arXiv上看第一版论文的观点。后来他们纠正了一些明显不科学和错误的地方,但并没有纠正所有内容。举个例子,他们说我们只采样了9%的开源模型和60%的闭源模型,从而制造了开源和闭源之间的差距。但实际上,我们非常支持开源模型,比例更接近60比40。这是他们声明中错误的一个例子。另一个例子是他们声称这种预发布测试引入了某种未公开的偏见。
“Gemini-Nano-Banana” 闪击战:预览测试模式的威力
Anastasios: 实际上,我们做这种预发布测试已经很长时间了,我们的社区非常喜欢它,他们喜欢那些秘密代号,比如Nano Banana。
Swyx: 是的。
Anastasios: 人们非常喜欢Nano Banana,它引起了全球轰动,全球有相当一部分人在使用它。至于命名,我相信那是他们随机生成的决定。
Swyx: 显然产品经理Naina的绰号是Nana,这就是这个名字的由来。Nana加上了Banana。
Anastasios: 这么温馨。我不知道这个起源故事。对我们来说,这看起来只像是个随机的名字。
Swyx: 但它显然鹤立鸡群。在这之前还有Reeve Image和BFL那些模型,你记得吗?
Anastasios: 那些模型也很棒,团队进步很快。但Nano Banana绝对是一个轰动。那个瞬间改变了谷歌的路线图和市场份额。
▍“Nano Banana” 闪击战:谷歌曾在 LMArena 竞技场中以“Nano Banana”等神秘代号预览测试未发布模型。该模型一经亮相便引起全球轰动,改变了谷歌的路线图和市场份额,并带动谷歌股价波动数十亿美元。这种社区喜闻乐见的“预览测试(Preview Testing)”模式,也因此成为观察大模型竞争格局的重要窗口。
Swyx: 谷歌的股票因此波动了数十亿美元。现在有了OpenAI的红色警报。虽然我不确定具体细节,但The Information是这么报道的。图像生成一直是AI中很奇怪的一部分,因为它并非实现AGI的关键。它不是推理,而是模型生成视觉表示。过去Gemini因为生成种族主义图像遭到大量投诉,ChatGPT也遇到过类似情况。我曾想,我们能放弃图像生成吗?把AI的良好声誉集中在语言模型和编程等领域不好吗?但我错了,我是Nano Banana Pro的超级粉丝。
Anastasios: 我在这点上也错了。我最初没看到它的积极作用。但实际上,我认为这些多模态 (multimodal) 模型将成为AI在消费者和企业中都最具经济价值的部分。因为AI应用增长最快的细分市场之一就是营销和设计,包括广告。
Swyx: 作为一名内容创作者,我可以无限获取图表、解释图和信息图。很快,我们甚至不需要自己为论文制作图表了。
Anastasios: 我们的论文图表将由动物生成。
Swyx: 是的。DeepSeek最近发布了V3.2,他们的解释非常冗长。这篇论文有23页长,内容非常密集。我把他们对强化学习 (RL) 环境的解释和帮助我理解论文的图像输入到Nano Banana Pro中。我能随手生成一张博士生通常要在Photoshop里花一个月才能做出的论文级别图表,这真是不可思议。
诚信第一:大模型时代的第三方独立评估原则
Swyx: 我想问问你运营Arena的原则。你管理着一个拥有500万用户的庞大社区。在成立公司前后,你确定的核心原则是什么?是否有任何改变?
Anastasios: 我认为一切都没有改变。我们希望提供行业的北极星,以真实用户的应用场景为中心,将其置于首位,以便人们知道该设定什么目标。我们的目标是创建一个不断更新的基准,不因为不断涌入的新数据点而遭受过拟合 (overfitting),跟踪所有新模型和AI的新用例,为全世界提供真实用户如何使用这些模型的实际情况。模型以及它们在这些用例上的表现有多好。我们继续发布了大量开源数据。我们可能发布了比任何人都多的关于人工智能真实用例的数据。数以百万计的对话,来自真实用户的真实对话,社区正在利用这些数据进行研究和改进。
Swyx: 在你们将要构建什么和不构建什么方面,我可能没有完全跟上你们最近发布的所有内容。我知道你们最近推出了开发或代码竞技场,代码竞技场、专家竞技场。对你们来说,明年的关键路径是什么?你们决定永远不做的事情是什么?
Anastasios: 让我先谈谈我永远不会做的事情。对平台而言,平台诚信(platform integrity)是第一位的。我们在排行榜上展示的公共排行榜(leaderboard),我认为就像一项慈善事业。对我们来说它是个亏本赚吆喝的项目。我们并不指望通过公共排行榜赚钱。你不能花钱上公共排行榜。它不像高德纳那样,也不像任何花钱办事的系统,永远都不会变成那样。无论提供商是否付费,无论他们是否获得了好分数,模型都会被列在排行榜上。他们也不能花钱将其撤下。这意味着排行榜具有某种永远不会妥协的诚信。
“公众排行榜是一项公益慈善事业,而不是付费买榜的系统。模型不能付钱上榜,也不能付钱下榜。” "The public leaderboard is a charity, not a pay-to-play system—models can't pay to get on, and can't pay to get off."
▍点拨:这强调了 LMArena 维护平台诚信(platform integrity)的核心立场。在大模型厂商极其看重排名的竞争环境下,保持评估的公信力是平台最根本的护城河。
Swyx: 但并不是所有的预览模型都能上榜。
Anastasios: 是的,但这没关系。那些预览模型从未发布过。谁会在意把未发布的模型放在排行榜上呢?关键在于,对于每一个已发布的模型,你在排行榜上看到的分数在统计学上是可靠的。它反映了模型在现实世界中的能力。
Swyx: 是的。
Anastasios: 为什么呢?因为全世界有数百万人在为它投票。这就是那个数字的来源。为了计算那个数字,我们所做的就是让数百万人投票。我们收集这些投票,将它们转换成一个数字。这将永远保持对模型性能透明且公平的反映。
▍排行榜的“局部最优”陷阱:大模型在 Chatbot Arena 的 Elo 评分上升,是否真的代表它在实际生产的所有场景中都更好?通用排行榜难以覆盖每一个专业场景。因此,团队正向专业领域(如 Code Arena、医学、法律、金融)纵向扩展,并向多模态、视频领域横向扩张,以打破单一通用 Elo 评分的局限性,避免行业走向 Elo 指标崇拜。
纵向专家领域与横向多模态的未来扩张
Anastasios: 我们接下来的方向是什么?许多不同的新类别。我不知道你最近有没有看到,我们推出了职业和专家类别。由于我们的用户群达到数百万甚至数千万级,即使是个位数百分比的用户基数,也意味着很大的人数。我们用户群中个位数百分比的人从事医学、法律、商业、金融、会计、创意、营销等行业。我们能够展示这些模型在所有这些不同垂直领域的表现,因为我们拥有所有这些用户。我们正朝着多模态(multimodal)方向努力。视频功能,我们即将在今年晚些时候或明年初的某个时候在网站上推出。所以,还有很多项目在筹备中。
Swyx: 太棒了。你们会提供API吗?反对的理由是什么?
Anastasios: 显然存在对API的需求。问题更多在于我们公司的发展重心。因为我们是一家初创公司,所以我们真的应该专注做好一件事,也就是竞技场。我不确定我们希望业务铺得多开,也不确定我们希望在什么样的时间线上做这件事。
消费级 AI 产品的社区运营与用户留存
Swyx: 在社区管理方面还有什么建议吗?更广泛地说,每家人工智能公司都非常希望能壮大他们的社区。你们显然是世界上最强大的社区之一。什么策略真正起作用了?
Anastasios: 首先,我想向我们的社区经理Greg致敬。他在管理我们的社区方面做得非常出色。他真的很了不起。所以我想说雇佣Greg吧,但别雇佣Greg,他是我们的。去找个属于你们的Greg吧。但总的来说,如何获得这么多用户并留住他们?(用户留存,consumer retention)这是一个棘手的问题,因为消费者市场是世界上最艰难的市场之一。世界上有很多网站供人们浏览。他们为什么要访问你的网站?现实情况是,如果你想打造一个占据主导地位的优质产品,你必须为人们提供价值。坦白说,我不认为我们已经完全做到了。我并没有掌握构建出色消费级产品的完美方案和答案。如果我有的话,我们的用户就不会只是几千万,而是数亿,甚至十亿级了。
Swyx: 未来会不会有一天你们比 ChatGPT 还要大?
Anastasios: 我不知道。我不知道我们是否需要变得那么大。我也不知道我们是否会那样,因为他们打造的是一款非凡的划时代产品,对吧?这花费了大量时间,在某种程度上也包含了运气的成分。有很多转瞬即逝的机遇,就像对我们来说一样,我们的用户群就随之大幅增长。但当这些用户到来时,他们也很容易离开。所以我的想法是,每一个用户都是争取来的。你必须每天都去争取他们。他们可能随时离开,他们是善变的。所以你必须时刻思考:我该如何为这个人提供价值?了解他们是如何使用我的网站的?我还能为他们提供什么?我该如何构建所有的留存机制,以便他们留下来,并且还能带来他们的朋友?
Swyx: 在用户留存方面有没有行之有效的策略?就像你说的,现在很多人都在注册登录。注册登录是留存的一个巨大驱动力。但是你们提供了什么来鼓励他们这样做呢?
Anastasios: 比如历史记录。持久的历史记录。这就足够了。这是产生巨大影响的一件事。
Arena的未来:大模型生态的“行动号召”
Swyx: 好的。你们希望从大家那里得到什么?你们在寻求什么帮助,有什么行动号召吗?
Anastasios: 我们一直在寻找优秀的人才加入我们。如果你是所在领域世界上最优秀的人才之一,无论是消费级产品、机器学习、B2B、进入市场策略,还是市场营销,我们在 Arena 都需要你。我们正在组建一支由真正的专家组成的高效能团队。我一直在寻找优秀的合作者。
Swyx: 你们需要合作伙伴吗?假设我在 Cognition,我想与 Arena 合作。什么样的方式对你们有效?你们已经有哪些富有成效的现有合作伙伴关系?
Anastasios: 我们当然与所有主要模型实验室合作。这很简单直接。
Swyx: 比如,嘿,我们有个新模型。
Anastasios: 给你们。完全正确。所以我认为最直接的事情就是针对 Cognition 这样的公司。我们来评估一下。它是一个智能体(agent)。但我们应该继续塑造。代码竞技场就是一个智能体评估系统。
Swyx: 确实如此。但这所有这些竞技场往往更侧重于模型而不是测试工具(harness)。但也许这应该改变。
Anastasios: 也许我们应该朝着那个方向发展。我认为代码竞技场是一个很好的例子,它可以支持像 Devin 这样的全功能测试工具。所以在我看来,如果我在 Cognition,我会说,让我们把 Devin 放到竞技场上,弄清楚如何把测试工具串联起来。我相信那里肯定有一些非常有价值的东西。上周,人们在说 Devin 已死。你看到了吗?
Swyx: 是的。
Anastasios: 人们都在说 Devin 不复存在了。Devin 并没有死。Devin 无处不在,表现得非常好。但我们能否向人们强调这一点,向他们展示 Devin 实际上是在它所擅长的领域里世界上最顶尖的之一。Arena 实际上能够做到这一点。我们作为一个中央评估平台的定位使得这成为可能。
Swyx: 是的,我很喜欢。非常感谢你主导评估现状的发展。祝贺你度过了精彩的一年。
Anastasios: 也祝贺你。祝贺你的播客和职业生涯发展势头越来越好。能看到这些真的令人印象深刻。
- 大模型能力评测防刷榜:企业在做大模型选型评估(evaluation)时,不应仅依赖传统的静态公开基准测试(如 MMLU、GSM8K 等),必须结合基于真实业务场景的双盲 A/B 测试(LMArena 的 Elo 对决模式),以防止模型过拟合(overfitting)和厂商针对性刷榜。
- 合理利用“预览测试”(Preview Testing)机制:在发布新的垂类 AI 系统前,可以通过沙盒预览测试或隐式金丝雀测试,在不向用户透露具体型号的前提下,快速低成本收集成千上万个真实盲测样本,确保实际体验领先。
- 平台诚信(Platform Integrity)是 AI 生态的生命线:中立评估机构如 LMArena 建立的防付费买榜(anti-pay-to-play)机制是其估值 17 亿美元的最底层商业基石。开发者和企业应优先信任具备“不接受厂商付费干预”声明的独立评测指标,将其作为技术路线图的北极星。