说明:这份 Markdown 基于英文原始自动字幕整理,使用段落级时间戳方便阅读和回看。自动字幕对人名、公司名和产品名可能存在识别误差,正式引用前请回看原视频核对。
Sail Research 创始人兼前 NVIDIA 工程师 Neil Movva 讨论,如何从软件、芯片、数据中心与供应链各层降低 LLM 推理中 token 的成本。其核心判断是,廉价且可长时间后台运行的 Agent 将催生深度研究、网络安全和主动式个人智能等新型工作负载。
[00:00] 我的工作是尽可能把 token 做到人类所能达到的最低成本。我会实现这一点,并会动用技术栈中我能用到的每一层手段。我热爱供给侧杠杆。我会用上每一块芯片、每一种能源,以及美国所有适合做这件事的土地。我们仍然把 Agent 当作咨询成本高昂的人,遇到难题时才去问它。这不是看待智能的方式。机器能够思考,这令人难以置信,我们应该努力把这种能力交到尽可能多的人手中。
[00:32] [音乐]
[00:37] [音乐] 我认为在这类对话的早期,直接说清楚你正在构建什么、它现在能做什么很重要。所以,或许请你先用简短的描述帮我们厘清一下,具体说说你构建的系统是什么,以及它为什么应该存在。Sail Research 是一家 token 工厂。我们提供 API,任何人都可以向我们发送请求,使用开源的大语言模型完成他们想做的任何任务。我们会以市场上无可匹敌的价格向他们提供这些 token。
[01:05] 我们也支持他们在此基础上构建 Agent。我们托管所谓的 sandbox,即部署在云端、可长期运行的 Agent 虚拟机,专为运行数小时、数天或数周的 Agent 设计。因此,你可以把你们看作与服务不同类型推理的其他公司并列的同行。你们服务的是一种特定类型的推理,目标是成为某种智能使用方式中绝对成本最低的提供者和赋能者。没错。我们公司的主题是充裕。我们希望以几乎每个行业都能持续负担的成本,把这种新的智能商品交付给尽可能多的人。我们认为,只要把某件事的成本降低 10 倍,它就成为一个新的产品类别,我们希望 token 也是如此。机器能够思考,这件事意义深远,而我们现在的工作是让世界上尽可能多的机器投入思考。
[01:53] 如果把今天的主题看作 token 成本,那么 token 成本是理解这件事的正确方式吗,还是你会换一种说法?首先,绝对是。今天,我的北极星指标是做到业内最低的单 token 成本,并且大幅领先。我不认为 token 是衡量工作或智能的最终单位,但它是我们今天使用的单位,所以很直接。我认为在 token 之后,你会开始更多地转向结果,这是一种比较模糊的方向。比如说,今天你通过 Agent 消耗 token 时,实际上无法控制 Agent 会推理多少 token。它可以推理一段时间,也可以调用一定数量的工具。我越来越认为,我们会让 Agent 完成某个工作单元,尽可能多次地尝试达成目标,而它为此使用多少 token,将是一个随任务而定的因变量。
[02:42] 所以,你设想的是由 Agent 自行管理 token 预算,而不是公司规定工程师每月可以花多少 token。为什么这是一个你们有机会解决的问题?看起来整个世界都在追求更多、更好、更快、更便宜的 token。眼下世界似乎正在非常积极地解决这个问题。你看到的独特切入点是什么,也许是市场在尝试解决这个问题时没有做到高效的地方?我认为有两件事为我们公司带来了顺风。第一件一定是开源的兴起,我必须先讲它。我认为我们开始看到越来越多的客户和更广泛的市场在意拥有智能。他们希望对自己所依赖的东西拥有控制权和主权。
[03:25] 这为定制模型,甚至那些谁都无法从你手中夺走的原生开源模型,创造了一个强劲得多的市场。你始终拥有模型权重,始终有权按自己的意愿部署它们。在这样的世界里,过去几年间,为这些模型提供大规模服务的市场已相当成熟。挑战在于,所有这些公司,你随便挑,Base10、Fireworks、Together,它们都专注于低延迟推理,而一个非常重要的客户 Cursor 把它们拉向了这个方向。
[03:53] [清嗓子] 我认为大约一年前那是正确的选择,而从六个月前开始,看起来低延迟或许不是你从 Agent 那里想要的唯一东西。你想要更强的持久性、更长周期的任务。现在,对我来说,Agent 推理的未来显然是长周期任务。你会让机器一次运行数小时或数天。它以每秒 100 个 token 的速度吐出 token 并不重要,每秒 10 个可能就足够了。这随之会带来相应的优势和效率。
[04:22] 你为什么对此如此有信心?对我来说,我似乎希望一切都尽可能快。你在等待它时,当然应该得到尽可能快的答复。我的诀窍是,我不希望你等待它。我希望它是主动的,我希望它在后台运行。换一种说法,最好的延迟就是完全没有延迟。你早上醒来时,工作已经在夜里完成了,你甚至不必提出要求。这就是梦想。我们还没有完全做到。但更重要的是,我认为你越是置身其中,不断提示 Agent 并等待答复,实际上你就越会成为让 Agent 做更多或更少工作的瓶颈。我们希望 Agent 以更贴近人类的时间尺度运行。你不会每 5 分钟管理一次同事。你让他们完成一项高层次任务,然后可能每天回来查看一次,但更可能是一周一次。对我而言,这就是人类与 Agent 协作的未来,更像是人类的时间尺度。请再说说,这种情况正在发生的早期迹象有哪些,因此你们应该创办这家公司。
[05:13] 首先,也是最重要的是测试时计算扩展这个概念。也就是说,你可以给 Agent 更多时间,它会给你更好的答案。这个想法大约两年前就被理论化了,但直到我认为去年的年底,随着 Opus 4.5 的出现,我们才真正能够据此下注。Opus 4.5 是第一个多少适合较长周期任务的 Agent,它刚推出时表现相当一般,但看看较新的模型,再看看我们在开源领域的工作,你会发现 Agent 已经能够一次运行一个小时。我不会说已经能运行数天,但今天运行一小时绝对很合适。因此,只要看到平均轮次或任务时长越来越长,几个数据点就足以让你画出那条指数曲线,并看到 Agent 值得运行更长时间。
[05:58] 你认为三年后,长期运行 Agent 的市场份额会是多少,或者类似的指标?你知道,我喜欢这个市场,因为它没有边界。没有人类参与其中,所以你可以在后台消耗任意多的 token,这与人类的注意力跨度形成对比。如果你让我在 Codex 或 Claude Code 中消耗 10 倍的 token,我实际上不确定自己是否还能做到。我已经陷在一个循环里,坐在笔记本电脑前的大部分时间都锁定在编程上。没有上限的是可以在后台或主动消耗的 token 数量。所以从长期来看,我认为到今年年底,后台工作负载和实时工作负载可能各占 50%,但我认为这会变成 90 比 10,后台占优。哪些事情是你最喜欢的例子,也就是作为后台任务完成得比作为人工参与的好得多的事情?
[06:40] 任务?大多数深度研究,以及大多数你想从不是 100 个来源、不是 1,000 个来源,而是 10,000 个或更多来源中获得确定答案的问题。如果你想建立一个权威的信息索引,例如我们的客户 Parallel Web Systems 正在尝试做的那样,他们希望为整个互联网建立索引,并实时监控互联网的变化。这是那种疯狂的 EB 级任务,需要非常不同种类的智能,或非常不同规模的智能,才能完成。深度研究是我们的顶级类别,而我们也日益看到网络安全沿着这个方向发展。你可以生成很多代码,但破坏同一段代码的方式,比生成那段代码的方式多得多,呈指数级增长。有一些很棒的客户正在非常努力地寻找能够攻破任何软件并主动修补它们的 Agent。例如,Fable 刚推出时,或者 Mythos 刚推出时,网络安全社区基本上掀起了一股热潮,要让 Fable 针对我们写过的每一行代码运行,并以 20 种不同的方式寻找 bug。这意味着你既要寻找内存错误,也要寻找业务逻辑错误和网络漏洞等所有问题。而这些实际上都是你会为之编写专用 Agent 的事情。你不会只让 Fable 看一次源代码,而会让它真正地
[07:53] 搭建环境,以便对这些应用进行渗透测试。某个时候,人们开始开玩笑说,安全已经变成了工作量证明。当你想要安全的软件时,真正的问题是你花了多少美元购买 Anthropic 的 API,来尝试攻破自己的软件。这是衡量其安全性的最佳指标,因为那是世界上最好的工具。我们越来越发现,这里的智能前沿相当崎岖。并不是 Fable 能发现软件中所有 bug 的超集。你会用非常小的模型发现一些大模型找不到的 bug。你会用 Haiku 发现一些 Fable 找不到的 bug,反过来也一样。因此,这鼓励采用非常多样化的采样方法,并尝试构建能自主攻破软件、从而让你修补它们的网络安全 Agent。如果要对这类事情稍微进行一些推测和想象的话,
[08:40] 那么成本极低、运行时间极长的 Agent 能够实现什么?我们谈过一些非常实际的例子,深度研究、网络安全等等。但如果你对这种推理会解锁的用例和新产品类别稍微更有想象力一些,我想问题就是:那又怎样?如果你取得了最大的成功,稍微畅想一下它可能会带来什么。绝对可以。我认为,对个人用户而言,最让我兴奋的是主动式智能 Agent 这个想法。你可以想象一个始终在后台运行的 Siri,它了解你一天收到的所有电子邮件、所有短信,并对你的生活有更全面的认识,也知道如何在其中提供帮助。现在仍然是点状解决方案,所以你最终要做很多提示。Siri 并不很主动。我们可以用充裕的推理能力解决这个问题。如果你足够信任机器,认为它既可靠又值得信赖,比如能够保护隐私,那么你甚至可以想象机器能够理解你如何与它交互,并在每次打开手机时主动呈现你的下一步行动。我们能否构建一个关于你下一步要做什么的好模型?
[09:44] 我的估计是,可以,我们完全可以。关键是极其廉价的智能。你必须愿意消耗 token,而不承诺任何回报。这就是解锁点。从长远的视角看,我们拥有一种能够解决任何可验证问题的智能形式。任何可验证问题意味着大多数软件,也意味着大量形式化的内容,比如数学证明及类似问题,还可能意味着科学发现。这些都是相对可验证的问题。而所有这些事情如今本质上都附带美元成本。
[10:18] 这是个隐藏的变量,就像你究竟能调动多少 token 来让这件事成功?实际上,我们已经开始把这些长期任务的美元成本拉回到合理的范围。不是几百万美元,而是几千美元;不久的将来,或许只要几百甚至几十美元,就能为任何科学问题、任何研究问题给出确定的答案。Ramp 是唯一一个旨在让财务团队更精简、更快速、更出色的平台,平均每年可为企业节省 5%,让你专注于增长。Ramp 客户的营收增长速度是美国企业平均水平的 3.2 倍。Visa、Vercel、Cursor、Stripe、Notion、ElevenLabs、Shopify 以及其他 70,000 家企业如今都在使用 Ramp。我的公司也是,你的也该如此。访问 ramp.com/invest 了解更多。
[11:06] OpenAI、Cursor、Anthropic、Perplexity 和 Vercel 都有一个共同点:它们都使用 WorkOS。要实现大规模的企业采用,你必须提供 SSO、SCIM、RBAC 和审计日志等核心能力。与其花数月自行构建这些关键能力,不如直接使用 WorkOS API,在第一天就全部具备。这就是为什么你所听说的众多顶尖 AI 团队已经在使用 WorkOS。WorkOS 是让产品快速具备企业级能力、并专注于最重要之事,也就是你的产品,的最快途径。访问 workos.com 开始使用。Rogo 的 Felix 是一名个人金融 Agent,能借助你公司的模板、上下文和标准,把一条提示转化为[音乐]完成的、可直接交付给客户的成果。给 Felix 发一封邮件,例如:“把[音乐]这些评论整理出来给我。”或者:“根据这些邮件的上下文更新我的跟踪表。”Felix 会返回完成的[音乐]PowerPoint 演示文稿、Excel 模型和有来源的研究资料。Felix 按照你的团队现有的工作方式运作,[音乐]全天候快速、准确地交付工作。访问 rogo.ai/felix 了解更多。
[12:04] [音乐] 所以,如果我们憧憬那个未来,我们就只会受限于人们能提出什么问题。基本上,也就是我们能问出什么问题。呃,模型正处于这样一个临界点:即便面对一个高层次的问题,也能一路追踪所有可能的后续问题;你基本上可以让模型自行承担这件事。问题在于你的 token 预算是多少。而我们会解决 token 预算问题。那不可验证的任务呢?我基本上把整个人类品味这一类别都归入其中。我们还没有解决人类品味,我也不知道它从根本上是否可以被解决。我很期待在这方面被证明错,不过,嗯,我们专注于非常量化的问题,把写作的质量、艺术的美留给人类。
[12:47] 好。现在我们来谈谈你希望构建的那套非常巧妙的解决方案栈,最终形成这个巨大的 token 工厂,成为极低成本智能的供应商。我认为你是从软件、硬件和电力这几个层面来考虑这件事的。讲讲你的总体规划,如何应对这项与其他人思路截然不同的挑战。你知道,我们总得从软件开始。如今的芯片和数据中心还有哪些提升效率的机会?我们做的第一件事,就是围绕 GPU 的峰值效率构建整个 LLM 软件栈。这意味着我们使用 Nvidia GPU,希望从同一块芯片中压榨出比世界上任何人更多的 token。
[13:26] 这要从最底层的编程内核开始。其实这正是我的背景:我的一生,准确说是整个职业生涯,都在研究 GPU 和内核。大学期间,我的第一份工作是在 Nvidia,我得以见证 Tensor Core 是如何赢得在芯片上占有一席之地的。这是在 2016 年。请向外行解释一下这是什么意思。好,Tensor Core 是 GPU 上用于加速矩阵乘法的专用单元。就这么简单。Tensor Core 如何随时间演进有很长一段历史,我们之后会讲到。
[13:56] 为什么矩阵乘法如此重要?这是个好问题。实际上,我不能说存在某种关于宇宙的神圣真理,能解释为什么矩阵乘法看起来像是计算的原子单位。但,呃,我听过的一种说法是:它是一种极其简洁的方式,可以把两块数字混合在一起,让它们以某种有趣的方式相互作用。我能说的大概就这么多。线性代数恰好能以非常紧凑的形式表示数据中任意的关系,这实在很方便。显然,伟大的图形公司 Nvidia 长期以来一直在 GPU 和游戏图形领域占据主导市场份额。随后,大约从 2010 年代中期开始,他们启动了类似秘密研发项目的工作,让图形处理器更适合他们关注的机器学习任务。我记得我在 Nvidia 时读过一些经理的实验记录,他们会去参加一些小型 ML
[14:45] 会议,例如当时的 ICML 或 NeurIPS,记下这些论文,比如:“哦,深度学习这东西似乎开始流行了。真正有意思的是,这些研究生正在用 Nvidia 的游戏 GPU 训练大模型。我们该深入研究一下,弄清楚这里发生了什么。”到 2015、2016 年,至少 Jensen 已经确信:人们对我们芯片的这种使用只会持续增长。我们开始为这项正在涌现的能力分配越来越多宝贵的硅片面积,把第一版 Tensor Core 放进芯片。因此,我们说的是把原本为在屏幕上绘制像素而设计的游戏芯片,改造成能做矩阵乘法的芯片。当时还很早期,当你要求更多硅片面积时,本质上是在和图形团队竞争,在任何芯片公司都是如此。这里始终存在竞争。设计师会极其谨慎地守护这块资源。你绝不想投资错误的技术,因为那意味着机会成本,本可以把面积分配给其他功能。所以我们几乎是寸土必争,才为第一代产品争取到一点点芯片面积,大概 5% 到 10%,用于
[15:54] 这一代芯片,对基本卷积提供一定程度的加速,而卷积是当时计算机视觉模型的基础运算。呃,随后我们有一个软件团队,试图从芯片中榨取一切可能的性能。我所在的那个软件团队让我最深刻地理解了 Nvidia 的理念:他们有一个术语叫“光速”,他们对于制造的任何
[16:20] 硬件,都在追逐光速。这个理念深深刻在每个工程师心中:只要机器做得到,我们就会把机器推到前沿,直到它完成我们认为它能完成的事。而光速就是可能性的边界。光速就是可能性的边界,完全正确。呃,如果我们认为芯片能以这个频率运行、每周期产出这么多次乘法运算,我们就会做到。我们会打破每一个瓶颈,达到性能的峰值。因此直到今天,我仍对所有工程师说,我们追求 100% 的光速。我不在乎相对竞争对手的数字,我只关心绝对数字。呃,我们能让芯片做到什么,又该如何实现
[16:51] 它?在结束你在 Nvidia 的这段经历前,除了那个文化触点,还有没有什么真正改变了你的思考方式,或者当时公司的运营方式、文化中最突出的地方?我有很多关于 Nvidia 的故事,可以讲几个。嗯,我最喜欢的一点是,就员工任期而言,我在 2015、2016 年 Nvidia 共事的很多人至今仍在那儿。这家公司的留任率惊人,而且坦白说,至少在芯片这一侧,他们是我整个职业生涯中共事过的最优秀的工程师。他们极其、极其有动力,也充满热情。
[17:20] 他们始终相信并行计算这一理念的各种形态,也乐于看到芯片不断演进。这是他们毕生的工作,他们在这个方向上极其、极其胜任。他们也是一家非常节俭的公司。我想 Nvidia 以及 2008 年之后所有硅谷公司,都削减过一些福利。所以,没有免费午餐。呃,例如 Nvidia 更进一步,冰箱里连免费牛奶都没有。因此,如果你想在 Nvidia 喝咖啡并加牛奶,实际上每个月得向牛奶俱乐部交一美元,牛奶俱乐部会在冰箱里备好 Costco 的牛奶。我对此记忆犹新。我们那里不这样做,不过,呃,这是一种渗透到整家公司的节俭。于是从那段经历中走出来,你获得了如何通过软件更高效使用底层硬件的经验。
[18:06] 是的。那就把这和今天的环境联系起来。好,当然。所以我认为,GPU 从根本上说是一台吞吐量机器。当你给它大量工作,并让它以计算单元的峰值利用率处理这些工作时,GPU 最开心。但过去几年我们实际采用 AI 的方式并不是这样。我们确实把 AI 推向了交互式聊天机器人,聊天机器人是如今最常见的 AI 使用形式。在那个世界里,你非常在意尽快把答案输出给键盘前的人。正如你所说,不要让用户等待,我希望一切尽可能快。这对 GPU 来说其实很有意思:当你试图快速输出 token 时,很难让 GPU 进入计算资源被充分利用的最佳状态。这里存在一种
[18:48] 根本性的权衡:GPU 要么以吞吐量为导向,要么针对延迟优化。由于使用形态面向聊天机器人,所有人都选择了延迟优化。我相信这会是未来一年我们将看到的最深刻变化:我们会从聊天机器人转向更主动或在后台运行的 Agent。在那个世界里,围绕吞吐量构建技术栈就合理得多。你能从技术上解释为什么吞吐量和延迟之间的权衡无法打破吗?为什么同一套硬件不能两者兼得?这几乎是你可能看到的每一种系统的基础规律。总是在尽可能快地让少量数据穿过系统,同时为此留出大量缓冲空间,与尝试宽而慢地运行之间做权衡。窄而快或宽而慢,是整个计算机科学中的经典权衡。不过对 GPU 而言,我认为有一点值得关注,即 GPU 上的批处理概念。我们希望把许多用户的工作合并为一个批次,以便在 GPU 上一次运行。这就是 GPU 的并行处理。我们希望有大量并行工作可做。不过,当你一起运行一大批计算时,做的净工作量会更多。因此,你可能填满了所有单元,但每一步
[19:59] 中,当你把一批工作送过 GPU 时,都有更多工作要做。所以该批次中的任何单个 token 或单个用户请求,都会因为与其他人的流量一同处理而在 GPU 上停留更久。也许可以这样说:如果你想去旧金山的市中心,可以坐公交车,也可以乘私人交通工具。私人交通会像乌鸦飞行一样有自己的直达路线,或者说,从 A 点到 B 点完全走你想走的道路。公交车则得服务更多人,从根本上必须做对所有人都有效的事,所以它会走更慢的路线,还要停下来等其他人上下车。我认为公交车和汽车的类比相当准确。这是个很好的类比。因此,你要做的第一步,就像是在 Nvidia GPU 之上打造尽可能好的公交车。这就是优化的第一步。
[20:49] 完全正确。这意味着我们会探索不同的并行方案。也许我能再举个例子:Nvidia GPU 真正创新并做得很出色的一点,是 GPU 之间的 NVLink 互连。事实上,NVLink 系统好到,如果你要更快地进行一次大型矩阵乘法,就可以把它切成两半,并将其[清嗓]分片到两块或更多块,最多比如八块 Nvidia GPU 上,让它们分别处理这个大型矩阵乘法的一部分,然后在最后把结果连接起来,在最后将结果归约合并。而
[21:24] 这是降低一次操作最低延迟的绝佳方法。假设每个 GPU 现在只需完成原来 1/8 的工作量,因此能更快完成,但不会快到八倍。这是次线性扩展:你会用上八倍硬件,却得不到八倍速度,可能只能提升四到五倍。你无法获得强扩展性,因为存在通信开销;每个 GPU 处理较小的工作块时,也会比处理较大工作块略低效。因此,若你想得到尽可能低的延迟,这确实是唯一的加速方式。你可以这么做,但这不是我的选择。例如,我更愿意采用专家并行或流水线并行等不同的并行方案。我们还可能通过一些有趣的方式重叠并隐藏通信延迟,而低延迟服务器在这方面的余地会更小。
[22:12] 那么,把 NVLink 理解为一项改善延迟表现的技术,是正确的吗?是的。而且它只改善延迟表现,这就引出了下一部分:我们公司有哪些不同之处。但对于低延迟推理,我会说 NVLink 是必不可少的。NVIDIA 非常擅长低延迟推理,而我要说的是,我们其实并没有那么在乎低延迟推理。那么这对我们意味着什么?嗯,我并不期待其他公司整体上能迅速攻克 NVLink;这是一项很难掌握的技术。
[22:40] 它很难扩展,也很难投入生产。因此,如果我有某个其他厂商的芯片,它在基础计算组件上表现很好,仍能很好地完成矩阵乘法;它只是无法快速地把这些结果传递给同类芯片。那么,在我的技术栈中,也许有空间容纳这种芯片,把它作为每美元计算能力极高的选择。事实上,大多数情况下我优化的正是:这颗芯片有多少 FLOPS,以及拥有并运行它每小时要花多少钱。因此,确实有些芯片的每美元 FLOPS 高于 NVIDIA,但它们的互连能力可能没那么强。我的工作就是找出该使用什么并行方案,才能让这种芯片适合推理。不会是张量并行,做这个基本离不开 NVIDIA;但其他技术对我来说可能很有效。
[23:27] 在结束延迟这部分话题之前,你能谈谈 Cerebras 这类能进行极快运算的公司吗?我很好奇你如何看待这些路径、这些公司,以及未来可能发生什么。你对专注于极低延迟的硬件未来有什么预测?我认为 Cerebras、Groq,以及另外几家刚走出隐身模式的公司,做了一个很有意思的押注:不只是再造一块 GPU,而是打造一种围绕不同内存层级设计的加速器。它们想最大化芯片上 SRAM 的容量,并将其作为模型权重和 KV cache 的超高速内存。SRAM 与 DRAM 是为芯片制造内存的两种方式。一种是把内存直接集成到逻辑 die 上,也就是说,你告诉 TSMC,我希望芯片上有这么多 MB 的存储。这个可以实现,TSMC 有可用的标准单元库,你只需铺设大量 SRAM 单元即可。
[24:23] SRAM 的问题是会占用硅 die 上很大的面积。假如你想造一块很大的 die,比如面积为 800 平方毫米的 NVIDIA Blackwell;即使整块都用 SRAM,也许也只有个位数 GB 的存储容量,并不算很多。另一种做法是采用完全不同的制程技术,不再由 TSMC 制造,而是由 Micron、SK hynix、Samsung 制造 DRAM。DRAM 是完全不同的内存制造方式,更侧重于电容器而不是晶体管单元。SRAM 的标准构造是所谓的 6T 晶体管单元:这是一种稳定的晶体管排列,允许你向其中写入一个 bit,之后它会保持这个 bit 的状态。你当然仍要供电,但无需任何主动管理,它就能保持这个 bit,因此称为静态。
[25:12] 动态随机存取内存,也就是 DRAM,之所以是动态的,是因为写入数据时,你是把电荷写入电容器;一旦写入,电荷就会耗散、发生泄漏。因此,DRAM 的动态之处在于,大约每 50 毫秒就必须刷新写入的每一个 bit。你本质上是在不断抛接数十亿个球,内存控制器必须管理数十亿个 bit,读取并刷新 DRAM 中的每一个 bit。好处是密度可以高得多,而且这是完全不同的制程技术,涉及大量不同的权衡。因此,我们把 DRAM 制造交给 Micron、SK hynix 和 Samsung 这样的独立公司,它们是全球最擅长这件事的公司,制造 DRAM。若把这些公司的 DRAM 堆叠成许多层,并将其布置或焊接在 NVIDIA 主逻辑 die 周围,现在便可获得数百 GB 的容量。例如 Blackwell 在逻辑 die 周围有 288 GB 的 HBM,而逻辑 die 本身可能只有约 500 MB 的 SRAM。因此,DRAM 相对 SRAM 的密度可能高出多个数量级,达到三个数量级。好,回到 Cerebras:它们在做什么?
[26:25] 它们看到了这个问题:目前并没有显而易见的办法提高芯片上 SRAM 的密度。但 SRAM 的特点是,它与实际进行计算的逻辑门物理距离极近,算术逻辑单元紧挨着它们要读取的 SRAM;执行矩阵乘法的计算单元可以以令人难以置信的速度从 SRAM 取数。Cerebras 的 Wafer-Scale Engine 3 可达到每秒 21 PB。相比之下,NVIDIA Blackwell 上的 HBM 大约是每秒 10 TB。又一次是多个数量级的差异:容量更大,但带宽按比例更低。
[27:04] Cerebras 的做法是,尽可能采用更多 die。它们不把自己限制在 TSMC 施加的 800 平方毫米光罩限制内,而是使用整片晶圆,让每个 die 都通过划线区连到其他 die,并尽力在整片晶圆上放入尽可能多的 SRAM。每片晶圆可以有大约 50 GB 的 SRAM,然后再将多片晶圆以流水线或类似方式堆叠起来,于是就能拥有高达 1 TB 的超高速内存。
[27:40] 做这一切,就是为了让每片晶圆从 SRAM 读取数据的速度达到每秒 21 PB。因此,你可以用极高的每秒 token 数服务这些语言模型,因为你能在大约一毫秒内,把像 Kimi 这样大模型的全部参数数据移入和移出逻辑核心。这样一来,你就有了实现每秒一千个 token 的路径。那么你如何预测这个细分市场?好的,我认为它们的结果会是某种混合形态:我们得把擅长快速访问内存的 Cerebras 芯片,与内存容量更大的设备配对。确实,你可以把 Kimi 这样的一万亿参数模型放在大量 Cerebras 晶圆上,但你不太容易解决 KV cache 的问题。KV cache 会随着人们更多地使用模型而增长,而且它始终是动态的。
[28:39] 你甚至不知道需要多少 KV cache,这取决于你有多少用户,以及你想服务多少用户。你能用最基础的方式解释一下 KV cache 吗?可以。使用语言模型时,只要对话还在继续,你送入语言模型的每个 token 都会保留在其上下文窗口中。假如我们聊了 100,000 个 token,第 100,001 个 token 到来时,前面的 100,000 个 token 仍在此前的对话里,模型会参考全部历史对话,以便更好地预测我们接下来会说什么。因此,KV cache 是一大块内存。你必须为送入语言模型的每个 token 存储一个表示,它经常会比模型权重本身还大。我喜欢这样理解:模型权重中是凝结起来的知识,而 KV cache 中是我们这场具体对话的动态知识。对,这也是为什么人们有时会发现,对话进行得很深时效果开始变差,因为出现了某种技术问题。是的,KV cache 在这方面很有意思。KV cache 是此前一切内容的精确表示,我们会存储在对话中见过的所有信息。
[29:51] 然而,训练时,模型主要并不是在极长上下文对话上训练的,而主要是在例如 8,000 token 或 16,000 token 的对话上训练。因此,即便把模型带到 200,000 token,虽然在这种上下文长度上做过一些训练,但那并不是模型的核心强项。对 Frontier Labs 而言,一个长期挑战始终是:如何让模型在 200,000 token 时与我们预期它在 10,000 token 时一样聪明。这将是我们长期面对的战斗。百万级上下文窗口这个概念已经存在多年了。我想 Anthropic 是第一个达到百万上下文窗口长度的。我仍然会在 Claude Code 中使用 /compact,远在上下文达到一百万之前。我不认为把它用满是件好事。
[30:34] 因此,这些极快、极低延迟的方法最终会受这个因素限制。是的,模型权重方面你可以任意发挥,完全可能让权重存储拥有无可匹敌的性能;但 KV cache 会成为一大棘手问题。那么三年后、五年后,你认为这类芯片会扮演什么角色?它们在异构芯片市场中会占据怎样的份额?Cerebras、Groq,以及其他几家类似公司,应当被视为加速器。它们真正擅长的是与更传统的、关键在于配备片外内存的 GPU 类设备结合使用。你需要片外内存来获得容量,也需要片上内存来获得速度。我们希望将二者混合起来。把 Transformer 推到极限,达到一百万上下文长度时,实际会出现一个计算受限阶段,即我们所说的 MLP 的矩阵乘法阶段,模型的大部分知识和世界知识都编码于此;随后是注意力层,我们在这里动态适应当前对话。在极限条件下,注意力通常受内存限制,而在足够大的 batch size 下,MLP 则受计算限制。我会说,Transformer 的原罪在于:
[31:46] 它把一个从根本上受内存限制的层,紧挨着一个受计算限制的层放在一起。要有一颗同时擅长计算操作和内存操作的芯片非常困难。GPU 在这方面相当均衡,但你仍得二选一。Cerebras 对矩阵乘法这类任务的内存访问极快,很适合在 Cerebras 芯片上承载 MLP,也就是权重;而 GPU 的容量可以扩展到极长的上下文长度,因此你可能想把注意力层放在 GPU 上,把 MLP 放在 Cerebras 芯片上。
[32:23] 我相信 NVIDIA 和 Groq 正在做的就是这个。你能稍微谈谈 Transformer 吗?你一直很擅长向那些不太熟悉 2017 年这项创新的人解释核心概念,例如它的优势和弱点,以及你是否认为它会继续是未来 AI 的主导架构或主导架构之一。Transformer 的作用是让我们能够非常有效地从无监督数据中学习。归根结底,Transformer 要做的是接收任意序列的数据,并尝试从中寻找模式;而注意力操作是 Transformer 最核心、最具代表性的组件。它让模型能动态适应它认为序列中最相关的部分。在 Transformer 的每一步中,你本质上都会重新衡量之前看过的输入,并判断哪部分与你的下一次预测最相关。而且
[33:22] 因此,它非常适合学习任意序列数据。我们经常产生的最有趣的数据序列就是语言,这也让它在语言领域取得主导地位。但如果再把视野拉远一些,我认为 Transformer 真正做得好的是扩展。Transformer 没有这种人为先验,它只是说:“数据序列中会存在某种模式;如果有模式,我就会找到它。我会向这个问题投入越来越多的参数,直到它奏效。”Transformer 也受益于大量计算机视觉领域的工作。例如,
[33:53] 例如,计算机视觉面临的挑战之一,是很难从支持向量机等线性模型或其他传统机器学习模型的数十万参数规模继续扩展。这些模型只有几千个参数。后来进入深度学习时代,计算机视觉模型达到了数千万参数。当时最大的模型大约有 1.5 亿参数,对计算机视觉来说已经是巨型模型。如今我们经常谈论数万亿参数,而 Transformer 正是将规模从数百万参数带到数万亿参数的桥梁。
[34:22] 如果我把扩展的关键单位理解为数据和算力,那么是否可以说 Transformer 会一直存在,因为我们很擅长获得更多这两样东西?数据还是个开放问题,但算力不是。是的,Transformer 就像极好的海绵。给 Transformer 增加 10 倍可用算力,总会在某个方面获得对数级提升。而且到目前为止,缩放定律确实有效,十分优美。至于 Transformer 到底特别擅长什么?
[34:55] 它们几乎能处理你扔给它们的任何数据集,是极其强大的通用学习器。我认为,相比我们试图用来替代注意力机制的其他技术,Transformer 特别有用的一点是,它能表示你想要的任何成对关系。序列中的任何 token 都可以关注序列中的任意其他 token。因此,只要序列中存在某种关系,你就能用 Transformer 发现它。当然,你未必需要全对全建模,不需要每个 token 都查看其他每个 token;但如果需要,Transformer 提供了这个选项。
[35:28] 在我们找到更好的方法来缩减这个空间,或让信息建模能够进行更有选择性的注意之前,注意力机制都是非常非常好的操作。这是我们在计算机视觉时代学到的另一种技巧。Karpathy 有句老话:如果你有一个新数据集要训练模型,首要目标应是让模型过参数化,并尝试在已有数据上过拟合,以证明其中存在你可以建模或记忆的关系,证明学习算法有效,证明你能将知识注入模型。一旦能够过拟合,就可以压缩,而压缩就是获得泛化能力的方式。你并不是真的想记住眼前的数据,而是想泛化。因此,在数据集上过拟合之后,就可以反向推导,尝试找出能用尽可能少参数拟合的通用模式。
[36:14] 你对数据未来的预测是什么?也请谈谈数据在整个故事中的重要性。我喜欢这样一句话:互联网是一次性的数据补贴。我们免费得到了它。大约有 30 万亿个高质量文本 token;如果放宽对优质文本的定义,则有 300 万亿个 token,而我们基本已经看遍了。如今模型已反复见过整个互联网。来自互联网的人类数据已经没有太多可挖掘的了。下一阶段
[36:41] 在我看来,数据的下一阶段是通过 RL 环境健身房让模型自我改进。实际上,我们甚至不会从更多随机用户与 AI 的交互中获益。过去,我们很重视一种新型数据,也就是人们使用 ChatGPT 时的交互数据,以及他们向 ChatGPT 发出的喜欢什么、不喜欢什么的反馈信号。现在有一种说法我很认同:我们所服务的中位模型,已经远比随机人类提供反馈的能力先进,因此从随机人类偏好,或者说无条件的人类偏好中获得的信号,如今实际上已经不再有价值。你
[37:19] 此时需要的是专家的人类偏好。模型已经超越了普通的泛泛之辈。对,普通人。没错。所以对我而言,数据的特征是给模型一个困难且可验证的任务,让它在一个相对隔离的健身房环境中运行,只面对一个可以推进的问题,并能衡量自己是否在这个问题上取得进展。编程问题属于这一类,数学问题也属于这一类。而且越来越多地,我们可以直接给 Agent 一台计算机,让它像人类员工那样行动,并就它是否朝目标结果取得进展给出反馈。这个环境就成了数据。我认为这不算特别有差异化的观点,但就我目前所见,它非常非常有成效。
[38:01] 你认为这会持续很长时间吗?还是说,如果把互联网看作一个大板块,这也是另一个大板块,会有自己的高光时刻,我们把它用尽后,就得转向其他东西?我认为它其实比这更深刻。基本理念是:如果你想实现通用人工智能,最好的办法就是不断叠加专门智能,直到没有空白需要填补。这里的检验标准,唯一必须确保的就是任务可验证。你需要给模型一个自我评分系统。有了它,就拥有了让模型在任何任务上自我改进的配方。我认为,从前沿实验室的支出方式就能看出这点。他们过去在数据上的投入没有这么多,现在在 RL 环境上的投入多得多。这些环境完全捕捉到了在可验证任务上递归自我改进的关系。
[38:55] 好。好。我喜欢我们在这里岔开了几个小话题,但回到你最初的任务:让现有硬件更高效。是的。通过软件更好地掌控硬件层面正在发生的事。那就继续讲讲你目前做了什么、想做什么,之后我们会转到硬件,最后转到能源。听起来不错。是的,我提到了 kernel。令人惊讶的是,人们以为 kernel 已经做完了。还有很多优秀的人
[39:23] 像 Tri Dao 一样,能写出出色的 kernel,它们构成了所有现代深度学习的基石,现代深度学习建立在 FlashAttention 之上,现代 Transformer 也建立在 FlashAttention 之上。但只要稍微偏离常规路径,比如出现一个以略有不同的方式嵌入位置信息的新模型,例如 RoPE 系统发生变化,原有的 kernel 突然就不适合这个新模型了,我们可能必须给它打补丁。我不会说我们已到了必须从零发明新 kernel 的阶段,但能够快速修改现有 GPU kernel 很重要。抱歉,顺带说一下,kernel 是在 GPU 上运行的任何程序的通用术语。历史上,kernel 通常被放进一个库里,每个 kernel 的用途都非常明确。通常会有一个 kernel 用于矩阵乘法,甚至像加法这么简单的操作也有另一个 kernel。要把两个 tensor 相加,那又是另一个 kernel。
[40:15] 然后我们越来越多地开始把这些 kernel 融合在一起。所以如果我做了一次矩阵乘法,然后想把结果加到另一个也做过乘法的矩阵上,也许这两步会变成一个 kernel,我把操作融合起来,不必把数据写到 DRAM,再读回来只为做加法,也许就能直接完成。为什么人类还在做这件事?感觉 AI 应该特别擅长设计更高效的 kernel。也许这正是我们的去向,只是还没完全到那里。但如果尚未到达,那里是否就是我们的目标?如果还没到,为什么仍由人类来做?为什么 Tri Dao 如此知名?这是个名字
[40:51] 我知道。我不想替 Tri Dao 发言,但他教会我的是:不一定还要手写 kernel。我喜欢说,我们在白板上写 kernel。我们走到白板前,描述机器应该做什么,然后用自然语言把它简洁地描述给模型。随后模型就能执行:好,这是我的输入和输出;这是我们要如何把这项工作分派到 GPU 上的策略;我来实现
[41:17] 这个。所以,我们在做概念设计。没错。我不太确定为什么模型还不特别擅长这件事。我不认为这有什么遥不可及之处。我相信 6 个月后,模型在 kernel 工程上会好得多;我也相信实验室会告诉你,他们已经以全自动方式完成了大量 kernel 工程工作。所以软件作为一种优势,是的,如果我把软件理解为以尽可能接近光速的效率使用底层硬件,那么随着时间推移,它将不再是像你们这样的公司的优势。
[41:47] 没错。像 Mythos 或 GPT-5.6 Sol 这样的涨潮,会让所有船都浮起来。确实如此。我其实不认为值得专门去做一件事,比如让模型只在 kernel 工程方面做得更好。我认为这并不是通用编程中最有意义的细分领域,尤其是 kernel 工程。或许可以向 prompt 注入某些特权信息,以此有效引导模型更好地编写 kernel;但总体而言,是的,在这种能力上,我们都处于前沿的下游。
[42:20] 就这种能力而言。我一直很喜欢能源史中的这个现象:它总是在原始能源,比如煤炭,和一块煤中蕴含一定能量时我们能够利用其中百分之多少之间来回摆动。
[42:35] 驾驭并利用能源。一部能源史的重要部分,就是把那个比例从 10% 提升到 95% 或类似水平。对。那么我们现在处于什么位置?如果我把 Blackwell 之类的东西看作一块煤,Blackwell 就是那块煤,你觉得我们现在大概利用了其中的百分之多少?如今我们能够多高效地利用现有的一块煤?分析这个问题有很多不同的方法。我认为,在某种意义上,当 GPU 正在做它最擅长的事,也就是大维度矩阵乘法时,我们确实非常擅长优化其性能。那类操作的运行利用率能达到峰值的 70% 到 80%,限制它的不是软件,而是功耗。Nvidia 报出的峰值 FLOPS 有点乐观。由于功耗降频,你永远达不到那个数,不过。因为发热。对,没错。热设计方面,假设能到 70% 到 80%,就已经饱和了,相当不错。
[43:24] 但在实践中,你的大部分时间并不会花在 Transformer 的那条理想路径上,即执行大批量矩阵乘法。所以,我们的工作本质上是在芯片周围构建引擎,确保始终向 GPU 输送这些大批量的任务。过去一年,GPU 世界最深刻的转变之一是:你不再一次只编程一张 GPU,而应当从整个机架着眼,甚至同时从整个集群、整个数据中心着眼。Nvidia 也开始不再只交付单张 GPU 或单块主板,而是直接规定整个机架系统。他们称之为 NVL72。他们最新的芯片 Grace Blackwell 300 就以包含 72 个单元的机架形式交付。如今是一场公开的竞赛,看谁能最高效地编程这台机架规模的计算机。我相信,这种计算形态是效率和速度的未来。事实上,Nvidia 做得很出色:如果你想要尽可能低的延迟,就应该使用那款芯片;而截至目前,如果你想要尽可能高的吞吐量,大概也应该使用那款芯片。
[44:29] 归根结底,这是一个非常新的编程范式。人们常说,最好的芯片,比如 Blackwell,现在的市场像毒品市场。为了尽可能多地拿到它们,发生了各种耐人寻味的事情,因为人人都极度缺货。我很想听听你对这个比喻的看法,实际感受是不是如此?另外,也请谈谈并非最前沿的芯片的市场。如果我愿意接受性能略差或中等程度差一些的芯片,市场会是什么样?
[44:57] 那个市场是什么样的?带我们了解一下那个世界。好,有几点。第一,Nvidia 对所有芯片基本都抱有长期视角。他们看到市场对 Blackwell 芯片的巨大需求,也可以像过去其他供应商那样,大幅提价,让市场自行调整,供需曲线终会在某个点相交,理论上每个人都会更满意。但 Nvidia 认为,如果他们只是让资金最雄厚的买家买走所有芯片,长期来看可能会伤害自己。
[45:26] 因为如果那位客户最终积累了更多权力,他们明白如今计算能力就是权力。所以,他们在如何分配计算资源上非常有策略。这是第一点。第二点是,关系非常重要。没有人愿意收到一家新创公司的大额芯片租赁订单,对方说:“噢,对,我要租 10,000 张 Blackwell,租三年或五年。”这家初创公司通常才运营几个月,谁知道它是否有付款能力。如今,要说服别人让你获得计算资源相当困难,需要非常好的关系,或者惊人的资金实力,才能在 Nvidia 那边促成这件事。这全是因为稀缺性极高,需求爆表。至于其他芯片,我甚至不会称它们为次等芯片。我喜欢说,没有坏芯片,只有糟糕的定价。
[46:17] 只要价格合适,我会让任何芯片发挥作用。这算是公司的一条理念。再谈谈 AMD。我认为 AMD 的芯片整体非常好,挑战在于人们不太懂得如何高效地为它们编程。所以,我一直在和你说,我们有一支多么出色的 kernel 团队。我们极其认真地从硬件中榨取性能。Nvidia 很擅长为自家芯片做这件事。坦白说,我们能挖到一些 alpha,但在其他芯片上可做的事情其实多得多,因为供应商在提供开箱即用的最佳 kernel 方面,比 Nvidia 做得略少。对我来说更好的是,这里存在 alpha。就像其他人认为 AMD 不如 Nvidia 一样,这种看法正中我下怀。我很乐意让他们忽视这款芯片,而我尽可能多买一些。
[46:59] 不过,我觉得这现在其实已经不太成立了。我认为 AMD 在一些大买家中颇受欢迎。公开信息显示,Meta 和 OpenAI 都买了大量 AMD 芯片,所以我们越来越看到,所有 AMD 供应也都在被分配。不过还有一长串其他公司正在涌现,纯新增的公司很棒,比如 Etched、SambaNova 或 d-Matrix,这些公司都在出现。我认为它们面临的主要挑战是规模:它们能否从 TSMC 获得足够的晶圆配额,生产出芯片并推向市场?当然,只要市场上出现新芯片,我都希望尽快知道,并评估我们能否买到相当大一部分供应。
[47:41] 所以这从根本上说是你的套利机会。如果你能更擅长从那些受到较少关注的芯片中一点点挖出性能,随后就能以利润转售,这可能是一门很好的生意。没错,没错。我不认为其他人只是技术不行,所以无法让这些芯片发挥同样好的效果。我们在这方面相当有能力。我认为我们大概是世界上最擅长使用多种硅架构、并积极在意想不到的地方追逐性能的团队之一。但我认为,关键在于我们愿意以多快的速度围绕一款新芯片构建技术栈。我们没有太多既有包袱,比如数据中心供应商只能使用某一类芯片,以至于部署这些全新的芯片会变得极其痛苦。我们有一些非常有创造力、愿意快速行动的数据中心合作伙伴,也有一类新伙伴可以聊。最重要的是,我们不回避这个挑战。这就是。
[48:33] 坦白说,其中很大一部分就是直接说:是的,我们喜欢 TPU,我们要让 TPU 发挥作用。是的,我们喜欢 Trainium,我们要让 Trainium 发挥作用。如果它不能轻易发挥作用,我们就会想办法把它纳入异构服务系统。它会有自己的位置。每种芯片都有比较优势,我们必须找到这种优势,然后朝那个方向充分利用它。在我们进入硬件、数据中心、能源等话题前,这只是一个插曲,那会是对话中非常有趣的部分。我想请你谈谈你对投资者群体担忧的看法。好。
[49:05] 比如你看看存储芯片股。或者我现在最喜欢看的,是一张展示标普 500 中半导体占比的图。历史上大概是 2%、3%、4%,现在是 19%、20%、21%。如果你研究市场史,就会发现这类东西会在某个时期达到疯狂的短期峰值,随后崩回长期常态。我好奇,这为何让所有投资者都感到担忧?是的。你知道,很多人在 Micron、SK hynix 以及这类公司上赚了很多钱,但大家都觉得,从长期看,计算是一种商品,它不会占全球总市值的四分之一或五分之一,所以他们害怕,这就是背景。所有人都承认存在巨大短缺,但大家又觉得,我们总会解决,这些东西会回落到它们在资本市场中的正常位置。我很想知道你怎么看这种叙事。有一点,与其说我是历史的学生,不如说我是历史的参与者。
[50:05] 我出生于 1997 年。我妈妈在 2000 年前后的互联网泡沫繁荣与崩盘时期在 Intel 工作。你知道,我记得 Cisco 曾是全球市值最高的公司,Intel 紧随其后。我的意思是,我主要把 25 年前的那段历史与今天作类比。我认为主要区别是,历史上对网络设备的许多投资都带有投机性。我们预期会有未来的用户需求,但它从未到来。我认为 token 消费,或者更广义的 AI 消费,有意思的地方在于它不再是投机性的。人们购买 token,因为它们立刻对自己有价值。你不会囤积 token,而是立即使用它们。这甚至不同于两年前的情况,当时 2023 年和 2024 年 Hopper 一代芯片供应紧张。那时所有支出都面向训练,而训练本质上具有投机性。如今,所有人都在给自己在 Claude Code 上的花费设上限。这是一个非常不同的世界。
[51:01] 现在谈论的是推理支出,并预测推理支出会上升。我确实认为推理支出会单调增长。推理支出不存在投机。Vanta 为 Ramp、Cursor 和 Harvey 等超过 16,000 家快速发展的公司自动化处理安全与合规,让它们全天候保持审计就绪。它是排名第一的 Agentic Trust 平台,如今还能帮助像你们这样的公司监控在审计之间、涉及供应商、AI 工具和整个[音乐]环境中出现的风险。你们团队注册的每一款新工具、每一家开启 AI 功能的供应商,[音乐]都可能成为出问题的机会。而大多数安全项目的设计并不是为了应对 AI 的增长速度。Vanta Agent 就像一名全天候在后台工作的 GRC 工程师,发现问题、为你起草修复方案,并将供应商评估时间最多缩短 50%。无论你是快速成长的初创公司还是全球企业,[音乐]Vanta 都能帮助你赢得并证明信任。像最优秀的听众一样投资。获取特别优惠。
[51:54] 访问 vanta.com/invest,即可获得 Vanta 1,000 美元优惠。Ridgeline 是首个为投资[音乐]管理公司打造的端到端记录系统,内置 AI,可在一个统一平台上运行投资组合会计、对账、报告、交易和合规。各公司正从旧有技术迁移至 Ridgeline,因为 Ridgeline 的 AI 功能远领先于其他任何投资[音乐]管理软件。我一直听许多投资经理谈论 AI,他们大致分成两派:一派甚至不确定从哪里开始,[音乐]另一派则坚信他们一个周末就能自己构建订单管理系统。
[52:28] 现实是,运营一家投资公司始终需要治理、[音乐]控制措施,以及数据的单一事实来源。无论对 AI 多么热衷,都不会改变这一要求。如果你认真对待公司的 AI 战略,Ridgeline [音乐]就应当成为这场讨论的一部分。你可以在 ridgeline.ai 申请演示。现在回到你对硬件的看法。单元层面让我很感兴趣,我们谈了芯片、机架、集群。我很想谈谈数据中心。你说过,你有一些有趣的合作伙伴正在做一些很酷的事。请谈谈在你看来数据中心的现状与未来。
[53:04] 是的。因为显然,要支撑所有这些推理,关键在于这个领域的大量创新,而你显然正专注于它。我认为我们对话中的一个主题是,训练与推理究竟是什么,它们这两类有什么区别?两年前以训练为导向,与今天以推理为导向,有什么不同?我认为整个 AI 技术栈中最保守的参与者必定是基础设施方,无论是数据中心,还是更保守的芯片基础设施方 TSMC。
[53:30] 呃,所以从历史上看,数据中心都是按 AI 数据中心的方式建设的,面向训练。训练是涵盖推理的更广泛工作负载:任何训练集群都可以用于推理,但反过来未必行。二者的区别在于网络,也就是你在芯片之间的带宽上投入多少,以及需要多大的集群。实际上,数据中心在某种意义上存在规模不经济:在一个数据中心里部署 10 万块 GPU,比部署 1 万块要昂贵和困难得多,而部署 1 万块又比部署 1,000 块要昂贵和困难得多。如今我们只讨论你有多少兆瓦或吉瓦的电力,而且
[54:05] 基本上,如今在美国已无法轻松建设一个吉瓦级数据中心。哪怕 100 兆瓦也越来越难,除非你属于极其特殊的一类客户,否则基本不可能。呃,10 兆瓦大概已处在当下可实现规模的边缘,而我会说 1 兆瓦的供应很充足。因此市场上存在这样一种奇特现象:你能找到大量汇聚起来的电力,但它不会集中。这对建设训练数据中心的人毫无吸引力,因为他们默认一切都得在一个地点,没人想处理跨数据中心训练。
[54:40] 所以市场存在一些滞后。我认为市场仍然认为,必须尽可能去争取那些 100 兆瓦和 10 兆瓦的数据中心,我从许多数据中心开发商那里听到的仍是这种态度。但我们越来越看到一些有新想法的人意识到,推理适合这些分布式的 1 兆瓦数据中心。呃,我们完全认同这一点,也非常乐意在全美购买小型算力池,并将其用作我们的推理集群。请具体说说,1 兆瓦相对于 10 兆瓦,实际物理尺寸有多大?
[55:12] 是的。随着液冷的出现,这件事变得非常专业。如今,你可以在单个物理机架中塞进惊人的功率密度。你会把一兆瓦算力想象成一个巨大的数据大厅,基本就是一座大型仓库。而现在,实际上大约八个机架就能装下这么多算力。每个机架大约和一台冰箱一样大,你可以想象八台并排放着。呃,对,这就是一兆瓦。所以你的看法是,你想帮助构建的未来,是许多不同芯片能够一起使用。是的。
[55:46] 也就是你可以买到这些芯片,你作为买家,要尽可能从每块芯片中榨取价值。然后这些芯片可以在非常小的数据中心中耦合起来,只做推理。大量零散算力,其中有些价格低于应有水平,加上你从中挖掘更多价值的能力,再加上数据中心中小型的部署单元,就等于便宜得多的智能。我当然这么认为。是的,只要你能创造性地选择接入哪些资源,就有很多方式能获得更便宜的 FLOPS。因此,我描述我们所做事情的一种方式是:我们会在世界任何地方购买任何芯片,时长不限。这种灵活性和流动性,我认为目前无人具备。呃,我们非常坚定地用行动证明承诺,真的会接入任何容量,并找到让它在我们集群中发挥作用的办法。这是我们今天优势的重要组成部分;长期来看,我们必须通过投资这些其他人会怀疑的数据中心,来创造更多这样的优势。因为你知道,当你建起一支由一千个小型数据中心组成的军队,而不是一座大型吉瓦级数据中心时,会发生什么。嗯,有几件事。
[56:54] Frank,你通常不会有电力冗余。现场不会有备用柴油发电机,那些都非常昂贵。我们会削减所有这些开销。很多情况下,我们甚至不会有冗余网络。我们会把它们部署在电力接入良好、只有单一电源的设施中,并向这些数据中心铺设一条光纤线路;但不会铺设三条具备冗余、故障转移和 SLA 的光纤线路。有时它就是会宕机。事实上,即便其中一些的正常运行时间降至大约 95%,我也不会惊讶,而这很糟糕。
[57:20] 非常糟糕。对其他任何人而言,这都是致命的、糟透的。在大型吉瓦级数据中心的场景里,正常运行时间只有 95% 的数据中心基本不会有买家。我就是第一个买家,我会买 95% 正常运行时间的。原因在于我说过的后台引擎:如果有些任务在后台运行,你并不在乎。部分原因如此,呃,实际上有两点。其一,我们拥有非常强大的控制平面,只要故障不与其他数据中心相关联,它就能妥善处理任何单个数据中心中的任何单点故障,我可以把工作负载迁移到别处,我对此没问题。故障会以某种频率发生;对我而言,正常运行时间为 95%、98% 或 99% 的数据中心,其好坏基本呈线性变化。这
[57:58] 对我而言只是线性地变好或变坏。嗯。现在,你确实需要我提过的异步部分。我们服务这些长时程 Agent,因为一旦某个请求失败,我就得找一块新的 GPU 来承载该请求。这意味着,在 Agent 工作的这一个回合中,它已经运行了一小时,却因为它的 GPU 被撤走而遇到障碍。在那一刻,这个 Agent 可能会多经历一两三分钟,甚至 10 分钟的延迟。但我的观点是,客户并不在意,因为他们的 Agent 已经运行了
[58:32] 几个小时。它们在睡觉。没关系。[笑声]偶尔某一个回合变得稍微久一点并不重要。是的。我们会告诉客户:看,我们的平均吞吐量会非常有竞争力,但 P99,也就是第 99 百分位延迟,将无法控制,也不可能被控制。作为回报,我会给你无可匹敌的经济性。我认为这正适合后台 Agent。谈谈电力这个类别。你看到了哪些有趣、创新的事?你认为它将如何发展?好吧,我说过我希望我的数据中心有 95% 的正常运行时间。如果价格合适,我甚至能接受 80% 的正常运行时间吗?
[59:04] 大概可以。呃,这意味着什么?我是加州之子,我喜欢太阳能和风能。我认为美国对太阳能和风能的利用远远不足。挑战一直在于其间歇性。你甚至会认为太阳能和风能不适合数据中心,因为你有持续的基础负载,却有间歇性电源,那该怎么办?我认为我们其实离解决这个问题已经不远了。我完全能容忍数据中心发生以天甚至周来计的停机,这正是数据中心最糟糕的噩梦情景:因为风不吹、天空有云、雾在山谷上空盘桓一段时间,导致长期停机。这就是最坏的情景。
[59:41] 事实上,这高度可预测。每当发生时,我只需从世界其他地方调配容量。呃,我可以对天气建模,算出我的数据中心何时会离线,把我的工作负载迁移到别处,就没问题。诀窍在于,这会让我更好地获得其他人不会碰的电力,因为处理这种停机实在太麻烦了。如果我的芯片足够便宜,它们大概不会是 Nvidia 机架。如果我的芯片足够便宜,我不介意拥有闲置芯片的资本成本。是的,我听你把整个系统描述为一种拾荒
[01:00:13] 策略。没错。是吗?对。稍微展开讲讲这个比喻。首先,我们拾取芯片,然后为这些芯片拾取电力。我的想法是,两种情况下我都不想与 Anthropic 或 OpenAI 竞标算力容量。我赢不了他们,也不想赢。我想更有创造性,利用他们如今无法识别价值的供应。随着时间推移,我积累足够多的聚合供应。我永远得不到集中供应,只能得到聚合供应。随着时间推移,我建起一座在经济性上无可匹敌的聚合工厂。
[01:00:43] 我们正在建设一座工厂。我们试图建造世界上最好的钢铁厂,呃,但它会通过小型钢厂实现,而不是大型单体钢铁厂。如果我设想这一模式的不同版本,比如你能实现多大程度的垂直整合。是的。一种极端版本是你拥有一切。因此这是资本密集型业务。你拥有电力来源,建设数据中心,设计自己的芯片。
[01:01:09] 你控制能从这些芯片中榨取最多价值的软件。然后把最终产出的 token 卖给用户,比如你的用户就是我,你拥有整个技术栈。但你可以想象该业务还有许多其他组合。无论你把边界画在哪里,你都可以极度轻资产,一无所有,只充当协调平面,协调所有这些东西,成为虚拟拾荒者,对吧?
[01:01:35] 你如何思考该成为这些业务中的哪一种?你知道,回答这个问题的我其实有两个部分。一个是公司的 CEO,他需要让公司每天正常运转,并以尽可能可持续且快速的方式成长。另一个是创始人,创始人更富想象力,而且就热爱这些事。作为创始人的我想做一切。这是我的整个人生。我一生都在思考芯片、电力、能源,这些就是我关心的一切。所以我当然想要最大程度地雄心勃勃,我永远不想停下。直到我从头到尾建成最高效的系统,我绝不会停止。
[01:02:08] 你基本上是在做现实世界里的阶乘运算。没错,非常如此。所以这就是面对那个难题时情感层面的答案。站在 CEO 的角度,我认为我们必须更务实一些。正如你所说,要拥有一切所需的资本简直高得离谱。软件的杠杆效应很高,所以我们必须从软件起步;但最终,我们是要拥有发电能力,还是能与公用事业公司签下很好的购电协议?我更倾向于让其他人专注于他们历来擅长的事情,再看看我们能否达到那个规模。我把它看作是:我想达到一个规模,赢得把这件事纳入我们羽翼之下的资格。我绝对认为,整个技术栈的每一层都有可以获得的效率。如果你能打破那些我将向其购买产品的人所作的假设,他们已经假定了自己的客户会是谁,而我或许可以打破这些假设。这是相当乐观的看法。我认为这之所以可能,只因为我们实际上正试图为计算史上最大的计算市场提供资金支持。
[01:03:04] 我们实际上将为推理投入数以十亿、万亿美元计的资金。正因为聚焦于此,为推理定制大量东西就很合理。我的工作是找出所有可以这样做的地方。然后,随着这些地方对我和我的合作伙伴变得明确,我会让合作伙伴为我打造定制化的东西;如果他们做不到,我就自己做。如果把整个系统,包括软件、硬件、能源等,拉远来看,并对我们今天在产出有用的智能 token 时效率最低的环节进行排序,会是怎样一份清单?
[01:03:40] 是的。那份清单是什么样的?我认为,计算扩展实际上非常高效。也就是说,你给我更多 FLOPs,我就会用更多 FLOPs。我会说,我们在使用 FLOPs 时其实已经相当审慎。看看现代模型,密度超过 10% 的模型非常少,这意味着可激活专家总数中只有 10% 被激活。我认为前沿模型接近 1%。所以已经相当稀疏了。我不认为我们在 MoE 这一侧浪费了太多。人们研究这个已经很久了,他们很擅长把它压榨到极致。
[01:04:12] 我们不擅长的是注意力机制及其对内存的使用。具体来说,KV cache 现在的压缩程度相当低。我认为,如果看看 KV cache 中的熵,它远不足以让这些存储物有所值。我们每个 token 在 KV cache 中存储了好几 KB 的数据,这大概差了一到两个数量级。我不知道 Frontier Labs 在做什么,但 DeepSeek 确实发表了非常有意思的工作,持续把它压缩得更小,而且进展不错。我认为,他们大约每年都能在这里取得一个数量级的进步,这说明还有很大的提升空间。我想这些都只是微观层面。如果再拉远一些,我认为我们根本没有有效地调度计算资源。世界上有这么多算力,Nvidia 今年在生产 500 万颗 Blackwell 芯片,它们都去哪了?
[01:05:00] 它们真的始终都在被使用吗?我很怀疑。我认为,在某个层面上,我们只是需要更好地在全球范围内编排计算资源。这很难做到,因为大量算力消失在永远不会重见天日的私有算力池里,那些 GPU 就可悲地闲置着。看到那些 GPU 让我生理上感到难受,硅和电力都投入进去了,它们却只是闲置,我想解决这个问题:如何把全球算力组织和编排为共享资源,并更高效地塞满它。我估计,大家都会取笑 xAI 的集群在总 FLOP 利用率上有些挑战,但现实是,世界其他地方要糟糕得多。大量 GPU 只是放在仓库里,或放在分配给某个特定客户的私有资源池里,根本没有得到利用。
[01:05:47] 你是在非常直接地攻克这件事的效率问题。这有效得多。是的。那晶圆厂呢?你认为晶圆厂本身的未来是什么?我想所有人都在问,存储厂商、TSMC、Intel 等能否扩大产能,或者说它们将如何扩大产能?是的。我们会在美国做这件事吗?嗯,是的,谈谈芯片制造本身。如果我们只要打个响指,就让如今现货中的芯片数量增加 100 倍,token 可能会便宜得多。所以,这似乎是这个领域里很重要的一部分,我想听听你的看法。是的。很有意思,一切都彼此平衡地增长,对吧?
[01:06:28] 如果我们打个响指,把所有这些东西都翻倍,你或许能解决一个 TSMC 瓶颈,但接着只会撞上另一个瓶颈。你多造 20% 的芯片,马上又会有另一个瓶颈。不过,有意思的是他们认为什么是必须交付的,什么是他们认为客户,也就是我,永远都会想要的不变量,而我认为这是一种更流动的关系。如果一家晶圆厂向我披露更多它们的权衡取舍,我就能更明智地决定自己能做什么。其中一个最有意思的例子是,
[01:07:01] 任何一家晶圆厂从生产线下来的最差芯片和最优芯片之间都有很大的差距。芯片制造存在很大的方差。问题是,像 TSMC 这样的公司会非常努力地收紧我们所说的这些工艺角。我们希望最差芯片在特性上尽量接近最优芯片,而他们有很强的动力让这成为可能。但这意味着他们在流程中加入了许多我或许并不需要的控制。也许我其实愿意给最差的芯片找一个用武之地。你不需要那么严格地收紧工艺控制,而那会耗费更多时间和成本。也许我愿意接受更多不合格品。
[01:07:38] 我认为,对我们而言,这是围绕裸片成本、裸片供应,以及电力成本和可部署地点做更全面的优化。我的整个目标是大幅扩大美国各地的电力供应,让许多原本无法在数据中心赢得一席之地的芯片有地方可去。我们能谈谈你是如何设计自己公司的系统吗?你学到了哪些经验?你提到了一些有意思的 Nvidia 经验。是的。
[01:08:06] 那就带我了解一下这种文化,以及你们如何构建一个以此为北极星的团队和企业。我认为,我们有很多从极限状态出发的思考。我们不担心眼前的情况,例如刚开始做一个模型时,效率不会很好;我们会思考一个月、六个月或一年后可能会走到哪里。我们不接受所使用机器的状态是固定不变的。哪怕是 Blackwell 芯片,如果我们认为有某个瓶颈阻碍了我们实现这种性能,对我而言,极其重要的是我们充分理解并刻画它,然后把它写下来。这样我们既可以告诉 Nvidia 和我们的朋友,也可以在未来购买芯片时牢记这一点。我们想学到那些我们认为对自身或公司长期而言本质上不变的东西,并将其融入未来的决策。我们非常强调协作。我认为,我们寻找的最重要特质之一,是既是好学生又是优秀老师的人。
[01:09:09] 我们团队里很多人大学时当过助教,也热爱以这种方式分享知识的体验。我们一直在做白板讨论,我认为,人人都有东西可教、也有东西可学的同侪环境对我们极其重要。你认为,在三年后更多事情由机器处理的工作环境中,想招聘什么特质的人,才能保持韧性?好奇心,百分之百是好奇心。有一件事我无法教,那就是对性能的热爱,对深入研究机器运行的每一微秒、理解那一刻机器中发生了什么的热爱。对我来说,这是性能工程师最重要的特质,也是我寻找的东西。我不寻找很多 AI 经验,也完全不寻找 CUDA 经验。那其实是一个巨大的误导。CUDA 作为一个概念,或 GPU 作为一个概念,在过去五年中都演变得太多了。根本没有必要
[01:10:03] 要求十年经验。我想教会人这些,但我无法教会他们对性能工程的热爱。这才是我寻求的。你能逐一评估各大实验室,也谈谈闭源作为一个类别与开源之间的关系,以及你认为正在发生和将会发生什么吗?我会说,实验室为了领先其他一切三到六个月,付出了极高的溢价。我认为这大概仍然值得。我认为 OpenAI 和 Anthropic 所做的事情完全合理。你知道,围绕蒸馏有一个敏感话题,我认为它是闭源前沿与开源前沿之间关系非常核心的一部分。而且
[01:10:40] 我想就此提出另一种看法:人们认为蒸馏是盗窃,你在对前沿模型的输出进行蒸馏时,是在从它们那里拿走某些东西。事实上,即使这不是你的意图,即使你从不尝试从 Anthropic 抓取数据,我想指出的是,我们放到互联网上的内容中,由 AI 生成的产物占比正越来越大。即使只看 GitHub,我们认为过去一年创建的仓库中,有多大比例是由 Claude Code 创建的?我们认为那算蒸馏吗?因为那可能就是我们所需要的一切。如果你只用 GitHub 上你认为优质的开源代码输出,来训练一个前沿级模型,我一点也不会惊讶。而且
[01:11:18] 当然,如果我们采取这样的立场:用户拥有自己与 AI 交互的输出,并选择把它放到 GitHub 上,而很多人确实这么做,那么我们将长期存在潜在蒸馏。对我而言,这似乎从根本上不可能阻止。我不认为从根本上能够阻止信息或模型能力的扩散,它一定会发生。问题只在于速度有多快。接下来的问题便是,扩展定律和改进定律会永远成立,还是会在很长一段时间内成立?如果会,那么领先三到六个月就有价值;这种状态会持续多久就持续多久,而他们可以相对于非常便宜的开源 token,为那些 token 收取极高溢价。这是正确的思考方式吗?
[01:11:58] 我认为有可能。我不知道领先三到六个月的溢价会持续那么久。看看企业部署,它们不会以三到六个月的速度行动。很多企业可能还在使用 4.6、Opus 4.6 或 Opus 4.7 之类的版本,它们不会迅速采用最前沿的东西。人们对推出任何变更都有很多疑问。我们现在还只是刚刚触及表面,所以我认为根本无法在这场竞赛中判定胜者;当然,我甚至不认为这是一场能够被决定胜负的竞赛。它始终是一个持续的过程,而且从根本上说,我认为开源永远不会消失。如果一位领导者离开造成真空,新的领导者就会进入。还存在太多……
[01:12:37] 激励很足,顺风因素也很多。只是,训练一个前沿级模型每天都在变得更容易。那么,你希望未来是什么样?比如,封闭与开放之间应如何平衡,模型公司因拥有整套技术栈而包揽一切又该如何平衡?Anthropic 能做到这一点,像新的 Google 一样,Google 能不能也这么做?你希望未来是什么样?我想要充裕的 token 和多样的 harness。我希望每个人都构建自己的 harness,让每家公司、每个用户,甚至每个人都能让 Agent 成为自己的。呃,我认为我们离那种定制化程度和能力已经不远了。我希望人们拥有自己的智能,也希望这种智能可以定制,可能不是通过权重微调,而是通过更多的 in-context learning。这是更技术性的细节。但通往这个富足未来的底层投入,基本就是廉价的 token。我的工作是让 token 尽可能便宜。我会做到,并会利用我能动用的技术栈中每一层来做到这一点。我喜欢供给侧杠杆。我会用每一种芯片、每一种电力来源,并利用美国境内每一块适合此事的土地,而且……
[01:13:45] 作为回报,人们就有动力去探索拥有充裕智能是什么感觉。我们仍把 Agent 当作一个咨询成本高昂的人,遇到难题才该去问它。这不是看待智能的方式。机器能够思考,这太不可思议了,我们应尽量把它交到尽可能多人手中。你所处的位置非常独特,对于如何让这一未来成为现实,你也有独特视角。相较于那些消息灵通且对此感兴趣的朋友,你认为自己哪些世界观最有分歧?哪些想法会让朋友觉得你像长了三个脑袋?
[01:14:21] 我会说,大多数都和芯片有关。谈到打造定制芯片时,他们会问我:“哦,那有什么不同?”本质上,是要绕开 HBM 短缺,并更多地卸载到闪存等其他形式的存储器。我对这个想法非常投入。团队里每个人都知道,我一直在强调:我们必须怎样改变模型架构,才能让把 KV cache 卸载到闪存这件事在更大程度上可行。我一直在白板上推演这个。在推理从业者圈子里,对于如果围绕每秒服务 1 到 10 个 token 来设计系统,可以做什么,我们有些不同看法,而这正是我们整体的北极星目标。更广义地说,还有一个更大的问题:人们怎样每天消费一万亿个 token?这是我们希望创造条件让他们能做到的世界。
[01:15:11] 一万亿个 token 到底是多少?帮我们具体感受一下这个量。一万亿个 token,嗯,按 OpenAI 的定价,若是 5.5 或 5.6,至少要 500 万美元。是的,我认为美元可能是最好的衡量尺度。对。那是数百万美元。对。那么,在怎样的世界里,每人每天会消费相当于如今 500 万美元的东西?对。我的意思是,我们至少需要把每 token 成本降低三到六个数量级。把它降到 5,000 美元,你可能就会有一些客户。而且……
[01:15:40] 事实上,我会说,对于某一规模的模型,我们正接近让一万亿个 token 的成本以数万美元计量。你可以想象为单个任务运行它。你会不会担心,普通人根本做不到、也不会这么做,就像他们现在也不会用自己的大脑这么做?也许世界对智能的需求其实没有那么大。我永远不会相信这一点。世界永远有对智能的需求。我认为,作为产品社区,我们面临的挑战是如何为这种智能铺设入口。我不是产品人,所以不能说我有最好的愿景。
[01:16:13] 你想赋能那些人。我想赋能那些人。我不希望他们受制于这样的想法:“哦,我的免费版用户用不了它”,或者“我负担不起给他们这么多 token”。我总是从客户那里听到这种话。我们想解决这个问题。反过来的问题呢?不是你觉得什么最疯狂,而是你认为哪个共识是错的?我反复想到的一件事是 Nvidia。我短期看多 Nvidia,而且你永远不该押注它会失败,它总会重塑自己。但从根本上说,有一点会让人惊讶:当我告诉他们,如果看 Hopper、Blackwell 和 Rubin,并做同类比较,BF16 矩阵乘法的每瓦性能其实没有提升那么多,或者再进一步看 TSMC,比较 TSMC 的 5 纳米、4 纳米、3 纳米和 2 纳米,这些芯片的每瓦性能也没有发生巨大变化。
[01:17:06] 因此,人们会因地缘政治而抓狂,比如如果我们因任何原因失去 TSMC 的供给会怎样。我的逆共识观点是,情况不会那么糟。供应肯定会受到冲击,但西方现有最好的工艺,比如 Intel,落后得并不远,最差可能也只是每瓦性能差 2 倍。如果你追随芯片圈的讨论,差距会被说得很大,但实际远小于你以为的程度。还有什么……
[01:17:33] 人工智能领域还有什么正在发生,却不在你的路径上?也就是说,它不是这个系统中某个组成部分,而你最终会想做的正是其中最令你感兴趣的事。嗯,我们完全处在模型的下游,对吧?模型团队可以决定如何设计架构,而我的参与非常有限。我的意思是,我对 OpenAI 或 Anthropic 没有任何影响力。我只能祈祷它们朝对我最有利的方向发展,或者尽力预测我认为它们会走向哪里,并据此构建我的服务架构。两者……
[01:18:04] 它们所做的软件和硬件选择。我认为某种意义上最有意思的博弈,再次回到了机器思考的深刻性,以及选择稀疏注意力而非稠密注意力会带来多大影响,或者使用不同数据类型会带来多大影响。比如我们以前用 BF16 训练,现在可以用 FP8 或 FP4 等更低精度的数据类型训练。这感觉像是任意选择,却会深刻影响我能使用哪些芯片,以及我该如何构建硬件、思考计算的未来。如果有 100 位企业家在一个房间里,他们都想创办一家新的计算创业公司。是。
[01:18:41] 假设他们特别想做硬件芯片、系统、机架之类的东西。对于他们应如何定位公司、应成为哪一类公司,而不是在某个技术押注上做出何种具体选择,你会给什么建议?因为看起来我们会尝试一切,这对世界会很好。有些东西会奏效。但如果你必须建议他们如何定位业务,才能在这个即将到来的世界里成功,你会说什么?一切都取决于供应链瓶颈。因此,你首先得说服我或说服投资人,你理解决定现代芯片供应的三到五个瓶颈:TSMC 的晶圆产能、HBM 产能、先进封装,第四个或许是电力。
[01:19:20] 比如,你从哪里获得电力?怎样搭建这些机架?我想听到的是,你应当对这四个瓶颈中的每一个都有很好的答案,也要说明如何绕过它们,因为归根结底这全是套利。你要造芯片,是因为你认为 Nvidia 做了一些令其难以改变的选择,而这确实如此。Nvidia 做了许多难以改变的选择。它们并不完美,只是平衡得极好。因此你要走尖锐、偏专门化的路线。你要选定一点,并说:“我认为他们低估了 HBM 将会多么短缺的影响。”
[01:19:49] 我们会改而在另一个方向上全力推进。顺带说一句,我确实认为这大概是最值得攻克的方向。为什么?没有简单的办法能快速增加大量内存晶圆厂,而那些厂商一直……所以还要过一段时间我们才能……对,对。Boise 的那些人不喜欢为周期性行业做巨额资本支出。他们已经因此吃过很多次亏。但可以想见,正因为这种短缺,世界会通过让系统中其他一切更高效来绕过它。
[01:20:18] 我认为他们会让其他一切都变得更贵。想想 iPhone 会削减内存,iPhone 会涨价,而我们只能接受。为什么 Nvidia 不直接走到终点,自己卖 token?你觉得呢?Nvidia 在这方面非常聪明。他们不和客户竞争。Nvidia 对一切都着眼长远。为什么他们甚至不从 NeoCloud 开始?为什么不直接从后门卖算力?Nvidia 非常擅长这个。Jensen 很擅长让朋友成为亿万富翁。他把 CoreWeave 打造成了一家价值数十亿美元的公司,而且还有许多这样的公司。他没必要破坏这份善意。
[01:20:50] 他想创造一个多元化的 NeoCloud 和推理服务商生态,它们都在竞相为 Nvidia 创造需求。这样,如果其中任何一家决定,我不知道,垂直整合,或者转向 AMD 或其他选择,他还有另外三家饥渴地准备填补那个位置。让买家之间竞争很棒。我最喜欢问每个人的收尾问题是:别人为你做过最善意的事是什么?最善意的事,我的第一反应是这些年来我遇到的所有导师。这是一个……
[01:21:18] 这样的人很难得,他们会从日程中抽出大量时间,并且实际上把确保你理解某件事、教会你某件事,或将某种价值观灌输给你当作自己的事。他们觉得你已接近理解,只需推你跨过那条线。之前提到的 Nvidia 里很多人,都让我对性能工程产生了那种热爱。还有我大学里的教授。我记得大二时的导师,我那时非常没耐心,跑到他的答疑时间说:“我想造 AI 芯片,我知道自己想做什么。为什么还要浪费时间上这些基础课、网络课和操作系统课?”他只是看着我,基本上铺开了整个技术栈,让我看到理解这个拼图中每一块的深度与美妙。
[01:22:05] 他让我不要再只关注系统的某一个部分。他说,真正能理解从门级硅芯片一直到构建出色的互联网规模服务的整个技术栈的人极其罕见;你应该立志在自己的一生中达到那种理解水平。这实在是一种非常非常罕见的特质,而追求这种程度的专业能力是非常高尚的。我至今仍深受这番话影响。这不是常见的建议,而是一句忠告。Neil,精彩的对话。非常感谢你抽出时间。
[01:22:37] 非常感谢邀请我。你知道微小的优势会如何随时间复利累积吗?这在投资中如此,在经营公司时也同样如此。[音乐]你的支出系统就是你的资本配置策略。Ramp 默认就能让它更智能。更好的数据,更好的决策,长期更好的经济效益。访问 ramp.com/invest 了解详情。随着业务增长,Vanta 会与你一同扩展,实现合规自动化,并为安全与风险提供单一事实来源。访问 vanta.com/invest 了解更多。[音乐]从 OpenAI 到 Cursor 再到 Perplexity,最优秀的 AI 和软件公司都使用 WorkOS,让自己一夜之间而不是数月后就具备企业级能力。访问 works.com,[音乐]跳过那些不那么光鲜的基础设施工作,专注于你的产品。
[01:23:21] Ridgeline 正在重新定义资产管理技术,将自己定位为真正的合作伙伴,而不只是软件供应商。它们帮助公司实现 5 倍增长并扩展规模,从而实现更快增长、更智能的运营,以及[音乐]竞争优势。访问 ridgeland.ai,了解它们能为你释放什么潜力。
英文原始自动字幕:raw_subtitles/uyzqxIoiobU.en-orig.srt;YouTube 自动简体中文字幕:raw_subtitles/uyzqxIoiobU.zh-Hans.youtube-auto.srt,仅作辅助参考。这份 Markdown 使用段落级时间戳;自动字幕的专名识别可能有误,逐句引用前请回看原视频核对。