Create

Sign in to ReadmeX

Sign in to join communities, post, vote and chat.

New here?

Story

Nebius’ Eigen AI acquisition puts inference efficiency at center

AI summary

Nebius acquired inference-optimization startup Eigen AI for consideration exceeding $1 billion, bringing its roughly 20-person team into the cloud provider. Eigen AI founder Hanrui Wang now leads Nebius’s Token Factory, which covers inference, post-training and agent systems, while the company positions efficient open-model serving as a core business.

Why it matters: The deal highlights how inference optimization and large-scale open-model serving are becoming strategically important layers of the AI infrastructure stack.

Eigen AINebiusToken Factory

0
Source textMIT科技评论中文 · 35 min read

2026 年 3 月,英伟达 GTC 大会的现场,黄仁勋在主题演讲中放出一张幻灯片:在中国开源模型 Kimi K2.5 的推理速度排名里,一家名叫 Eigen AI 的公司排在首位。

“我们事先并不知道。是他在台上讲的那一刻,我们才发现,原来我们真的做到了最快的速度。”Eigen AI 创始人兼 CEO 王瀚锐向 DeepTech 回忆当时的心情:非常意外,也非常兴奋。

那时,Eigen AI 才正式成立 9 个月,员工 20 人左右。不到两个月后,上市 AI 云服务商 Nebius 宣布以超 10 亿美元对价收购 Eigen AI。消息一出,Nebius 股价连续大涨。王瀚锐当时感到一种“复杂”的心情:股价上涨是资本市场的认可,但市场的期待也随之水涨船高,“越涨,我们肩上的重担就越大”。

王瀚锐博士就读于麻省理工学院(MIT)电子工程与计算机科学系(EECS),是韩松教授的“开门弟子”。他从 2017 年起就聚焦 Transformer 和 GPT 架构的高效计算,主导开发的稀疏注意力(sparse attention)系统 SpAtten 是 2020 年以来 HPCA(高性能计算机架构国际研讨会)引用最高的论文之一,配套加速器完成了台积电 28nm 工艺流片。

2024 年从 MIT 毕业后,他推迟了加州大学洛杉矶分校(UCLA)计算机系助理教授的入职时间,选择与两位 MIT 校友联合筹办 Eigen AI。公司的业务很好懂:让开源大模型在 GPU(图形处理器)上跑得更快、更省,再按 Token 对外出售。截至被收购前,在独立评测平台 Artificial Analysis 上,Eigen AI 的推理性能在 25 个主流开源模型上均位列第一。

近日,凭借在 AI 推理效率上的一系列突出工作,他入选了亚太区《麻省理工科技评论》“35岁以下科技创新35人”(Innovators Under 35)。

加入 Nebius,王瀚锐出任高级副总裁(SVP),全面负责 Token Factory 业务,涵盖推理、后训练和智能体系统三条产品线。7 月底,Nebius Token Factory 成为 2.8 万亿参数混合专家(MoE)模型 Kimi K3 的 Day 0 首发合作伙伴。

从学者到创业者,再到大公司的管理者,王瀚锐在几年间换了三种身份,他对此的看法很务实:不为创业而创业,学术和产业之间也从来不是单选题,关键看哪种组织形态最能让技术落地。

看到了领域内尚未被解决的关键问题,也是他做出很多决定的核心驱动力:创业是因为发现GPU大部分时间都在空等数据;谈到未来还想进入哪些领域,他同样描述了两个尚未得到满足的需求:自动为用户挑选最合适的模型,以及人与智能体之间的交互能否突破说话和阅读速度的限制。

在对话中,问及对 AI 长期走向的看法时,王瀚锐的态度相当乐观。在他看来,模型的规模增长(scaling)远没有到头,“再提高 1,000 倍都是有可能的”,Token Factory 的终点则是让智能变得像水和空气一样便宜。

落到具体的产业判断上,他又很冷静。他坦言,推理服务夹在 GPU 厂商和客户之间,是微笑曲线的中段,“更容易受到挤压”。本科和博士期间都做过芯片设计,他却不急于跟进自研推理芯片的热潮,理由是模型的底层算子仍在快速变化,“现在造出来的芯片,3年之后可能就会不适配”。

以下是DeepTech与王瀚锐的对话实录,经过编辑整理。

从 NLP 研究者到 AI 研究者

DeepTech:先请你向我们的读者介绍一下自己,包括之前的经历,以及现在在做什么。

王瀚锐:我目前在 Nebius 工作,负责整个 Token Factory 业务,包括推理、后训练和智能体系统。之前本科就读于复旦大学,2018 年毕业后进入 MIT,成为韩老师的第一个博士生。当时的研究方向是高效 AI 计算(efficient AI computing),核心问题是如何通过跨层级的硬件-算法协同设计,来提高模型效率、降低成本和内存消耗。

我从 2017、2018 年就开始做 Transformer 相关的研究,主要方向是稀疏化,包括 Token 剪枝(为模型去除不重要的 Token 或 KV 缓存),和量化(对高精度模型的压缩)。除此之外,还做过早期的缩放定律(scaling law)研究,观察不同规模的模型对性能和速度的影响。我们也做过芯片,比如稀疏注意力(sparse attention)芯片 SpAtten,用台积电 28nm 工艺流片做出来。当时是把算法从上到下、一直做到底层硬件平台。

2024 年博士毕业后,我全职开始筹办创业,2025 年正式创办了 Eigen AI。公司的方向是帮助企业用户做开源模型的优化和部署,一边有训练团队,帮企业用自己的数据把小模型训练到超过闭源模型的准确率;一边做推理系统,把后训练好的模型大规模部署到 GPU 集群上,让用户可以通过 API 调用。2026 年春天,我们并入 Nebius。进入这个更大的平台,是为了把之前的技术最大化地部署到更多 GPU 上,惠及更多客户。

DeepTech:你是韩松的开门弟子,为什么会选择加入他的实验室,你们当时做的事在整个领域里算前沿吗?

王瀚锐:韩老师是整个高效 AI 方向的开山鼻祖,我在读博前就和他有合作。当时高效 AI 计算已经是一个有一定关注度的方向,但我是整个实验室里第一个做 Transformer 方向的人。当时很多同学还在做其他模型的效率优化,比如视觉模型、3D 点云模型。

这个方向当时确实小众。我选它,一是因为它的架构不同于传统的卷积网络,更适合并行计算。二是 Transformer 本身展现出的能力很有意思。当时最流行的是 BERT 这类模型,GPT 架构还不是主流,只在实验里做一些纯生成式模型的对照。

但我们看到 Transformer 既有并行加速的潜力,又能解决之前解决不了的问题,还展现出生成文章的能力,感觉有机会突破图灵测试,最终决定做这个方向。

DeepTech:ChatGPT 火了之后,Transformer 成了非常主流的架构。你们当时预料到今天这样的局面了吗?

王瀚锐:没有预料到规模化会这么快,也没想到零样本学习(zero-shot learning)的能力会变得这么强。

这个领域最早叫“机器学习”:做任何任务,都得先准备数据、设计输入输出和损失函数,把模型“教”会才谈得上推理。其实在七八年前,模型都只能从一个任务扩展到十个、几十个,直到 GPT-4 前后,所有任务才被统一成文字输入/输出的形式。

就像现在已经没人自称机器学习研究者了,大家都叫 AI 甚至 SI(Super Intelligence)研究者,因为智能成了模型自带的属性,泛化能力强到足以忽视“学习”的过程。

最早的原始 Transformer 只有千万级参数,最近 GPT-6 发布,网传参数超过 10 万亿,6 年里差了 6 个数量级,我觉得这非常惊人。硬件也一样,2020 年我在英伟达实习时常去参加黄仁勋主持的公司会议,当时英伟达的主要业务还是游戏,数据中心只占据一小块。但现在大家也看到,训练和推理所需的算力规模已经相当大了。

DeepTech:你觉得这种规模化有没有接近极限?

王瀚锐:我觉得远远没到头,再提高 1,000 倍都有可能。预训练确实受数据限制,但在后训练和强化学习(RL)阶段,模型可以在各种各样的强化学习环境中自由探索、自我演化,不再受制于数据。

如果只把网上的文字喂给模型,它的能力上限就是人类智能;如果给模型一个足够复杂的客观环境,它的上限就变成环境本身的复杂程度。人的智商最高可能在 200~300,但以数学为例,这是一个非常复杂的环境,模型在数学世界里或许能达到 500 甚至 1,000 的智商,提出一些人类已经无法理解,但很有启发性的想法。

训练是证明能力,推理才真正让能力被用起来

DeepTech:你们 2025 年创业时,正是训练最火的时候,为什么选择做推理?

王瀚锐:当时训练确实非常火。GPT-4 横空出世,接着是备受欢迎的 GPT-4o,人们也很期盼 GPT-5,大家都在讨论规模化能达到什么高度。

我们的判断是,训练在资本市场很火热,是因为它证明模型具备很多以前无法想象的能力。但到 2024 年,这种证明已经做得很充分了,滞后的是应用:模型能力上限越高,能解锁的任务就越多,影响的行业也越多,这部分市场很大。

真正发挥模型能力的应用,必须在经济上说得通。我和其他联合创始人此前的研究,都是在让模型更实用、更高效。这些技术正好可以帮大家从惊叹、观望,走到真正下场使用。

DeepTech:决定创业有没有具体的契机?

王瀚锐:2024 年就决定了,一个很重要的原因来自技术层面,我们做架构研究时发现,Token 的生成是内存受限的,每次都要把模型权重重新加载一遍,GPU 大部分时间都在等数据搬运。但如果把很多用户的请求聚合在一起,这一层计算就从矩阵与向量乘法变成了矩阵与矩阵乘法,大幅提高 GPU 的利用率。我们做了实验和性能剖析,发现确实能做到。

当时 OpenAI、Anthropic 都是云端服务模式。因此,我想到自己之前的稀疏注意力工作、联合创始人的 AWQ(激活感知权重量化,一种大模型低比特量化方法)也不必局限在边缘设备和端侧 GPU 中,可以放到大规模云上,处理更大的吞吐量和流量。

图 | Eigen AI在NeurIPS 2025 展览(来源:受访者提供)

DeepTech:现在也有人在做端侧推理。在你看来,云端和端侧有优劣之分吗?

王瀚锐:我们在 Eigen 也思考过是否要把一部分工作放到端侧。在卷积神经网络(CNN)时代,手机上能跑的模型和最前沿的模型差得不多。但6年过去,模型规模涨了 10 万倍,手机和电脑的内存显然没涨这么多,最前沿的模型越来越难在端侧运行——我们不太可能把 Kimi K3 压缩一下放到手机上跑。

最近一个有意思的变化是,很多模型都在出轻量级版本。比如 Qwen-3.8-27B 只有 270 亿参数,能力却远超两年前的同规模模型。如果以后可以压缩到几十亿参数,32GB 内存的笔记本都能跑,两者的差距又在缩小。

不过目前看来,唯一能证明端侧必要性的应用场景是隐私,总有小部分人和公司需要在本地运行模型,这个需求会一直存在,但占比不大。从增长速度来讲,云端依然快于边缘推理。

光速就是第一性原理

DeepTech:你 2020 年在英伟达实习,当时公司是什么样的氛围?对你后来的工作思维有哪些影响?

王瀚锐:对,2020 年我在英伟达研究院(NVIDIA Research)研究全连接层的稀疏化,公司有几个理念对我影响很大。

一个是研究要从真实问题出发,必须思考技术转化。在英伟达研究院,做项目需要在产品部门找到一个支持者,并且在它启动之前就要回答一个问题:如果这件事做得非常成功,会带来怎样的影响?所以后来我们创办 Eigen AI、决定做推理,也是从真实需求出发。

另一个是“光速”(Speed of Light)。它有两层意思,一层是做事要快;更深的一层是,光速是不变的物理定律,代表第一性原理。我们做推理优化时,会先算 GPU 有多少个流式多处理器(基本计算单元),如果全部用满,理论上能达到什么速度,再反推现在的每个环节离上限还差多少。这就让我们有了一个明确的、可以逼近的目标。

DeepTech:从需求出发的理念,是在英伟达形成的,还是更早?

王瀚锐:其实从读博时就有了,我们实验室跟工业界的合作很紧密,经常和产业方对接,他们会反馈实际生产中的问题和想要的解决方案。韩老师的理念是,高效AI计算必须能产生真实的影响力。所以从读博开始,我们做的东西坚持全部开源,论文全部发表,所有细节都列出来,就是为了让企业能直接用上,也方便后来者在我们的基础上继续往下做。

DeepTech:在你们看来,做推理最大的技术壁垒在哪里?

王瀚锐:最大的壁垒是让系统不断适应快速增长的规模。谁能最快地把服务模型的能力提高 10 倍,不断提高一个又一个数量级,谁就能领先。用计算机领域的话说就是,“任何比现有系统大 10 倍的东西,都是完全不同的东西”。

推理这个词的内涵很广,在笔记本上跑一个三层全连接网络是推理,在几万、几十万张 GPU 上每秒处理海量 Token 也是推理。难的是在大规模 GPU 上把开源模型部署得既稳定、又快、经济上又划算。这和业务相辅相成,足够多的需求才能推动技术更上一层楼。

另一个壁垒是让技术的演进自动化。现在最前沿的研究话题之一是递归式自我改进(RSI),我们也在把它用到服务引擎和内核设计上。未来一两年,用智能体优化系统会是很重要的壁垒,但目前还有很多问题需要解决,比如不同模型能优化到什么程度,自我改进的边界在哪里,什么时候需要人来监督。第一个攻破这些问题的公司,就会和对手拉开差距。

DeepTech:你们做推理的前提是开源模型。客观来讲,如今开源模型和闭源模型的差距有多大?

王瀚锐:和最前沿的 GPT-6.1、Claude Fable 5.1 比,开源模型在基准测试和最难的推理任务上肯定还有差距。但一年前大家觉得差了 9 个月到一年,半年前觉得差 6~9 个月,现在可能只差不到 6 个月。

在 Token Factory,我们有一个很重要的观察:客户其实并不在意模型是开源还是闭源,也不需要最强的、面面俱到的模型。拿到客户的数据,针对他们的任务、调用框架和运行环境做后训练,让开源模型在客户更关注的问题上表现超过闭源模型,这就够了。

DeepTech:你们的客户也会价格敏感吗?

王瀚锐:客户大致有两类需求。一类看重可控性和安全性,他们想知道自己的数据是怎么被处理的、用的是什么模型,还希望把积累的客户数据和经验变成竞争壁垒。这需要我们对模型进行定制化的调整,只能用开源模型。

另一类更看重成本和容量。很多客户直接用 OpenAI 或 Anthropic,未必能拿到足够的预留容量,比如需要几千张 GPU、几十亿 Token 的额度。开源推理服务商能提供更大的预留容量,既满足他们持续扩张的需求,成本也更低。

开源模型能力变强的同时,价格也在上涨。但对流量非常大的企业来说,哪怕把成本降低 5% 都是很大一笔钱,降低一半就更有吸引力了。

DeepTech:直接用开源模型的企业,和“先闭源跑通、再切换到开源”的企业,二者的相对比例在最近有没有变化?

王瀚锐:直接尝试开源模型的企业越来越多。一方面是品牌认知,以前大家信任 OpenAI、Anthropic,因为这两家做的最早,而这两家恰好都做闭源;后来 DeepSeek、Kimi 的品牌声誉做起来了,大家看到它们用更低的成本达到了不错的准确率,就会直接尝试开源模型。

另一方面是实际使用。用过一段时间闭源模型的客户,跑出的工作流里往往有很多个模型,有的用开到最高推理强度的模型,有的用小一些的。他们会逐步把简单环节换成开源模型,最复杂的高层规划、判断类环节先保留闭源,慢慢地,他们也会把一部分高难度环节换成开源模型。这是一个渐进的过程,因为他们已经积累了真实的调用记录、失败案例和评测基准,能判断出某个模型的准确率够不够。

DeepTech:在模型能力、品牌、价格、灵活性、隐私安全等因素中,客户的权重大概是怎样的?

王瀚锐:成本大概占了一半,准确率提升占 30%,可控性占剩下的 10% 到 20%。很多客户还在意我们能不能帮他们做后训练,做到超越闭源模型。例如本来要用最大的闭源模型、开最高的推理强度才能达到某个准确率,但客户希望在准确率和成本的权衡曲线上找到更好的点。为了满足这部分需求,我们在训练上也投入了很多,帮企业搭建数据飞轮,让模型持续变好。

DeepTech:国内也有企业在做类似的事,中美两边的公司,在商业模式上有哪些不同?

王瀚锐:我和国内一些同行交流过,从技术交流和开源社区来看,两边都很有活力,技术规律和趋势有很多相似之处。商业模式也非常类似,都是按 Token 计价,一些差异是在按 GPU 还是按 Token 数预留容量等细节处。不过,两边最大的区别是硬件层面,也就是能否用上最新的硬件。

“从来不会为了创业而创业”

DeepTech:在 2026 GTC 的演讲幻灯片里,黄仁勋展示了 Eigen AI 在 Kimi K2.5 上的推理速度排第一。这件事对公司影响大吗,你们事先知道吗?

王瀚锐:这是我们公司非常难忘的一段经历。他发布之前我们并不知道,是在发布的那一刻才发现,原来我们真的做到了最快的速度,当时非常意外,也非常兴奋。

这次曝光对我们的帮助肯定很大。一方面,老黄在 3 月份的主题演讲里再次强调推理,大家对推理的关注开始升温,当然,这也和 OpenClaw、Kimi 等工具或模型的出现有关。另一方面,我们在正在爆发的推理市场里做到了最快,主动找来的客户更多了,对团队士气也是很大的鼓舞。

(来源:X@Eigen_AI_Labs)

DeepTech:公司成立一年左右就被收购,当时是怎么考虑的?

王瀚锐:如果只看公司的成立时间,这个速度确实很快。但我们在这个领域已经有了十年左右的技术积累。我从 8 年前开始做稀疏注意力、KV 缓存量化,另两位联创中,金帝 2015 年就开始做 NLP 研究,韋程也从 2015 年开始做效率和内存系统,这些技术都直接用到了我们的推理和训练产品上。

我们的出发点一直是让研究产生更大的影响,尽量保持初创公司的发展速度,同时解决一些硬性约束。进入 Nebius 一个季度(Quarter)后——在大公司才会“按季度过日子”(笑),我们确实感到客户、GPU 数量等各方面的规模都比以前大了很多,所以这是一个互利共赢的选择。

DeepTech:你们对被收购的态度一直是比较开放的?

王瀚锐:我们的思路是,有些事情一定要在创业公司做。放在 5 年前,推理平台根本不存在,这类新产业用创业的速度来做肯定是合理的。但我们还要找到最能让技术产生影响的组织形态。

近期大家都意识到了推理的价值,更多的算力、更大的市场和更强的销售团队可以支撑更快的发展,我们自然对这些选择保持开放。当然,我们也可以选择独立发展,这是一个权衡问题。

DeepTech:当时接触的公司里,为什么最后选择了 Nebius?

王瀚锐:有几个方面。首先我们的瓶颈是 GPU,那就要选一家有 GPU 的公司,也就是各种新型云服务商(neocloud);因为我们做的是软件,所以需要一家非常重视全栈的公司。

Nebius 从 Yandex 分拆而来,后者相当于俄罗斯的 Google,企业文化里对软件有很强的信念,Nebius 的愿景也是做全栈,我们加入后会比较受重视。GPU 是 Nebius 的强项,它的市场团队也非常强,正好补上我们的短板。

其次,我们希望有足够大的施展空间。Nebius 规模很大,但又没有大到失去灵活性,虽然是上市公司,行动速度依然像创业公司一样快。有硬件、重视软件、行动又快,满足这几条的公司在市场上其实很少。另外,我们和 Nebius 在并购之前就合作了很长时间,一起推进了很多个模型的推理加速,比较“情投意合”。

DeepTech:如果没有 Nebius 这个选项,你们最想加入的公司会是哪一家?

王瀚锐:如果没有 Nebius,我们可能就会选择独立走下去。

DeepTech:交易宣布后,Nebius 股价连续大涨,到 6 月交易完成时,涨幅已经相当可观。这个过程中你们是什么心情?

王瀚锐:心情还是挺复杂的。股价上涨大家肯定都很高兴,交割时收购对价翻倍,Eigen AI 成为独角兽,这是资本市场的认可。超出预期的是,最后涨出来的部分已经远超这笔收购的对价。但越涨,我们肩上的重担就越大,大家的期待会更高,我们需要尽快交付实际的成果。

DeepTech:你们团队二十多人整体加入了 Nebius,但硅谷这两年流行另一种模式:只挖走创始人和核心团队,再签一份技术授权,公司本身留在原地。你们整体加入,是你们的坚持,还是有其他原因?

王瀚锐:其实我们没有经过很复杂的谈判,默认就是收购整个公司。Windsurf、Groq 等交易是最近才出现的一种模式。它的好处是,如果只收购人才、签技术授权,就不需要经过复杂的审批流程,符合 AI 快速发展的节奏。但它也有弊端,公司对剩下的员工、投资人,以及原有客户的善后工作都会变得非常棘手。

DeepTech:所以它可能只是权宜之计。

王瀚锐:没错。比如英伟达宣布收购 Hugging Face,就没有用挖角式收购(acqui-hire),关键在于公司是偏技术,还是更依靠整体的市场影响力。像 Hugging Face、OpenRouter 这种平台型公司,不可能只靠挖走几个工程师实现收购目的,必须整体收购。但如果目标只是几个人、几项核心技术,而且很容易剥离,大公司就会希望快刀斩乱麻,把人和技术授权一起拿过来,这样可以省去很多法律风险和原公司的担责风险。

我不认为“部分收购”会成为标准模式,它更多像特殊时期的特殊办法,只有在大家抢同一家公司、或者出于战略考虑必须快速完成的时候,才会用这一招。大部分收购最终还是要整体并购。

DeepTech:其实你对收购这件事应该不是很陌生,曾经实习过的深鉴科技被赛灵思(Xilinx)收购,导师韩松联合创办的 OmniML 被英伟达收购,现在你自己的公司也被收购了。做 AI 系统方向的初创公司,保持独立是不是一个伪命题?如果要保持独立,至少需要具备哪些特质?

王瀚锐:这里肯定有选择性偏差,被收购的公司更容易被看到。但 AI 系统软件在整个价值链上确实只是中间的一环。

微笑曲线告诉我们,越靠中间,就越容易被挤压,利润率很难做高。推理业务一边要面对 GPU 厂商,一边要面对客户,同一层还有很多竞争对手。

回看上一代基础设施,有个很有意思的现象:亚马逊云服务(AWS)、微软 Azure、谷歌云都背靠一家大公司,没有哪家独立云服务商做到非常大的规模。大公司的资本资源不用说,客户资源和渠道也是现成的。

AI 基础设施的增长取决于客户业务规模的增长,AI 系统这一层要想独立存在、持续做大,需要绑定几个稳定的大客户一起成长,最好是高增长的客户。

另一个生存之道是保持中立,可以接入不同的 GPU、不同的芯片和数据中心,支持各种各样的模型,成为一个中立平台。大公司总会和客户在别的业务上有重合,比如有的客户不想用谷歌云,因为和谷歌有竞争。

还有一点,AI 系统不从某个垂直行业出发,可以用在很多行业,所以很难积累某个行业的专门知识。也许另一条路是做更适配某个垂直行业的基础设施。比如有几家公司专门给药企做云服务和软件平台,它们是技术公司,但非常了解药企的各种合规要求,这也是能持续增长、保持独立的一种方式。

把 Token Factory 变成“万物工厂”

DeepTech:从创业到加入 Nebius,你的状态、关注点和日常工作有什么明显变化?

王瀚锐:创业公司的 CEO 是“首席什么都管官”(chief everything officer),客户、融资、招聘、产品、工程、营销都要管,核心任务是让公司活下来。

加入大平台,至少融资不用我负责了,我开始管预算、对损益负责,更多时间花在协调不同组织之间的行动上。比如要和 GPU 团队协调,因为他们提供算力;要和市场团队协调,确保对外传递的信息准确。我们作为“应用 AI 部门”,目标很明确,就是把模型产品做到最好,也能做得更深。

另一个挑战是我们现在是全球团队,欧洲也有大团队加入了“应用 AI 部门”,需要做很多全球协调,这是以前在创业公司不会面对的挑战。

DeepTech:在现在的团队里,你觉得把技术做到最前沿更重要,还是把产品打磨好更重要?

王瀚锐:产品打磨更重要。我们是基础设施公司,不是新的 AI 实验室,也不是研究机构。基础设施公司要做到每件事都可以复现、值得信任,我们不一定永远做最前沿的技术,但做出来的东西一定要让客户最放心。产品必须可复现、可扩展、可靠,让大家一提到 Nebius 就知道,找它一定没问题。像空气一样不被人注意到,可能是基础设施的最高境界。

研究我们也做,因为这个领域发展太快,基础设施还远没有到稳定状态,需要做一些前沿研究才能跟上最新的变化。但发论文、开发新技术不是我们的唯一目的,更重要的是把它们做成真正可落地的产品。

DeepTech:团队做研究和做产品的取向,和你个人的取向有没有细微的差别?

王瀚锐:我个人博士期间做过一些更前沿的硬件,比如用光子器件加速 Transformer,也做过用量子器件加速 Transformer。现在做“应用 AI 部门”的研究,还是希望能落到真实产品和生产环境里。不是说每项研究都必须落地,但很多问题是从产品里出现的真实问题,或者我们预测未来几个月会出现的问题出发的。

DeepTech:现在没有太多精力做前沿探索,你会觉得可惜吗?

王瀚锐:以前做研究,是在智识上很有满足感;现在在公司里把业务做起来、解决客户的实际问题也很有意思,两者各有吸引人的地方。

DeepTech:加入 Nebius 之后,你们陆续做了很多新模型的 Day 0 上线,比如 Kimi K3。为了做到这一点,你们有什么特别的尝试?和之前自己创业时做发布有什么不同?

王瀚锐:我们是所有新型云服务商里唯一一家做到 Day 0 支持 Kimi K3 的。因为我们是 Kimi 的合作伙伴,会提前做计划,准备好算力和各种优化。一是准确率,我们要通过 Kimi K3 的厂商验证工具(vendor verifier),保证准确率完全对齐。二是我们同时并行做几种优化,哪种有效就在 Day 0 用上。

能做到这一点,一是现在团队更大,可以在 Day 0 之前同时推进几个优化方向;二是我们有英伟达 B300 这样更先进的 GPU。

DeepTech:你们现在除了推理和后训练,还在做智能体。在你看来,智能体和之前的推理有哪些不同?

王瀚锐:智能体要做规划、调用工具、读结果、自我纠错、重试,步骤多得多。步骤多了,KV 缓存复用的机会就多。早期我们在 Eigen AI,聊天、客服这类请求的 KV 缓存命中率达不到 80%,但在智能体、编程、协同办公这些场景,命中率可以到 90%,甚至 95% 以上。这对 KV 缓存管理提出了更高的要求。

另外,评价指标也在变,从单纯计算每秒 Token 数转向看任务成功率或者每个任务的耗时。换一个小模型,Token 可能生成得更快,但需要重试更多次,时间反而更久;同样地,每个 Token 更便宜,完成任务需要的 Token 却更多了。所以智能体需要更高一层的评估。评估框架和接口层也要跟上,比如调用框架和模型是否兼容,能否支持各种对话模板和结构化输出,这些我们都必须支持。

DeepTech:那你们在智能体上有没有做一些比较有意思的尝试?

王瀚锐:一个是模型的自动选择,相当于一个路由器(router),智能体在不同步骤可以切换不同的模型。比如我们之前有个产品叫 Eigen Data,是一个合成数据生成平台,流程里要调用 14 个不同的智能体。现在我们在研究如何在不同位置用不同的模型,并根据生成数据的难度来切换模型,从整体上优化智能体工作流。

DeepTech:在智能体完成任务的过程中,你们观察到了哪些新的风险?

王瀚锐:一个是有些模型不支持工具发现,用户希望它完成某个任务,它知道某个工具的名字,却不知道具体实现和参数格式,就会凭空“编”出一个工具来,导致用户的调用框架报错。

另一个是系统层面的挑战,如果某个节点宕机,它存储的 KV 缓存就没了。如果不能快速恢复,重启后重新预填充这些缓存要花很长时间,还会打乱整个缓存路由过程,用户体验会变得很差。

DeepTech:现在大家都在谈 RSI,让 AI 自己改进自己。作为中间层,你们在这件事上可以做些什么?

王瀚锐:我觉得关键在于怎么定义验证器(verifier),也就是怎么定义对错、怎么定义进步。我们现在也在大量使用这种方法,比如内核设计智能体,我在一些会议上也介绍过相关进展,和英伟达、MIT 也有一些合作。

我们能做的,是让 RSI 在我们的基础设施上跑得更快,用更强的模型来做验证。它的消耗确实很大,用好的话,一个月写上百万行代码都有可能。但最核心的瓶颈,比如怎么设计验证闭环、怎么设计评判机制,很多不在基础设施的范围内。

DeepTech:现在 Artificial Analysis 的排行榜上,你们和 Together AI、CoreWeave、Fireworks 等公司你追我赶。这种竞争有没有尽头?如果有一天大家不那么关注速度了,最终比的是什么?

王瀚锐:Artificial Analysis 更像一个展示平台,决定了谁能被看到。上面除了速度,还有模型的智能水平、多模态评分,大家在上面看各种信息、互相分享,会形成一个整体的市场印象。

但基准测试和实际生产不可能完全一样。实际生产中,并发量、输入输出五花八门,Artificial Analysis 只能反映一部分,准确率也是同样的道理。既然它决定了谁能被看到,大家就会一直在上面展示,相当于宣布“我们支持这个模型了,速度很快,快来试试”。能不能把客户留下来,还是看生产环境的稳定性。

还有很重要的一点是算力,谁有卡。现在 GPU 非常紧缺,大家的瓶颈都卡在台积电的产能上,这也是为什么马斯克要做 TeraFab。这个瓶颈显然不是一两年能解决的,所以除了模型速度,谁能提供稳定、可持续扩展的算力,也是一层壁垒。

DeepTech:未来基准测试会不会有变化,比如加入模型性能或其他维度的评估?

王瀚锐:这个变化正在发生。Artificial Analysis 上大部分模型比的是速度,但像 GLM-5.2 这样的模型已经有了准确率指数,不只比推理服务商谁快,还要比谁准确。Nebius 目前在准确率上经常排第一。

我觉得 Artificial Analysis 以后会引入更多针对推理端点的比较维度。除了基准测试的准确率,真实生产中还有很大一部分在于API前端,比如工具调用处理得好不好,是否支持延迟加载工具,结构化输出的格式是否准确。这些都是智能体实际使用中的细节,也是我们花时间最多的地方,但目前 Artificial Analysis 的排行榜没有体现这些内容。

客户会看整个 API 前端,也就是模型之上的接口层,能不能把工具调用做得非常稳定、没有漏洞,这决定了他们会不会留下来。之后它可能会推出类似测试调用框架的基准,看挂到调用框架上能不能真正完成任务。大家的注意力正在从聊天转向智能体,很多指标也从 Token 层面转到了任务层面。

DeepTech:作为个人用户,我的感受是,随着推理能力变强,大家对速度的容忍度好像提高了。企业客户有没有类似的趋势?比如以前要求一秒出结果,现在等一个小时也能接受,只要最后能把任务做好。

王瀚锐:这个观察很有意思。我们看到,大家对首个 Token 的响应时间依然要求很高,因为这直接影响用户体感。但在高吞吐、高并发的情况下,每个用户的输出速度是每秒 300 个 Token还是 500 个 Token,其实人已经看不过来了,或者输出是给智能体调用工具用的,人也不会直接看。所以我们观察到,对每秒 Token 数的需求有一个上限,到 300 到 500 这个范围之后,很少有人再要求一定要到 2,000 甚至 3,000。

但随着大家把更多任务交给智能体,完成任务的端到端速度会越来越重要。现在让智能体写个文档,可能要等将近 10 分钟,我自己已经会有点不耐烦了。我们和英伟达合作的 Groq LPX 可以做到每秒 3,000 个 Token,想象一下,准备一份幻灯片从等 10 分钟变成等 1 分钟,用户体验还是会有明显提升的。

DeepTech:有时候模型回得太快,反而让人怀疑它是不是没认真推理。

王瀚锐:没错。现在还有一个很大的问题,比如 ChatGPT 可以选不同的推理强度,但这个选择很模糊,到底该用超高、最高还是中等,非常不直观。

所以现在开始兴起路由这一层,帮用户选模型,我觉得这是对的方向。就像我们用 Wi-Fi,不会去选它是 5G 还是 2.4G,这属于基础设施的底层参数。根据用户任务的难度,甚至在多智能体系统里,决定不同智能体什么时候用大模型、什么时候用小模型,这还是一个空白领域,也许以后会有更多公司出现,Nebius 也在做这方面的探索。

DeepTech:你毕业时拿到了加州大学洛杉矶分校计算机系的教职,你对未来的职业规划是怎样的?会回到学术界做更基础的研究,还是留在产业界?

王瀚锐:目前还是专注在 Nebius,把 Token Factory 做好。这个领域变化很快,未来有很多不确定性。我觉得不一定要二选一,在 Nebius 也可以做研究、发论文,到时候看整个产业的发展。

DeepTech:你对 Token Factory 这项事业有没有一个长期目标?希望它最终变成什么样子?

王瀚锐:我觉得很重要的一点是,Token Factory 就是一个万物工厂(everything factory)。因为人的输出,包括各种机器、物理实体,都可以看作由 Token 控制的。只要有足够多的 Token、足够多的智能,就可以在数字世界里构建一切,也可以在硬件世界里构建实体。

以此推演,Token Factory 就成了一个不受人口限制、可以持续增长的智能银行。智能可以增长百倍、千倍、万倍,成为一个没有上限的资源,经济不再受限于人。亚马逊、苹果的规模取决于有多少人网购、多少人买手机,Meta 的日活用户有 30 亿,是因为拥有手机的人数有上限,而如果大家可以无限地使用 Token,就能获得无限的智能,这种智能的水平还可能超过人类,我觉得这是非常令人兴奋的一点。

它会构建出什么,风险和机遇并存,有人会说这就是硅基生命,但我觉得人总会想出控制它的办法。我们要做的就是让 Token Factory 真正把智能变得像水和空气一样便宜,然后看它能构建出什么。

DeepTech:现在不少初创公司和大公司都开始自己做推理芯片,你们有这方面的计划吗?

王瀚锐:我个人对推理芯片还是很有感情的,本科时我同时修读了计算机科学和电子工程,做过一颗推理芯片,博士期间又做了一颗。但在 Nebius,我们目前没有做自研芯片的计划,还是先把最擅长的事情做大。

至于现在是不是做芯片的好时机,我觉得主要看基本算子是否还在快速变化。之前大家觉得都用 Transformer,那是不是就可以造 Transformer 芯片了?但最近注意力机制出现了各种变体,比如分组查询注意力(GQA)、多头潜在注意力(MLA)、Kimi Delta注意力(KDA)……底层架构还没有完全固定下来。

另外,模型规模还在不断扩大,每层的规模、KV 缓存的分配方式都在变。这些都会影响芯片的基本处理单元以及多级存储系统的设计。现在造出来的芯片,3 年之后可能还是不适配。所以如果要做芯片,必须提前准备,给未来的算子留出余量,内存层级的设计也要留足空间,才能做到向前兼容。

DeepTech:你刚才提到了物理AI的一些场景。Token Factory 目前有没有明确面向物理 AI 或具身智能的部分?

王瀚锐:Token Factory 内部有个团队专门做机器人方向,我们会支持自动训练物理 AI 模型,用智能体去训练物理 AI 模型,包括设计数据、使用云端仿真器等。另外也在支持多模态模型,其中包括世界模型(world model)。虽然还处在早期,但这是我们的重点关注方向,会做必要的准备。

DeepTech:你认可具身智能的前景吗?

王瀚锐:我不是这方面的专家,但我曾参观过 Figure AI 等机器人公司。这个方向非常必要,但在实现的时间线上,我没有那么确定。自动驾驶需要很多数据和多年积累,但汽车的自由度有限,而且它是工具,人坐在里面开车就可以收集数据。

具身智能的难点在于没法这么自然地收数据,总不能让人穿上钢铁侠那样的盔甲去采集。它的自由度更高,需要的数据更多,收集难度也更大,两方面叠加,数据就成了很大的瓶颈。所以我们看到,过去四五年,语言模型的规模涨了五六个数量级,具身智能模型可能只涨了两个数量级,因为数据跟不上。怎么解决数据瓶颈,我觉得非常重要。

DeepTech:如果有可能,你还会离开大组织,自己出来创业吗?

王瀚锐:我不会为了创业而创业,或者为了成为连续创业者而创业,更多是看我感兴趣、想做的方向,是否需要创业公司的形式。如果它特别新,或者需要跑得很快,可能需要。但目前我们最感兴趣、最兴奋的是构建智能工厂,Token Factory 是当下最有可能支持我们快速推进的平台,它的资源和架构也最适合我们把这件事落地和规模化。

DeepTech:你心里有没有想过一些适合用创业形式来做的方向?不一定真的去做。

王瀚锐:我想过一些从瓶颈出发的方向。比如刚才说的路由,大家选模型的时候很随机,这方面可以做的更系统。另外,在用编程智能体的时候,我需要通过说话或打字把想法传给智能体,瓶颈就在交互方式上,也就是我的说话速度和阅读速度。有没有办法把这个瓶颈去掉,以及未来人和智能体如何交流和共生,我觉得也是很有意义的方向。

注:首图/封面由 AI 辅助生成

Read the original →

How we got here

  1. Why AI Applications Struggle to Make Money虎嗅 AI · NVIDIA
  2. Andreessen Horowitz Launches a Project-Based School for High-School Graduates创业邦 科技 · NVIDIA

Comments

I've used this: share my experience What I think: share my view
How important is this story?No ratings yet

No comments yet. Start the conversation.