AI数据行业野蛮生长:从人工标注到RL环境
硅谷101播客邀请在 Scale AI 负责后训练与评测研究的何允中,以及加州大学伯克利分校博士后、Agents’ Last Exam(ALE)项目研究者孙一铀,讨论AI训练数据行业的快速膨胀与不透明。节目提到 AfterQuery 今年4月A轮融资时估值3亿美元、9月据媒体报道升至32亿美元,Bespoke Labs 7月宣布种子轮与A轮合计融资4000万美元,并梳理行业从人工标注、pre-training 转向评分细则(rubric)、可验证信号,以及包含任务、工具与验证机制的强化学习环境。两人还谈到垂直领域数据的采购难题、benchmark 与卖数据的边界(有人提及有数据公司出售评测数据)、专家造假与数据污染,以及 OpenAI 2月停止报告 SWE-bench Verified 分数所反映的评测困境。嘉宾观点仅代表个人,不代表所在公司或机构。
为什么重要:数据供应链与评测可信度正成为模型能力提升的关键瓶颈,这场对话提供了数据供应商与研究者的现场视角。
相关来源 36氪 人工智能 · 钛媒体
随着AI模型能力提升,训练需求更复杂,一批为模型公司提供训练数据的新公司正在快速增长:AfterQuery今年4月宣布A轮融资时,估值为3亿美元,到了9月,据媒体报道,新一轮融资已经将其估值推至32亿美元。另一家提供训练数据与智能体环境的公司Bespoke Labs,也在今年7月宣布,种子轮与A轮融资合计达到4000万美元。
虽然估值水涨船高,AI数据行业对外界来说却极其不透明。这些公司究竟在卖什么?
过去提到数据标注,我们容易想到给图片打标签、给模型回答打分。但随着AI从回答问题走向执行任务,数据公司的交付物也在变化:从专家写出的评分标准,到包含任务、工具和验证机制的强化学习环境。它们需要找到懂行的人,获得真实的行业资料,再把专业知识与工作经验转化成模型能够学习的训练信号。
与此同时,新的AI评测层出不穷。榜单分数提高了,究竟代表哪些能力变强了?针对评测生产数据,什么时候能改善真实用户体验,什么时候又会变成单纯的刷分?对于每天训练模型的研究员来说,他们最需要的数据,到底是什么?
本期硅谷101播客,我们邀请到在Scale AI负责后训练与评测研究的何允中,以及加州大学伯克利分校博士后、Agents’ Last Exam项目研究者孙一铀,从产业与研究两个视角,拆解这门透明度不高、又变化极快的生意。
我们聊了Scale、Mercor、Surge等数据公司的不同背景,也讨论了小团队在合成环境与垂直领域中的机会。从采购一份游戏源码,到验证专家提交的任务,再到设计让人愿意交出经验的激励机制,好数据的难点,往往藏在榜单之外。
以下是这次对话内容的精选:
01
谁在做AI数据生意?
Yiwen:现在市面上的数据公司林林总总,该如何分类?
何允中:这里面有几个大的玩家,还有一些新秀,甚至几个人的作坊。在我看来最有意思的是大家基因可能不太一样。比如说有做招聘出身的,像Mercor、Handshake;Scale AI是传统数商,从众包网络出身;也有一些新的是做合成的;还有最新的一些,可能是某些领域公司转行做数据了。这里面值得说的是具身,具身现在的行业状况是,有很多做模型的公司暂时没赚到钱,但它花了大量精力投资做数据,就顺便做起了数据生意。很多各行各业的人也发现了自己数据的价值,然后转行来做数据公司。我觉得大致是这么几个分类。
几个大的玩家,比如Mercor、Surge AI、Scale AI,基本上试图什么东西都能cover。除此之外,一些新秀玩家把一些领域做得比较好,像BigCode或者Snorkel AI,他们可能比较偏研究跟工程一点,我猜测他们主要生产代码,或者是工具调用这一类的环境,抓住了今年的风口。
另外我还看到一些小的公司,他们可能解决了一些垂直领域的问题,甚至可能不像我们做标注数据,就是一些数据经纪商。比如说可能是好莱坞的一个人,他有特别多的版权数据,他知道怎么把林林总总不同领域的东西卖出去。现在最新兴起的就是垂直领域,把一个领域做得特别好,可能是由一些领域专家组成的。
我会觉得机会还很多,大的数商有大的数商的优势,它进入一个领域有比较多的资源。我觉得整个饼是越来越大。
Yiwen:你讲到像Mercor这样的公司是所谓的招聘公司,招聘是一个什么样的商业模式?
何允中:Mercor是做招聘起家的。它有自己的一个自动AI面试的产品,主打的重点就是,我能够在比较短的时间内找到足够量的专家,有这么一个专家网络。Surge AI我觉得更多的是把这个东西内部来做。这里反正有一些取舍,基本上每个数商可能都需要面临这么一些取舍:如果我是自己完全全职培养的人,那他肯定能力强一点,但灵活度就不够,产能可能会差一点;如果是更多地依靠众包网络,可能灵活性大一点,但每个人的质量就比较难保障,这里面就涉及到质检问题。Scale AI这些公司的优势在于,我们有一些质检的经验,不光是在数据上,也在人上。
02
AI数据行业,如何转向?
Yiwen:其实我们关注这个话题,也是因为大概从2024年到现在,对于数据的需求发生了一个比较大的变化。因为2024年之前,我们在聊数据的时候,大家想到的很多还是人工标注,就是一些比较基础的数据,我们会需要非常多的数据来做pre-training,来训练模型。但是从2024年,其实Mercor之前有提到过,是因为Deep Search的兴起,导致整个行业转移到了一个所谓的Agentic data(智能体数据)。
我们会需要像你刚刚说的rubric(评分细则),包括RL环境,现在更多真实工作流数据。能不能帮我们先梳理一下这几个概念?我们先讲一下这个行业从众包数据、也就是人工标注数据,到智能体数据,中间经历了什么变化?
何允中:对,首先说明一下,Pre-training还是很重要的。不过确实,从我身边的人的兴趣来说,大家经历了一个转向,大家觉得pre-training感觉干得有点无聊了。那个时候是o系列模型出来了,大家都在做reasoning,发现这RL跑通了,一下子大家兴趣都在RL上。
RL比较有意思的一个问题就是,我需要一个可验证的信号。可验证的信号在代码或者数学,尤其是最早的推理模型,是从数学上做出来,就很简单,我这个选择题答错答对了就知道了,或者算一个数字出来。但是之后大家就在想,那我数学可以做RL了,我在其他领域呢?比如说像医疗、金融,或者更基础的指令遵循,这里我能不能做RL?这里它存在的一个问题就是,它是有一些客观标答的,不像在之前的一个阶段,大家做RLHF(基于人类反馈的强化学习),就是reward model(奖励模型),可能没什么标答,只是把大家的喜好学出来。
这里面其实是有个标答,只是它这个标答比较不结构化。就好像我去答历史考题,历史考题是有标答的,但是每个人的写法可能都不太一样,我很难做这个pattern match(模式匹配),就是说A B C D检查你有没有答对。这个时候就是一个rubric的方式,相当于我让一个助教拿着教授写的打分规则来给你打分。
因为这个打分规则是提前标好的,是教授写的,所以这个TA也不需要特别聪明。这是整个大模型数据中的一个核心概念,就是叫Weak-to-strong supervision,能不能用弱模型来监督强模型。那它这里成立的条件就是,我有个专家把他脑海里的知识给写下来了,这样弱的模型拿着它改卷子就行了。这就是rubric data。
这个东西应该是火了很长一段时间,当然现在还很重要。但是各个专家领域里比较容易获取的rubric,很快就被收得差不多了。看到比如说像Mercor或者Surge AI的崛起,其实跟这一块的专家rubric有关系。但是再往前走,就大家需要动手了。比如说现在做这种代码模型,或者像一铀他们做的ALE,虽然它不是做代码,但它需要“动手”,要解各种各样的问题。
这个时候,它就不再是说我只是验证你一个聊天的输出了,那我需要是在一个Agent的环境之下,那我可能需要给它一些工具,还有一些更复杂的验证方式。它还包含了rubric,但是可能我需要一些检查这个环境里面的变量是不是执行了,这个数据库是不是写入了,或者被删除了。甚至如果像是我生成一些文档,里面可能有些图,这个东西我还是需要rubric,但是我需要一个agent来检查,它就变得更加多样了。
现在可能大家追求的比较大的一个方向就是环境,它不光是我标注好的一些打分规则了,而是说我可能包含了一整套“我要做什么”,“在什么样的环境里面做”,包括了它需要的一些工具,需要执行的一些沙盒,以及还有一套跟task比较相关的验证方式。验证方式非常多样,比如说有这种Programmatic check(程序化检查),有这种rubric,还有偏好,我让人选我比较喜欢哪一种。
这里面我暂时还没有形成特别大的共识。我又看到有点像当年rubric时代,每一家要的东西都不一样。比如说像Terminal-Bench(终端任务基准),他们就不要rubric,他们就是纯programmatic。这里面也有不同的流派,还挺有意思。
Yiwen:一铀,你要不要从ALE的具体例子,来跟我们讲一下需要哪些要素?(注:ALE,Agents’ Last Exam,由加州大学伯克利分校RDI与300多位行业专家共同牵头构建,旨在评估AI智能体完成真实专业任务的能力。它让专家提交自己做过的项目,并为任务配备执行环境与验证机制,检验智能体能否完成耗时较长、具有经济价值的工作)
孙一铀:其实我跟允中的看法有一点反过来了。允中认为现在rubric差不多已经做到头了,但我的看法是,我觉得rubric这一块,尤其专家那种主观的判断题,其实还做得远远不够。我可以先从ALE的初衷讲一下。ALE当时建立的初衷跟允中讲的一样,就是我们怎么样把vibe coding迅速发展的趋势推广到vibe everything。
当时vibe coding为什么发展那么快?因为当时有非常非常多的Benchmark(评测基准)都在coding这个领域,而且coding它比较容易验证,它是一个确定性的rubric。大家为了刷这个榜,所以在coding这上面发展非常迅猛。那么用同样的思路,我们如果在其他各个领域上,尤其是工程,能够客观打分的这些领域上,能够建立各种各样的评测体系,你去刷分,但你只要刷的是有益的分,是有意义的题,那它模型带来的提升,对于人的日常工作来说,就是实打实的提升。
所以这就是我们当时想建立一个这样的初衷。当然世界上大家职业各式各样,实在是太多了,浩如烟海,所以我们只是说在第一个版本里面,给出了一个相对来说覆盖面比较广的初次尝试。然后我们还会继续努力,希望把这个覆盖得更广一些。到某一天希望它能成为真正的last exam。就当你解决这个benchmark的时候,基本上就能解决人类社会在某些领域的真正的有益的问题。
据ALE官网介绍,其评测覆盖55个非体力类职业 图片来源:ALE Blog
何允中:我同意一铀的观点,各个领域的训练肯定是远远没有到头的,很多东西都可能还没有被rubric的方式表征出来,所以这里面还有很大的空间。可能我刚刚说rubric到头了,更多的是个行业趋势,就这种静态的单轮或者多轮聊天,出一个文本,然后用rubric来检查它,就是纯知识类的。甚至也不是说到头了,因为毕竟还有不同的lab,每家的水平都不一样。
只是说今年的一个大趋势是在做coding,然后coding逐渐转向了Knowledge work,大家要动手了。这个时候,文本的rubric,我看到需求量小了一点,但还是很大,还是有很多东西没解决。
03
做评测与卖数据,边界在哪里?
Yiwen:我想再追溯一下评测近几年的发展,以及它和卖数据之间的关系。Benchmark和卖数据这两件事情,大家都觉得不能混为一谈。Scale AI之前推出了Humanity’s Last Exam,就是HLE这个评测,能不能给我们讲一下这个评测,以及你觉得它和数据之间是怎么样联系起来的?
Humanity’s Last Exam成绩曲线 图片来源:lastexam.ai
何允中:这是个好问题。我觉得从原理上来说,评测它体现的是模型距离我们想要的理想状态中间的gap。它更多的是一个科学研究这么一个基准,就是我想要模型在哪,它现在没到哪。但是这个事情跟卖数据联系起来也比较有意思。因为很多时候,它提升这个模型能力的数据,和它榜单的评测方式是息息相关的。这里面可能比较难的是找到一个平衡。如果我就生产大量跟这个榜单差不多的数据,那么它可能就在Bench-maxxing。
但是这个大模型训练还是有各种各样的维度,确实如果我想要提升某一类的能力,我需要抓住某一个维度,那么它跟benchmark肯定是有一定的相关性,这个是大家需要找到的一个平衡。因为大家对AGI的期待太高了,觉得人能做到的事情它都能做到,就是说我在各种各样的领域都可以想到一些方式构造一个benchmark,然后发现它这个模型距离你想象当中还有一些差距。
通常构造这个benchmark的人,对于这一块的领域可能认识比较深,就自然会给他一定卖数据的权威性,大家会比较相信你手上卖的数据。这个生意就这么产生了。现在ALE也是做得很火的benchmark,我相信也有不少人想问一铀卖不卖数据,或者可能VC也想找你投资,结果逐渐逐渐地就成了一个生意。
我觉得也有好有坏吧。这个生态其实也还比较野蛮发展,有多少是在做科学,多少在做bench-maxxing,我觉得确实需要仔细权衡一下。但是这确实是有很多的利益驱动,所以现在是个挺繁荣的市场。
孙一铀:对,这里的话,我也是要给大家敲个警钟。因为允中提到了,现在做benchmark的人会收到各种各样的诱惑,要把benchmark数据拿去卖。我甚至私下听到,有一些数据公司踩了这个红线,它把自己在做评测的数据去卖。当然这个是大家千万不能碰的一条线,不能让你做的生意污染你这个benchmark的权威性,不然的话,你不仅毁了你的benchmark,也毁了其他人的模型。
我个人认为benchmark和卖数据,这两个东西角色是不一样的,在这个生态系统里的地位是不一样。我认为benchmark面向的是未来,做数据面向的是现在。Benchmark是面向于未来,大家还希望这个模型公司去解决目前还没有解决的什么问题。ALE其实我们在今年1月份、2月份做的时候,我们特别害怕benchmark做得太难,导致这个benchmark失去意义,因为当时的模型很多基本上平均分只有10%到20%,大部分题目它都只有拿到零分。
我很担心这样的评测它会失去意义。但事实上没有必要担心这个事情,因为benchmark本身要面向于未来的模型去做的。数据的话更多是去解决这个benchmark所产生的一些需求,所以现在大家刷这个榜单,更像是说怎样去把这东西做好。我认为benchmark-maxxing(刷榜)它有好有坏,你只要面向了它这个数据,它不是直接污染你这个benchmark,你这个benchmark刷的又是有意义的一个榜单,只要这个benchmark和人的真实用户的体验非常接近,我觉得这bench-maxxing它不一定是一个贬义词。
04
垂直行业数据:难在采购
Yiwen:能不能深入讲一下数据采购这件事情?第一,你提到了刚才有很多小的公司,其实是现在一个创业机会,这也是为什么我们看到最近兴起的一些三五个人组成的数据创业公司,拿到了非常高的估值。这是不是因为他们的目标就是这些非常垂直的领域的数据?
何允中:我觉得这里可能有几块问题。首先我觉得最近兴起的这些RL environment公司,其实更多的是在做合成。因为整个数据行业已经从找人标注,慢慢地过渡到你要交付的是一整套环境,然后这个环境可能需要大量的这些工程工作在里面。很多在这些合成的技术栈上做得比较好的一个小团队,其实可以比较短的时间交付大量的合成环境。
这未必是不好的,就合成它有时候你也可以基于一些强的模型,或者说基于一些半成品的artifact,是可以做出一些好东西来的。现在这里是一块增长。但是再往下走,这里面比较有意思的是,这个东西之所以能成立,因为大家今年的主题是在卷代码。软件行业非常的open,有大量的公开资料,而且我们生产数据的公司,同时大家都懂代码,所以就这个比较好解决,让一些小的团队有很多机会给自己造很多数据。
但是我觉得再往后面走,比如说这些其他领域的垂类,就更复杂了。这里面我会看到有一些公司,他们可能解决两个不同的问题。比如说像我们做后训练数据,其实在我看来是两个问题:第一是采购,我要把原材料买回来,就好像ALE让大家上传,这是一个比较新的激励机制;然后加工,就是我们再把它标注,或者是通过一些agent pipeline把它做成适合大模型训练的环境。
在这个垂直领域问题上,其实采购变得越来越复杂。就甚至代码领域,其实采购一些私域的代码仓库,谁能把这个问题解决好,其实是一个巨大的优势。那么在垂直行业,比如说我如果是做芯片设计的,我可能要把整个芯片设计的环境给造出来,可能当中涉及到一些商业软件,那我怎么样把这些商业软件的版权拿到,把它包在这里面就是一个问题。还有一个就比如说做DevOps(开发运维),我要是一个系统工程师,我要操作什么AWS之类的,我知道有个公司做了一整套AWS模拟器。
每一个垂类的环境都有一些很深的东西,你可能要采购,可能要定制软件。大家抓住一两个垂类,把这个东西做好,其实创造了很多新的机会。
Yiwen:因为刚才我们提到这些垂直场景,比如说在药物发现这些生物医药方面的,还有一些具体行业的评测下面,我们可能没有足够的场景,或者没有足够的好的评测。在这种情况下,我们有足够的好的数据吗?
何允中:这里其实有一个难点。每个领域它都是需要一些人把他的专业知识吐出来之外,我还需要这个领域的东西。像药物发现,我可能需要很多私有的数据库,这方面我认为是目前这个行业一个大的卡点,就是你先要能把这东西买到,你知道大家手上有什么,才能把它做成benchmark。ALE其实很大程度上是在解决这个问题。
孙一铀:对,ALE希望大家能够以众包的方式,让专家把之前自己做过的project交上来。当然这里面有一些不符合规范的,我们都筛掉了,比如说我们现在在V2中,我们也尝试去收一些数据,比如说Steam上的一个游戏库,就游戏开发的一个任务。那种名不见经传的,大概几千人体量的MOBA(多人在线战术竞技)类游戏,它要价能要到两三百万人民币一条。我觉得哪家数据公司或者别人做benchmark,都没有这个财力去做这个事情。
何允中:对。就比如说很多公司想要采一些游戏的视频,然后做些标注,游戏视频可能是版权数据。这里有一个巨大的采购问题。我觉得这里是一个商业机会。我现在其实看到不少startup在解决这些问题,就其实大的数商我们自己也在投入做一些采购方面的工作。但是总体上来说,我觉得这里还有巨大的问题没有被解决。
ALE的行业版图,气泡里的图标是真实工作流中用到的专业软件 图片来源:ALE论文(arXiv:2606.05405)
孙一铀:对,我们在做ALE V2,想要把比如说一个领域做深的时候,我们会尝试先捋一个领域,它会有哪些工作流,会有一个树状结构,尤其在生物学这一方面。然后我们基于Nature出版物,它有自然的分类,子学科分类,然后把这个树展开到第三级的时候,大概有3000个节点。然后我们也做了一些工作,把现在已有的市面上的life和bio的benchmark已经覆盖了多少,做了一个统计,大概是10%、5%都不到,甚至市面上连一个成型的、覆盖面完全的benchmark都没有,更别说是针对这个去做相应的数据。
05
数据公司的竞争
最终是研发能力的竞争
孙一铀:这个地方我想问允中你的看法。因为我个人认为,随着模型的能力越来越强,模型公司自己内部创造数据的能力也越来越强。这一点你认为这个饼是越来越大的,但有没有可能会出现一个情况,这个饼面向于非头部公司的机会,反而门槛是越来越高的,入场券是越来越难拿的?比如说数学这块领域,之前的话,大家只需要去影印那些奥数课本,就能够去批量造出大量的数据,但这些数据现在基本上是零价值。所以你是怎么看待未来的数据公司的发展方向?
何允中:我会觉得从第一性原则上来说,还有巨量的问题没有解决。你要想这个世界上还有多少东西没被蒸馏干净,是巨大的机会。但是如果你就看现在大家是怎么运行的,这个事情当然会越来越难,因为越来越多的玩家进来了。我觉得大家如果只盯着我手上的工作,这个一定是越来越难做的。就算这个lab不自己做,越来越多的竞争对手进来,你的利润率也会越来越低。
所以在我看来,一个好的数商其实最后解决的是个研发问题了,就好像一个软件公司一样,我要提前投入未来大家需要的东西,赚到钱之后我再投入下一个东西。在lab本身,我有个暴论:可能lab未必有最好的基因来解决数据的问题。这里面可能有几块。比如说合成数据,合成数据其实按理说很多就是这个lab research的本职工作了,尤其是搞后训练的,大部分时间都花在搞数据上了,就是买数据、核数据、验证数据、洗数据。
但是这个领域你会觉得,为什么外面的人会有机会?今年的这一波增长都来自于一些懂行的人在外面把这个数据合了再卖回去。所以这个事情是存在的。我觉得一方面是因为大模型公司现在有太多的钱,就是你自己造,外面买其实也不矛盾。但是在更长远上来说,其实有很多问题可能模型公司没有太好的基因解决。比如说,如果我要采购,我要把一些行业的东西先采购回来,蒸馏出来。
这个时候我会觉得大的lab可能未必有那么大的优势,它甚至可能会有一些利益冲突。比如说一方面把你的这个FDE(前线部署工程师)派到了人家企业里面,然后另一方面你有一拨人在搞这个企业数据。那么我会觉得如果我是一个企业,我是不太放心把我的数据交给你的。出于这些原因,有一些东西可能lab不太适合自己做,它可能还是需要第三方的这个人帮他做一些采购,或者深入到一些行业领域里面去。
我会觉得一个数商真正要做的事情是在研发,看看未来还有哪些行业是重要的,这些行业有哪些东西我要值得投入,把东西买回来,然后我自己先投入R&D(研发),把这个行业的问题给研究清楚,然后再把它做成benchmark或者数据,甚至证明这个东西的有效性,然后我再转手卖给lab。从lab来说,就是大家的deadline都很死。
如果我是一个lab的研究员,如果你让我花半年的时间来解决一个行业,可能有时候大家其实没有自由度。就是这个时候你看到那边有一个数商说,我把那个行业的东西搞清楚了,你要不要?大家通常都会看一眼。所以长期来说,拼的还是一个研发能力。
06
数据污染、专家造假
Benchmark为何难做?
Yiwen:接下来还想再聊一下数据污染的这个问题。因为今年2月的时候,OpenAI就宣布停止报告它在SWE-bench Verified里面的分数。这个其实也是一套评测,具体来说,就是让AI修复真实开源软件里面的项目问题,再通过这个测试来判断它有没有修好。当时OpenAI主要是指出了两类问题:一类是它测试本身可能会有缺陷,比如说有的功能上正确的解法也会被判错;另一类就是数据污染。
这个我觉得很有意思,他们发现是在特定提示下面,模型能够复现部分题目原本的人类修复代码,也就是说,模型很可能在训练过程当中就已经接触过相关内容了,所以这个分数就变得有点难解释了。我想问一下两位是怎么理解数据污染这个问题的呢?
何允中:就SWE-bench这一类数据其实有一个问题,它可能甚至还不是污染,就是它task可能就做得不够好。比如说有时候有一些错误是假错误,比如说可能我的测试脚本要求得太多了,或者是我的task没讲清楚,有这么一些类型的原因。另外一个污染可能是说,模型预训练的时候把这些东西都训练进去了。这里面其实是有一些技术可以检测到这些东西。我想这ALE上面应该会有一些这种经验。
孙一铀:他说不采用SWE-bench,是连SWE-bench Verified也不采用。当一个benchmark在过去的6个月内只从74%提升到了80%,剩下那些问题可能是脚本写得太严苛了,或者它的题目本身就是不可解,或者是会有各种各样的问题。它剩下的可能20%都是集中在这个问题上,那这个benchmark本身可能就失去了它对比的意义。
ALE也没有解决一个问题,这个也想跟允中探讨一下。当一个专家他本身提交上来的材料本身是错的时候,我该如何去预防这个问题?这个是我们真实发生过的。因为我们专家五花八门的,当然这样的人很少。他是为了提交这个任务,为了拿到作者署名,因为我们的奖励机制就是你提交了这个东西,我们接纳了你这个任务,你就能被纳为作者列表的一部分。
确实是有人为了提交而提交。他甚至起了agent去合成一堆乱七八糟的数据,甚至有些数据交上来,我就肉眼看出来他就是编的。这个东西是确实是对我们的工作造成了很大的困扰。
何允中:这是个特别大的问题。Scale AI总是有人,总是可以靠人解决的。这里有个特别有意思的问题,比如说一铀提到了,我给他这个署名权是一种奖励机制,那会带来一定的问题。比如说就Scale AI,那更原始的,比如说我就给你小时工,那大家也有一些偷懒作弊的方案。我会觉得这个奖励机制是个特别特别难的问题。
长远来说,比如说我的目标是把人类都蒸馏干净,对吧?怎么样设计一个好的奖励机制,把大家的目标都协调一致?我觉得这里其实有特别大的空间,这里可能是个巨大的Research area。我自己心中可能有一些方案,Proof of work(工作量证明)。比如说,我要求你把做这个东西的一整段工作流程全部都录下来,你必须要做到多少时长,或者怎么样。
不同形式的问题,它有不同形式的奖励和验证机制,这里面其实有很多玩法,值得大家探索。
Yiwen:这里面其实也涉及到一个更大的问题,就是很多数据它本来也就是公开数据,就是网上的一些资料、公开代码这些东西。所以这些数据是不是本身就注定了会有污染?一般是怎么样处理这些情况?
孙一铀:其实最简单的污染,你直接其实问agent,它都能找到。公开数据其实还好检测。我觉得最难的是编造数据。比如说让你去做一个化学模拟,就它根本就没有跑过这个任务,它自己编了一套似是而非的东西,你没有个几个月根本查不出来这个问题,因为它看上去很真。什么时候能发现这个问题?当所有的agent它的能力基本上远超这个问题本身的时候,他发现所有的答案他们都是做出来是一样的,但是跟这个真实答案是不一致的。
这个时候我们就会查出问题。但这个周期会非常长,然后你让另外一个专家去验证这个问题,它成本又非常非常高。因为它本身这个问题,它都是要专家花一个多礼拜或者两个礼拜才能做出来。
07
代码是Agent的手脚
数商必须持续迭代
Yiwen:其实我本来是想问一下真实工作流的数据,但是听下来大家现在还是在卷coding数据,是吗?不是在做真的workflow。因为我理解是比如说像Mercor这样的公司,就是有在卖一些真的workflow的数据,但是听起来coding现在还是这个赛道最卷的。
孙一铀:其实你怎么定义真实工作流的数据?就真实工作流的数据,本质上它都能够被划归到一个coding的问题。就比如说对3D建模这个问题,其实有很多,比如说FreeCAD什么,它都是提供了现成的API,让你去做这个事情的。就是这不是传统意义上的coding,就是让你去写一段代码,去解一个LeetCode这种coding题,它是用coding去解决真实workflow。
所以说只要有足够的MCP、API调用,它其实本质上95%以上的任务都能够被划归到Coding的问题上来。
何允中:对,就是可能有一些小的,可以看它这个task本身是要的什么东西,它涉及到的一些环节是什么,能把它归结到不同领域的工作流上去。但是就我同意一铀说的,现在你让agent来做事情,代码就是它的手跟脚,所以它其实归根结底,Coding肯定是其中的一环。
Yiwen:是的,但是听起来其实数据行业本身也是在变化得非常快,因为就像我们刚才提到,从这个rubric data到RL环境的这样一个变化。所以有什么信号会让你觉得有某一个领域或者某一个赛道,它可以持续地增长吗?
何允中:我会觉得就首先还有很多没有解决的问题,机会还是很多的。另外一方面有越来越多的玩家进来了,比如说每年都有很多新的Neo Lab,资本市场还是以这个方式运作的话,就这个饼是越来越大的。但是这个数据变化很快,不太像是一个我可以躺在一个地方一直吃老本的生意。数商要疯狂地迭代自己,最后可能是拼大家的R&D的能力,或者说谁能把这个R&D的能力本身固化,做成一个flywheel。我有一个流水线,可以一直在发掘新的东西,也许这个是未来最大的优势。但是就总体上来说,我会觉得现在是百花齐放,未来机会还很多。
(嘉宾观点仅代表个人,不代表所在公司、机构或客户)
本文来自微信公众号“硅谷101”,作者:Yiwen,36氪经授权发布。
前因后果
- OpenAI就模型越权访问澳洲政府网站致歉iThome 台湾 · OpenAI
- 从Siri到Muse:个人助理的16年接力36氪 人工智能 · OpenAI
- AI基建竞赛转向:Meta 14GW野心与电力瓶颈钛媒体 · OpenAI
- Anthropic研究员的“逃离湾区”计划36氪 人工智能 · OpenAI
- OpenAI首份青少年报告:日均不足15分钟,安全提醒遭质疑AIbase AI新闻 · OpenAI
- 阿里拟领投UniPat 3亿美元融资品玩 实时要闻 · Scale AI