Create

Sign in to ReadmeX

Sign in to join communities, post, vote and chat.

or

New here?

Story

PaperBenchX: best AI agent fully reproduces only 14% of papers

AI summary

UniPat AI's PaperBenchX benchmark gives 10 frontier agent configurations a published paper and asks them to re-run the key experiments in real scientific software, across 93 tasks covering 12 research directions. According to the team's published results, 70 of the 93 tasks were not fully reproduced by any configuration, and the top performer, GPT-6 Astra, fully cleared only 14% (13 tasks), while Chinese models clustered around 7% — roughly half that. Scoring separates modeling, execution and scientific verification across 3,168 scorable criteria, with a 4–24 hour per-task budget and outputs wiped and re-run in an isolated environment before grading.

Why it matters: Reproducibility is the groundwork for letting AI agents run research, and this benchmark turns "can AI reliably reproduce existing work" into something that can be checked item by item.

UniPat AIPaperBenchXGPT-6 Astra

14
Source text品玩 实时要闻 · 13 min read

AI 正在承担越来越完整的科研工作。人们对它的期待也从辅助研究,延伸到了自主发现。

10 月 6 日,OpenAI 一次性公开了由内部前沿模型产出的 722 篇数学论文手稿,并为其中部分证明提供了可由计算机检查的 Lean 形式化版本。AI 参与科研的成果,正以越来越大的规模呈现在人们面前。

但成果越多,验证也就越重要。OpenAI 在发布中明确说明,这批结果处于不同的验证阶段,部分非正式的结果仍可能存在问题。

这也是 PaperBenchX 想要讨论的事情。

它由 UniPat AI 推出,关注的正是模型交出的研究成果,能不能经得起独立检查,以及该如何检查和衡量?

PaperBenchX 评测的角度也很巧妙:通过给 AI 一篇已经发表的论文,让模型在真实的科学软件中,把指定的关键实验重新做一遍,来观察它能否交出规范的实验流程,并执行得到可验证的结果。

10 个前沿 Agent 配置参与了这一评测。结果是,在覆盖了12个科学方向的 93 道题中,有 70 道,没有被任何配置“完全复现”。即使是表现最好的 GPT‑6 Astra ,也只有 14% 的任务能过关。而国产模型,基本在 7% 左右,只有 GPT‑6 Astra 的一半。

PBX 中的前沿 Agent 表现。柱状图表示完整得分(> 90%);方框表示部分得分
PBX 中的前沿 Agent 表现。柱状图表示完整得分(> 90%);方框表示部分得分

一直以来,可重复性是科学的关键特征之一:一项结果的意义不仅在于它已被发表,更在于其背后的假设、程序和证据可以被重构并独立检验。

放到 AI for Science 里,可重复性同时也是未来 AI 自主发现需要打牢的地基。在 PBX 里,已有论文提供了明确的目标,也提供了检验方法是否成立的参照。模型能否复现实验过程,直接关系到我们能否把更开放创新性研究放心地交给它。

这也是我们觉得 PBX 重要的原因——它把“AI 能否可靠地复现研究”,变成了可以逐项检验的问题。

当模型不断突破智能上限、解决科研难题时,总有人要关注:这些能力能否支撑它按科学规范完成整个研究过程,模型进入科研人员的日常工作后,究竟能承担多少工作,又有多少成果值得信任。

团队也公开了相关研究和背后的思考,感兴趣的读者可以进一步查看下方链接:

GitHub 开源链接:

https://github.com/UniPat-AI/PaperBenchX

官网 Blog 链接:

https://unipat.ai/blog/PaperBenchX

模型们都错在哪里了?

先看 Astra 做的一个“八单元手机 MIMO” 天线任务。

简单说,就是塞进手机里的 8 根小天线,要同时工作、互不干扰。它要求模型搭出结构,在电磁仿真软件 HFSS 里算出匹配、隔离、效率等一堆性能,看是否和论文一致。

GPT‑6 Astra 花了 187 轮交互,2.83 小时,跑了两组仿真,不仅都收敛了,隔离、增益等部分指标也过了关。

但问题出在一个关键尺寸上。

它在建模时写进了参数文件,却没有进入真正被计算的结构。 就像照图纸造东西,尺寸抄对了,东西却没照着造,最终未能通过核心性能检查。

这也是科研 Agent 的一道难关:论文里的要求,需要在长周期执行中,始终准确地传递到不同环节。

另一个天线任务,要求比较三种结构,DeepSeek-V4.1-Flash 完成了三组计算,也发现了需要调整的地方。但最终,总分却只有 13.2%,科学验证一项得分为 0。

这是因为,它修正端口方向时,最后一次完整重跑已经结束,交付前没有再完整检查修改后的流程。此外,计算一项指标时,它还漏掉了公式中的平方。

多轮实验探索,是相互递进的。这个错误反映出的是,Agent 必须知道,每组结果对应哪套设置。

改动一个参数后,哪些计算需要重做、哪些图表需要更新、哪些结论需要重新检查,都要沿着这些依赖关系跟进。

这也是 PBX 把评分拆成三类的原因:建模,看研究对象搭得对不对;执行,看规定的计算有没有真跑、证据留没留住;科学验证,看算出来的东西能不能撑起论文要的结论。

做对不少步骤,为什么还是没做成?

把具体失误放回总榜,模型之间的差异就更容易理解了。

PBX 让 10 种前沿 Agent 配置接受相同的 93 个任务。看它们完成了多少步骤和结果上的评分要求。

受测模型中,Astra 以 59.08%领先,Fable 5.1 和 Fable 5 都在 58%左右,与它接近;而国产配置中,Kimi K3、Qwen3.8-Max 则分别约 49%、47%。

10 组受测配置在 93 个复现任务上的总体与分阶段表现
10 组受测配置在 93 个复现任务上的总体与分阶段表现

再看模型们能完整完成多少任务。

单项得分严格超过 90%,才达到论文定义的“完全复现”门槛。Astra 过关 13 个,两个 Fable 分别过关 12 个、11 个,Opus 5、Kimi K3、DeepSeek V4.1 Flash、GLM5.3 都为 7 个,而 Qwen3.8 Max 和 HY3 分别为 5 个、 2 个。

想要理解这些分数背后代表什么,就要进一步拆分得分项和操作轨迹,继续追问:模型已经做了这么多工作,为什么仍然很难交出一次完整复现?他们之间的差别又到底在哪?

下面这张图,把这个问题往下拆了三层。

受测配置的阶段表现、交互时长和工作流程分配
受测配置的阶段表现、交互时长和工作流程分配

图 a 里,建模和执行的平均得分都在六成以上,但科学验证却只有约 43%。模型已经能完成不少建模和计算工作,但要让这些工作最终支撑一个可信的科学结论,仍然差着一截。

那么让模型多试几次,能解决吗?

答案是,不行。这也是图 b 有意思的地方:Fable 5.1 平均只用了约 113 轮交互,平均得分达到 58.17%;Astra 平均约 349 轮,得分为 59.08%。前者用大约三分之一的交互轮数,就拿到了相近的成绩。

操作记录提供了一些解释:漫长的交互,可能耗在反复尝试、故障恢复,以及对错误设定的持续计算上。模型一直在做事,但价值不高。

于是,问题又往前走了一步:这些时间,究竟花在了哪里?

图 c 拆开了模型在不同工作环节中的时间分配。专业软件的实际运行占去了大部分工具操作时间,但在启动这些计算之前,各模型投入的工夫并不一样。

这里值得注意的是 Fable 5。它同样以较少的交互取得了接近领先的成绩,并将 37.1% 的工具操作时间用于论文重建和代码实现,在论文抽样分析的 4 个模型中,前期投入比例最高。

这也说明,模型需要在计算开始之前,把研究对象、关键参数和实验方法弄清楚。

如果一开始就搭错了结构,后面几个小时的顺利运行,可能只是在更充分地计算那个错误的对象。前期及时确认设定、用小规模实验检查问题,才有机会让后续的大量计算产生有效证据。

看到这里,再回头看一项没有过关的任务,就不能只用“模型没做出来”概括了。

有的模型确实完成了实验,但设定或分析出了错,没能支持目标结论;有的则连结果如何产生,都无法独立核验。只看最后的分数,很难分清下一步应该改哪里。

PBX 把阶段评分、实验记录和独立重跑的证据结合起来,正是为了追到这些差别:模型需要补的是科学判断,还是实验管理,又或者是让结果能够被别人重新检查的能力。

PBX 如何把这些问题测出来?

想要通过一个 Benchmark 测出这些问题,并不容易。

一个难点就在于“出题”,它需要研究者自己先说明白:每一个实验具体要求什么,以及什么样的证据能够证明它的每一步都是对的。

PBX 的做法是,找到领域专家,先跑一遍复现的全流程,包括要复现什么,哪些条件不能改,什么结果才算达标,并在亲自跑通参考流程时,确认任务能在规定资源内完成,再把科学要求拆成评分项,检查评分器能否区分完整成功、部分完成和无效结果。

PaperBenchX 的两阶段、九步任务构建与验证流程
PaperBenchX 的两阶段、九步任务构建与验证流程

整套任务与评分规则的建设,累计投入了超过 1000 小时的博士级专家工作,平均单个任务耗时 10 个小时。这是一项庞大的系统性工程。

在这个基础上,PBX 还有四个值得参考的设计亮点。

  • 重视环境,使用了真实科研中的专业软件。

PBX 的领域覆盖非常广,有 12 个研究方向,且挑选出来的复现任务,基本都来自于领域优质期刊。

图注:PaperBenchX 的任务分布、来源论文与评分项构成
图注:PaperBenchX 的任务分布、来源论文与评分项构成

它也对应了 10 种领域原生科学计算环境。做天线,就要在电磁仿真软件里搭建结构、设置参数、计算性能;换到化学或材料任务,又要使用相应的工具和方法。

这让论文复现走出了通用代码环境。模型需要把学科知识落实到实际实验里,接受专业软件的计算规则和科学要求的检验。

  • Agent 提交实验包,PBX 清掉旧结果,重新运行并评分。
评测系统机制示意,从“任务包输入”到“基于回放的评分”
评测系统机制示意,从“任务包输入”到“基于回放的评分”

Agent 提交作业后,PBX 会删掉全部输出、断网、在隔离环境里重跑工作流。只有重跑产出的科学产物进入评分——每条评分项锚定一个具体的科学要求,由程序检查和大模型打分判定。

这一步检查的是:实验是否缺了步骤,是否依赖没有交代的临时操作,结果是否确实来自当前提交的代码和设置。

这个思路也很有意思。科学研究本身就需要“可复现”,那么 AI scientist 也要能复现已有研究,甚至 AI 对于已有研究的复现也要“可复现”。

PaperBenchX 把自己变成了一个严密的“可复现循环”。

  • 时间和算力有预算限制,Agent 需要自己分配研究安排。

单任务预算 4 – 24 小时,中位数 7 小时。在这个窗口里 Agent 要自己分配算力、检查中间结果、诊断失败、决定要不要再跑一轮——和真正的科研人员面对的节奏一样。

  • 检查实验与分析是否成立,验证科学结论是否有可靠依据。

模型把计算跑完、得到一个符合预期的数字,还不够。所用的方法是否适合这个问题,分析有没有依据,必要的对照和检验是否完成,这些都决定了结果能不能支撑论文要求的结论。

PBX 将这些要求拆成具体评分项,包含了 3168 个可评分标准,每项任务的中位数为 38 个。

数值、单位等交给程序核对,需要专业判断的部分由大模型依据专家制定的标准、结合实际证据评审。不是模型自己说“复现成功”,就算数。

从专家出题,到真实环境中的实验,再到独立重跑和证据核验,PBX 把一项研究变成了可以逐项验收的任务,让模型做对了什么、又在哪里出了问题,也就都有据可查了。

为 General AI Scientist 建立一个可衡量的起点

谈及“AI 自己做研究”,人们很容易想到让它提出新想法、攻克难题。

但研究要继续往下走,模型还得弄清楚:上一次实验到底证明了什么,眼前的结果,够不够作为下一轮研究的依据?

从这个角度来看,PBX 的可靠复现为 General AI Scientist 建立了一个可以衡量的起点。

在研究团队的设想中,给出论文,让 Agent 按照已有方法,把结果重新做出来、留下可信的证据,只是第一个阶段。

,论文提供的帮助会逐渐减少。研究者只给出目标或已知结论,不再提供实验流程,让 Agent 自己设计实验,判断目标能否实现、结论是否成立。这一步是自主验证。

再往前,连研究什么也需要模型自己判断。面对多个可能方向,它得提出有价值的假设,决定哪些值得投入资源。在需要实物实验的领域,还要走进实验室,接受真实世界的检验。UniPat AI 透露,未来也会在湿实验上有进一步的工作。

这条路径要求模型逐步承担更完整的研究责任。PBX 先检验其中的基础能力,也就让后续进步能够建立在可检查的结果上。

这种能力首先服务于 AI for Science,也可以向 AI for AI 延伸。模型提出新的算法、训练方案或工程优化后,同样需要控制实验条件、管理版本、检查指标,并确认提升是否能够重新验证。

它也关系到我们能否放心把一项数据分析、行业研究交给它。任务大小不同,对可信结果的需要是相通的。

此外,PBX 还有一种更长远的潜力:让 AI 通过复现已有研究,为自己生产新的学习材料。

眼下,已经为评测搭建的任务,就可以成为尝试这条路径的起点。

研究团队告诉我们,他们已经从实验轨迹中观察到一些值得学习的做法。例如,较好的 Agent 会更早明确关键科学设定,也会先跑小规模样例,确认软件和关键输出正常,再扩大到完整实验。这些记录经过检查和筛选,就有机会用于训练,让其他模型也学会怎样安排实验、发现问题和处理错误。

更大的空间,在于模型的可靠复现能力提高之后,它能够自己完成更多这样的实验。

人类已经积累了大量科学文献。但论文中的文字、公式和图表,通常呈现的是整理好的方法与结果。真正动手时,参数该怎样落实,异常该从哪里排查,修改之后哪些结果需要重算,未必都能从论文里直接读到。

如果训练需要这些操作与判断的经验,过去往往得设法收集研究者在真实软件中的工作记录。而随着复现能力提升,在具备实验环境和验收标准的条件下,Agent 就有机会自己去重做更多论文,生成带有验证反馈的科研训练数据。

可靠复现由此连接起了今天的评测和未来的数据生产:它既能检验 AI 目前能把研究做到什么程度,也可能让 AI 自己积累更多学做研究的材料。

这也是 PaperBenchX 作为迈向 General AI Scientist 第一步的意义:为宏大的科研期待提供具体的练习题和验收标准,让人类已经积累的研究成果,进一步成为 AI 学会研究的起点。

过去一年,我们急着让 AI 写出人类没写过的论文,但或许,它下一轮成长需要的新方向和新材料,可能就在那些已经读过、却还没有亲手做明白的旧论文里。

Read the original →

How we got here

  1. NYT v. OpenAI docs renew debate on paying for AI's news use科技新报 · OpenAI
  2. OpenAI expects annualized revenue to reach $70B by end of 202636氪快讯 · OpenAI
  3. Google's Gemini agent can route work between Gemini and Claude虎嗅 AI · OpenAI
  4. Synopsys eyes China AI lab partnerships to speed chip designAIbase AI新闻 · OpenAI
  5. Garfield, after playing Altman in 'Artificial', says he distrusts today's AIDoNews · OpenAI
  6. OpenAI posts 722 AI-generated math manuscripts, retracts 3 over sign error36氪 人工智能 · OpenAI

Comments

I've used this: share my experience What I think: share my view
How important is this story?No ratings yet

No comments yet. Start the conversation.