【科技纵览】近期,OpenAI在数学领域的突破令人瞩目,其模型不仅宣称攻克了N-S方程这一千禧年难题,更接连发布大量手稿。然而,当视线转向UniPat AI推出的PaperBenchX测评时,现实却显得格外骨感。在面对93个真实论文复现任务时,即便是表现最优异的GPT-6 Astra,其完整复现率也仅为13.98%。这组数据 starkly 揭示了一个悖论:AI虽能破解顶级数学猜想,却难以可靠地完成端到端的科学复现。
这种反差引发了学界深层的反思。陶哲轩、邓煜等25位菲尔兹奖得主联名发声,他们并未否定大语言模型的能力提升,而是尖锐指出,将解决数学问题作为基准测试,对数学共同体乃至更广泛的科学与创意职业而言,是一种有害的错位。数学尚有Lean这样的形式化验证工具作为最后防线,但在电磁仿真、材料带隙计算等其他科学领域,缺乏类似的绝对真理校验机制。一个看似合理的数值背后,可能隐藏着错误的物理模型或未收敛的仿真过程。
因此,衡量AI向“通用科学家”进化的首要标尺,并非提出新问题,而是能否可靠地重做已发表的科学工作。复现拥有唯一正确答案,具备可评估性。PaperBenchX正是基于此逻辑构建的国际首个多学科端到端复现基准。它涵盖电磁、光子、化学等12个方向,包含3168条专家校验项。测试规则极为严苛:Agent需基于公开论文和容器化环境,重建科学流程并生成证据。系统会在隔离环境中重跑工作流,只认可重放产物,彻底杜绝“猜答案”的可能。
结果显示,尽管部分任务中AI能产出合理数字,但真正从头跑通且证据可验的比例不足七分之一。这量化了当前AI与理想中跨越学科边界的General AI Scientist之间的巨大鸿沟。目前,UniPat AI团队已开源12个代表性任务,覆盖不同软件栈,旨在为业界提供评测Agent及调试复现工作流的工具。从某种角度看,这不仅是一次技术摸底,更是为科学仿真搭建的一道类似Lean的验证防线,迫使行业正视AI在真实科研场景中的落地能力。
AI科学复现率仅13.98%:PaperBenchX揭示“通用科学家”的真实距离
科技区角
2026-10-08 20:32
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。