深度原理|AI科研「发现回合」评测范式论文发布,MIRA双榜第一

PromptTree|阅读 0
2026/08/24 10:03
深度原理MIRAAI for Science发现回合
8月19日,论文《Measuring AI Scientists: From Exams to Discovery》提出以发现回合评价AI自主科研,作者团队含深度原理及微软研究院、斯坦福等机构。深度原理MIRA平台在Research Claw Benchmark与Science Agent Arena药物发现评测中均列第一,并布局锂电、冷却液与新能源材料自研管线。

考卷式基准告诉不了「AI科学家」能不能在实验室里把实验跑通——「发现回合」试图把评分标准从答题改成整条科研轨迹。对AI for Science赛道而言,这相当于给竞赛画了一把更接近真实科研的裁判尺。

深度原理(Deep Principle)是国内AI for Science创业公司,产品线覆盖化学反应过渡态计算与自主科研平台。8月19日,论文《Measuring AI Scientists: From Exams to Discovery》发布,提出以discovery episode(发现回合)系统评价AI自主科研水平:不只看得分,还看假说生成、方案执行、结果解读与全流程闭环,并强调失败实验数据的训练价值。作者团队包括深度原理、微软研究院、斯坦福大学、FutureHouse、艾伦人工智能研究所、加州大学伯克利分校等;深度原理为唯一中国产业共创方。

深度原理的MIRA平台被论文与公开基准共同引用为产业样本:在Research Claw Benchmark与Science Agent Arena药物发现评测中,MIRA均列第一,且任务平均成本处于行业较优区间。平台架构上分三层:多智能体小队负责规划调度;高性能计算与自动化实验双引擎干湿联动;底层科研记忆体系沉淀项目数据与试错结论。公司依托自建高通量实验平台,在锂电、工业冷却液、新能源材料等方向布局自研管线。此前React-OT等模型侧重单点计算加速,MIRA则把「算得快」接到「做得成」的闭环上。

发现回合相对旧基准的差异:

  1. 旧标尺:HLE等闭卷知识考试,只看最终答案。
  2. 新标尺:记录整条科研轨迹的科学性、严谨性与有效性,失败数据亦计入资产。
  3. 产业含义:上半场比谁知道得多,下半场比谁真能做出新材料或新分子。

所谓干湿闭环,白话是计算仿真(干实验)与自动化实验室(湿实验)来回迭代,而不是只生成「看起来能做」的实验方案。Jeff Dean创办Discovery Loop、OpenAI与Anthropic加码AI4S的同一阶段,这条评测框架把行业从「文献聊天机器人」推向「可审计的发现过程」。对投资人,应问干湿闭环数据能否独家、能否转化为材料或药物管线,而不是只看榜单分数。可以把它想成:闭卷考试换成带实验记录的答辩——PPT漂亮不算数,烧杯里得长出晶体。

需要把边界读清楚。MIRA部分能力依赖私有实验平台;论文为学术发表版本,产业转化周期仍长。下一观察点是第三方复现MIRA在客户现场的闭环成功率与单次发现成本。