九问|ScienceDiscovery以树搜索驱动科研RSI,开源科研工作台

PromptTree|阅读 0
2026/09/05 08:14
ScienceDiscoveryopenJiuwenRSI科学智能
openJiuwen社区开源科研工作台ScienceDiscovery近窗展示树搜索驱动的科研RSI:模型不训练、规则不改,只演进产物。公开案例含振荡积分约2小时236版、AlgoTune平均约2.279倍加速、符号回归约41.4%正确方程;代码开放于AtomGit与GitHub。

科研里最耗人的,往往不是写出第一版代码,而是其后几十上百次试错:积分器差一点、数值例程慢一截、从数据表反推方程写不对。openJiuwen社区开源的AI科研工作台ScienceDiscovery,把这段试错交给程序——模型权重不训练、搜索规则也不改,每一轮变的只有产物本身。近窗公开材料集中展示其树搜索驱动的科研RSI(Recursive Scientific Improvement,递归式科学改进)能力。

九问/openJiuwen侧把ScienceDiscovery定位为一站式AI科研工作台:文献与数据库连接器、沙箱里写跑Python/R/Shell、多智能体拆解任务、全链路可追溯。产品面向可信本地或工作站环境,而不是多租户公有云随便跑危险代码。树搜索跑在这层底座上:并发产生候选、沙箱评估、合并进产物库、按治理规则决定谁能提交。

机制与公开案例:

  1. 树节点:每一版产物可选中、改写、长出分支;高分分支获更多改写机会;失败版本同样入树
  2. 四步循环:选父版本 → 模型改写 → 沙箱评分挂新节点 → 向祖先回写访问记录
  3. 振荡积分:约2小时、236个版本无人干预;第119版在打分集平均相对误差约0.07%
  4. AlgoTune加速:同配置两种子平均约2.279倍,提示词不点名加速技术;对照口径高于部分官方榜与需先RL训模型的方法
  5. 符号回归:约41.4%写出正确方程,每题平均约16.5次调用,deepseek-v4-flash费用开销不足约3元

所谓科研RSI,白话是给目标与评分函数,让代码在沙箱里自己改到够好;所谓树搜索,白话是不只死磕当前最优,还会回到早先被搁置的分支继续挖——积分案例里,最终版本的祖先链路就曾跳回一个早已被超越的中间版。底座把演进循环固定成四个插槽,换算法或换任务主要换插槽内容,并支持多worker异步扩展。

放在科学智能上下文里,行业常见路径是「再训一个更大的科研模型」;ScienceDiscovery展示的是另一条:现成模型 + 可判定评分 + 搜索。它能先跑起来的领域,验证成本必须低到几秒几十秒——代码、数值、符号回归合适;风洞、合成、细胞实验仍会被「等多久才知道好不好」卡住。

产业影响上,对高校与实验室,这降低了「有想法但没人力刷实验」的门槛;对自动化实验与仿真厂商,则提示下一步该补的是更快、更可信的验证器。需要把边界读清楚:案例分数为团队公开评测;开源代码仓在AtomGit与GitHub,部署与安全边界以仓库文档为准。下一观察点是社区对评分函数与科学连接器的贡献密度,以及仿真/自动化实验能否把验证周期压到可搜索尺度。