紫东太初|AutoProject上线:AI4S从做Task走向做Project

PromptTree|阅读 0
2026/08/27 08:11
紫东太初AutoProjectAI科研ScienceClaw
中科紫东太初旗下ScienceClaw推出AutoProject项目级自主科研引擎,以Project2Task规划、TaskExecutor长程执行、EviGraph证据验证构成闭环,推动AI从孤立Task走向完整Project。ARCBenchML上EviGraph综合得分约0.865;论文已挂出arXiv 2608.05225、2608.04738。

AI科研若只会答一道题,却扛不住「从假设到证据链」一整张课题表,就仍是高级搜索引擎——AutoProject把工作单位从Task升级成Project。对实验室PI来说,该验收的不是聊天有多流畅,而是异常数据出现时系统会不会自己重规划、结论有没有可追溯证据。

中科紫东太初是中国科学院自动化研究所孵化的大模型企业,ScienceClaw为其科研原生智能体产品线。公司推出AutoProject项目级自主科研引擎,公开叙事是把AI4S能力从工具级Task执行推向系统级Project承接:真实科研不是任务清单的简单相加,而是从模糊构想出发、多任务相互依赖、随新文献与实验结果不断改线的长期过程。用户提交科研构想或宏观目标后,系统按「项目规划→子任务拆解→长程执行→证据验证→动态修复→成果沉淀」推进。

三层核心能力:

  1. Project2Task:综合目标、文献、资源与依赖,自主生成可执行、可迭代的项目任务网络;支持横向/纵向/先横后纵/先纵后横等拓扑;例:带钢表面缺陷识别课题可由一句目标展开为全周期规划。
  2. TaskExecutor:打破「一次调用、一次返回」模式,全局监控项目状态,捕获实验反馈,失败或异常时回溯评估、重构任务网络并自主重跑;例:YOLO建模链路中数据处理、训练、迭代优化自动衔接。
  3. EviGraph:证据图谱体系,跨子任务校验假设与实验、数据一致性;冲突时沿证据链定位根因并触发修复。ARCBenchML公开测试称综合得分约0.865(最优基线约0.596),Result Analysis约0.794(基线约0.442),Claim Support Rate约0.38(基线约0.27),实验数据一致性EDC约0.88。

系统强调「自主不等于无人」:研究者可随时介入路径、假设与中间数据,人机双向反馈注入领域直觉。紫东太初4.0被定位为具备自主规划、交错思考与反馈修正的多模态推理底座,覆盖生命科学、材料、化学、物理、天文等领域,统一文献检索、代码执行、仿真与专业工具运行时。

产业观察上,继「发现回合」等评测范式把科研从闭卷考试推向轨迹评分之后,AutoProject进一步把评分对象从单次回答拉长到整项课题。竞争重心从「单体Agent分数」移向「规划—执行—证据」能否进真实实验室流程。可以把它想成:过去AI是研究生手里的一个脚本,现在试图当课题组的值班助理——仍要导师签字,但夜班实验与数据核对可先跑起来。对基金与药企研发部门,应问数据驻留、知识产权归属与错误结论的责任链,而不是只看榜单涨幅。

需要把边界读清楚。基准测试为公开材料自述,真实湿实验与同行评审结论仍须人工把关;arXiv论文不代表临床或产业可直接采用。下一观察点是联合实验室课题能否公开复现完整Project日志与证据图谱导出格式。