科研Agent的硬验收是:不提前告知答案,独立复现已发表论文的发现。Inherent用约270亿参数底座加Agent外壳,公开宣称在论文复现上压过更大系统——再次把「外壳与训练目标」推到聚光灯下。
Inherent Labs是伦敦AI实验室,由Google DeepMind校友创立,约五周前以5000万美元种子轮走出隐身,员工约十余人,计划年内扩至约20—25人。所谓论文复现任务,白话是让Agent在不知道结论的前提下,按论文方法独立重做实验并核对结果——比「聊天里解释论文」难一个数量级;所谓「研究品味」,白话是强化学习奖励不只盯最终分数,还奖励值得做的实验设计与合理的研究路径,避免Agent用蛮力刷榜。
8月22日,公司发布Agent Faraday,公开称在论文复现任务上优于Anthropic Claude Opus 4.8与OpenAI GPT-5.5等更大系统。Faraday运行在约270亿参数Qwen 3.6上,训练侧重强化学习与「研究品味」,并调用GPT-5.5 Codex等现有工具而非重复造轮子。联合创始人Edward Hughes亦公开呼吁英国放松「garden leave」,认为人才流动限制影响创业生态。
产业观察上,小模型+RL+Agent外壳再次挑战「只有更大模型才能做科研」的直觉,与Harness讨论、伦敦DeepMind人才外溢叙事同向。对科研用户,要把「复现」与「发现」分开验收;对投资者,看点是人才外溢能否持续转化为可演示Agent。
可以把它想成:科研不是比谁字典厚,而是比谁更会设计实验——Faraday把「品味」写进奖励函数,是在赌这条曲线比单纯堆参数更陡。
需要把边界读清楚。对比为厂商公开结果;湿实验仍不可省。下一观察点是跨领域扩展能否保持性价比与「品味」可解释性。