模型实验室比拼参数时,数据公司比拼的是「谁能持续供应可训练、可评估、可合规的信号」。Snorkel AI的新一轮融资把这条生意的估值又抬了一档。
Snorkel AI是美国AI数据与训练基础设施公司,起源于斯坦福弱监督标注研究,后扩展到data-as-a-service(数据即服务)、合成数据与专家网络标注等组合。TechCrunch报道,公司完成约3.5亿美元Series E,Insight Partners与S32领投,估值升至约35亿美元;相对约17个月前Series D时期约13亿美元估值,接近三倍。收入口径为ARR run rate约3.75亿美元,并称过去十二个月增长约18倍。
融资数字可以读成一张加速表:估值近三倍、收入run rate提到约3.75亿美元、十二个月约18倍增长,说明买方不只是初创模型厂,也包括需要持续刷新训练与评估集的大型实验室与企业AI团队。Insight Partners与S32领投,也显示成长型基金仍愿为「数据层基础设施」支付高倍数。
弱监督的朴素解释是:用规则、启发式与程序化标签函数生成大量带噪标签,再学习去噪,以降低纯人工逐条标注的成本。合成数据则在真实数据不足或敏感时,用模型生成分布近似的样本做补充。两者叠加专家审核,构成面向大模型时代的数据生产线——既卖规模,也卖可治理的专家环节。
对资本,这是「卖铲子」叙事在数据层的加码;对模型厂,意味着高质量数据供给仍是稀缺租金。高增长ARR也带来客户集中度与续约质量的追问。观察点是合成数据在受监管行业的可审计性,以及估值跳升后公司能否维持同等增速,而不把生意做成高密度项目制劳务外包。