这一天的学术线不在刷总榜,而在四根更细的杠杆:数据怎么配、研究想法从哪来、知识能不能跨模态,以及AI挑题目的口味和人差在哪。
第一篇是DCVLM-Baseline,论文编号arXiv:2606.28551,由斯坦福、图宾根AI中心、马克斯·普朗克、谷歌、苏黎世联邦理工学院、华盛顿大学等37家机构联合发布。实验基于6万亿tokens和160个公开数据集,做了上百轮跨规模测试。结论和「先把数据洗干净就能变强」不完全一样:看图说话的上限,更取决于配比,而不是只取决于筛了没有。他们给出的配比是10%图文配对、5%多模态文档、15%纯文字、70%指令微调,称为DCVLM配方。用40亿参数模型实测,训练量仅为FineVision一半,核心得分高5.4个百分点,并超过FineVision训练的80亿参数模型。指令微调,白话就是用「问题—标准答案」这类样本教模型按人的格式做事。
第二篇是ResearchStudio-Idea / IdeaSpark,编号arXiv:2607.04439,由南洋理工、微软研究院、新加坡国立大学、新加坡科技研究局联合完成。他们从1947篇ICLR、ICML、NeurIPS 2021至2025年论文里归纳方法,其中1014篇Oral、260篇高引、722篇Reject,抽出15种高层研究模式卡片。字段由Claude Sonnet 4.6提取8个结构化字段,再由Claude Opus 4.7归纳聚类。用100个ICLR 2026 Oral测试题验证,IdeaSpark平均质量分3.87,满分4,100题里88个排名第一。模式卡片不是自动写完一篇论文,而是把「这类工作通常怎么提问题」先写成可复用的结构。
第三篇是MoKus,发表于ECCV 2026,编号arXiv:2603.12743,由清华大学与香港科技大学联合发布。他们观察到跨模态知识迁移:文本侧的知识更新,可以迁移到图像生成侧。两阶段框架把自然语言知识绑定到视觉概念上,每条知识绑定约7秒,从1条扩到5条只增加约29秒训练时间,并提出知识感知概念定制评测KnowCusBench。绑定,白话就是让模型知道「这个词所指的画面应该长什么样」,而且这个对应可以更新。
第四篇讨论AI的科研品味,编号arXiv:2607.01233v1,由耶鲁大学与芝加哥大学联合发布。他们对比11683份人类研究提案和9款主流AI模型的生成结果,发现AI的研究口味比人类窄。AI更常做「桥接和综合」,也就是把不同东西收成一个统一框架;人类更多做「替换」(9.13%,AI为0.92%)、「解耦」(2.33%,AI为0.21%)和「形式化」。窄,指的是选题动作的种类少,不是指文章写得短。
四篇合在一起,杠杆分别在训练配方、研究模式、跨模态绑定和问题发现。配方和绑定已经有数字;品味研究说明的是差异,不是「AI不能做科研」。下一观察点是DCVLM配方离开这160个数据集之后还稳不稳,以及IdeaSpark的88道第一能否被别的评审标准复现。