孩子一岁听懂的母语句法,大模型要烧掉整座文字森林——这不是情怀对比,是Scaling Law的下一道墙。对模型实验室而言,公开语料池可能在未来十年见底,小语种与垂直行业更缺文本,「学得像孩子」正在从学术好奇变成工程刚需。
MIT Technology Review 8月24日发文梳理认知科学与AI交叉进展:儿童可在约1000万至3000万词暴露量内掌握语法,而前沿大语言模型预训练常需万亿级token,存在巨大data efficiency gap(数据效率缺口)。斯坦福认知科学家Michael Frank比喻:训练现代LLM的文本堆叠高度可超过国际空间站,而人类青少年一生阅读量仅约二十米纸厚。「用GPT-2训练3000万词,你得到的是胡言乱语器,不是孩子。」
研究路径包括BabyLM竞赛:在约1亿词「发展上合理」的语料上训练小模型,检验语法基准;2024冠军GPT-BERT在约1亿词上可击败部分更大模型,但仍远不及商用LLM,且缺乏儿童的多模态具身经验。学者认为,纯文本神经网络或许终将逼近语法,但要缩小效率差距,可能需要视觉、听觉与互动数据——SAYCam等婴儿头戴摄像头项目正尝试把「膝盖森林」的第一视角喂给模型。所谓数据效率缺口,白话是:同样达到可用语言能力,机器要比孩子多吃几个数量级的文字。
产业观察上,数据效率不只是实验室话题。能学得像孩子的模型,才可能进眼镜、机器人与边缘设备——那里既没有万亿token,也烧不起整机柜电。可以把它想成:大模型过去几年在「多吃」上卷赢,下一步可能要学「婴儿怎么吃」——少而精,且得用手眼嘴一起学。对开源与小语种社区,BabyLM式小样本训练也是降低门槛的方向;对具身智能,第一视角与互动数据或成为下一轮稀缺资产。
需要把边界读清楚。儿童与LLM学习目标不完全同构;BabyLM成果尚不能替代生产模型。下一观察点是多模态婴儿数据训练的可复现增益与伦理边界。