首页
学习
活动
专区
圈层
工具
发布

大模型只走完1/4智能之路,下一代AI必须告别合成数据内卷

【AI从虚拟数据走向真实世界的概念图】

当技术变化越来越快,真正的智能必须从虚拟数据走向真实世界。

当整个行业都在疯狂堆参数、造合成数据、比拼谁的模型更"博学"时,强化学习之父、2024年图灵奖得主理查德·萨顿(Richard Sutton)在8月18日红杉资本的播客里,给AI赛道浇了一盆冷水。

他的判断直接而尖锐:合成数据是"一个巨大的错误",而当前的大语言模型,可能只完成了完整智能的四分之一。

这句话之所以值得认真对待,不是因为它出自图灵奖得主之口,而是因为它戳中了当前AI发展最隐蔽的天花板——我们以为在通往通用智能的高速公路上加速,实际上可能一直在一条死胡同里原地打转。

这篇文章不讲玄乎概念,只回答三个问题:合成数据为什么走不通?大模型到底缺了哪3/4的智能?下一代AI的真正方向在哪里?

01 合成数据为什么是死胡同:世界比任何模拟器都复杂

要理解萨顿为什么说合成数据是"大错误",得先搞清楚行业为什么扎堆做合成数据。

过去几年,大模型能力的提升高度依赖一个简单公式:更多参数 + 更多高质量数据 = 更强模型。但互联网上的公开优质文本正在快速枯竭,训练数据不够用了。于是各大实验室想到一个"聪明"的办法——让AI自己生成数据来喂AI,这就是合成数据。

用AI生成的文本、图像、仿真场景来训练新模型,听起来像是一条可以无限循环的增长曲线。但萨顿的反驳,基于一个他和同事贾维德(Javeed)多年研究的核心假设——"大世界假说"(Big World Hypothesis)

这个假说的核心逻辑非常简单:真实世界是无限复杂的,它的复杂程度远远超过任何一个智能体,也远远超过任何一个模拟器。任何由有限规则构成的合成世界,相对于真实世界来说都只是"微观的""微不足道的"。

换句话说,你用AI生成的数据再海量,也只是在一个被人类规则框死的小世界里打转。自动驾驶在仿真环境里跑完百亿公里,遇到真实道路上的雨雪、突发障碍物、非常规路况依然频频失灵;工业仿真数据再丰富,也覆盖不了设备老化、现场温湿度波动、临时工况变更等真实细节。

更关键的是,依赖合成数据训练的AI,本质上是在"自己教自己"。它没有机会接触真实世界的无限变量,也就永远无法突破人类预设规则的天花板。看似数据量在暴涨,实则一直在原地内卷。

萨顿的原话很直白:当被问及合成数据能否帮助大模型持续扩展时,他说——"不,那绝对是个大错误。也许这会成为下一条重要的经验教训。"

02 大模型只完成1/4智能:缺了哪三块拼图

萨顿说大模型只覆盖了智能的"20%或四分之一",这不是一个精确的科学测量,而是一个有冲击力的主观判断。但它指向的问题是真实的:当前大模型的能力边界,远比行业宣传的要窄。

按照萨顿的划分,完整的智能至少包含四个核心板块:

第一块:语言理解与模式匹配。这是当前大模型最擅长的领域。通过海量文本预训练,模型掌握了语言规律、知识关联和问答能力。这一块,大模型确实做得很好。

第二块:感知。对物理世界的多模态感知——看懂视觉场景、听懂环境声音、感知触觉反馈、理解空间关系。当前大模型虽然接入了多模态,但感知能力仍然是浅层的,它能"识别"物体,却很难真正"理解"物理环境背后的因果关系和隐性规律。

第三块:行动与规划。在真实环境中采取行动、执行任务、规划路径、应对突发变化。大模型可以输出行动方案,但它本身没有实体,无法在真实世界中动手试错、验证因果、积累操作经验。

第四块:持续学习。在长期经验中持续改变自身的能力。这是萨顿认为最核心、也是当前大模型最缺失的一块。

当前大模型的工作范式是:预训练 微调 上线 参数冻结。模型训练完成的那一刻有多聪明,以后就永远停留在这个水平。它不会因为和你聊了天就"悟"出新道理,不会在使用中自我修正,更不会从新经历里沉淀新认知。

这就带来了一个根本性缺陷:灾难性遗忘(catastrophic forgetting)。如果强行让模型学习新信息,新知识会覆盖旧知识,导致之前学会的能力大幅退化。所以行业只能选择"冻结参数",用上下文窗口、外挂知识库、定期重新训练来打补丁——但这些都不是真正的学习。

萨顿并不主张抛弃已有知识。他指出的问题是:当前模型常常把这些知识固定在部署前的参数中,此后只负责调用,很少用新的经历去检验和修正它们。一个不会从经验中成长的系统,再博学也只是一本会说话的百科全书,而不是真正的智能。

这也解释了一个常见现象:大模型谈理论头头是道,落地工业、医疗、战场等真实场景却频频翻车。因为真实场景需要的不是调取已有知识,而是在不确定环境中感知、行动、试错、学习——而这恰恰是大模型缺失的3/4。

03 下一代AI的真正方向:从"数据内卷"到"世界共生"

萨顿的批评不是为了否定大模型。他称大语言模型是"一个惊人的科学突破"。但突破不等于终点,语言能力只是智能的起点,而非全部。

基于萨顿的判断和当前行业的探索方向,下一代智能的进化路径正在清晰浮现。

趋势一:回归真实世界,具身经验数据取代合成数据

未来AI训练的核心资源,不再是AI自产的虚拟文本,而是物理场景中的一手真实经验数据。工业设备运行工况、实地路测场景、能源调度记录、无人装备环境交互数据、医疗临床操作经验——这些来自真实世界的、带有完整环境上下文的交互数据,才是AI进阶的优质养料。

道理很简单:只有在真实世界中摸爬滚打,智能体才能接触到"大世界假说"中那无限的复杂性,才能学会应对模拟器永远生成不了的边缘情况和突发变量。合成数据可以作为辅助,但绝不能成为主力。

趋势二:从静态预训练转向部署后的持续自主学习

下一代模型不再是"训练一次,终身使用",而是打造可动态更新的持续学习架构。像人类孩童成长一样,智能体在和环境、设备、任务的持续交互中,实时修正参数、积累经验、规避灾难性遗忘,做到用一次、精进一次。

萨顿给出的具体方案是OaK架构(Options and Knowledge)——一个基于模型的强化学习架构,有三个核心特点:

其一,所有组件都持续学习,不存在"训练完成后冻结"的阶段;

其二,每个学习到的权重都有一个专属的步长参数,通过在线交叉验证进行元学习,自动调节学习速率;

其三,状态和时间的抽象通过五步进程持续创建——特征构建、基于特征提出子任务、学习解决子任务的选项、学习选项的模型、使用模型进行规划。

2026年7月,萨顿在多伦多创立了Oak Lab,目标就是把这套架构变成现实:打造约1万亿参数、能实时学习和规划、功耗仅约20瓦的智能体。他离开了John Carmack的Keen Technologies,也告别了Google DeepMind关闭的埃德蒙顿实验室——这位七旬图灵奖得主选择用创业来赌一条不同的路。

趋势三:人机环境系统融合,跳出纯算力内卷

西方数字思维主导的旧AI,困在参数、算力、数据集的三角内卷里。但下一代高阶智能,必然是人、机器、环境三元协同的系统。

机器负责数据采集、精准执行、短期态势感知;人类赋予任务意图、长期目标、风险底线,完成全局战略统筹;自然环境、产业场景、地缘工况作为天然校验场,持续修正模型偏差。

不管是无人集群、工业智能、城市治理还是医疗辅助,只有嵌入真实环境闭环,智能体才能摆脱仿真世界的局限,拥有在强干扰、信息迷雾、突发变局下依旧稳定运行的能力。

04 一套判断框架:以后怎么看AI是不是真进步

萨顿的访谈最大的价值,不是给出了一个确定答案,而是提供了一套判断AI进展的新标尺。以后再看到某个AI新模型、新技术、新公司,不必先问它参数多大、数据多猛,而要看这四个问题:

第一,它的数据来自真实世界还是合成世界?如果主要依赖合成数据,它的能力天花板在生成规则的那一刻就已经定了。

第二,它上线后还能不能持续学习?如果参数冻结、只能调用训练时的知识,它再博学也只是静态系统,不是成长型智能。

第三,它有没有感知和行动的闭环?如果只能输出文字、不能在真实环境中感知和行动,它就永远无法验证自己的判断是否正确。

第四,它是在算力内卷还是在场景扎根?如果核心竞争力是"我比你多几千张GPU",而不是"我比你更懂某个真实场景",那它的护城河随时可能被更大的算力冲垮。

这四个问题,比任何跑分榜单都更能说明一个AI系统的真实潜力。

结语:AI下半场,拼的不是模型大小,而是与世界的连接深度

曾经,我们信奉缩放法则(Scaling Law),以为堆显卡、扩参数、造数据就能一路直通通用智能。萨顿的提醒让整个行业清醒:算力是工具,真实世界才是智能的终极土壤。

大模型不是错,它完成了智能的第一块拼图——语言理解。但如果把第一块拼图当成全部,把合成数据当成无限燃料,把参数冻结当成标准范式,那我们就会在一条越来越窄的路上越走越远。

放下合成数据的捷径幻想,深耕实体场景、打通具身感知、搭建持续离身学习架构、融合人机环境三元系反身统——让AI从互联网的文字世界,真正走进万千现实场景。

这,才是未来智能唯一的正确航向。

那些年,我们写过或翻译过的书(修订版)

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OWzQeB7zuX5cak0UaAsJe-NQ0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券