空间智能:AI 将理解真实世界
AI 教母、ImageNet 缔造者李飞飞从五亿年前寒武纪「视觉的诞生」讲起,勾勒计算机视觉如何一步步从「看见」走向「理解」再走向「行动」。她提出下一个前沿——空间智能:让机器不只是看和说,而是能在三维世界里动手、学习并越做越好,并展望医疗、机器人等场景。适合学习 AI 前沿、科技演讲的高阶英文表达。
播放器加载中…
我给大家看样东西。准确地说,我要给你们看的是「什么都没有」。这就是五亿四千万年前的世界。
纯粹而无边的黑暗。这黑暗并非因为缺少光。
它之所以黑暗,是因为缺少「视觉」。尽管阳光确实能穿透到千米深的海面之下,海底热液喷口也透出微光,那里生机盎然,可在这片远古之海里,却找不到哪怕一只眼睛。
没有视网膜,没有角膜,没有晶状体。于是这所有的光、这所有的生命,都无人看见。
曾经有那么一段时期,连「看见」这个概念本身都不存在。因为在此之前,从来没有谁看见过。
直到它出现了。出于一些我们才刚刚开始理解的原因,三叶虫——第一种能感知光的生物——登场了。
它们是这个我们习以为常的现实世界最早的居民,也是第一批发现「除了自己之外还存在别的东西」的生物。
一个由无数个体构成的世界。人们认为,正是「看见」的能力开启了寒武纪大爆发——在那段时期,大量各式各样的动物物种进入了化石记录。
最初,这只是一种被动的体验——不过是让光进来这么简单的动作,但很快它就变得主动得多。
神经系统开始进化。视觉逐渐转化为洞察。
看见变成了理解,理解催生了行动,而这一切,又孕育出了智能。
今天,我们已不再满足于大自然赐予的这份视觉智能。
好奇心驱使我们去创造能像人一样聪明地「看」——甚至看得比人更好——的机器。
九年前,就在这个讲台上,我做过一次关于计算机视觉的早期进展报告——它是人工智能的一个分支领域。
当时,三股强大的力量首次汇聚到了一起。第一,一类叫做神经网络的算法。
第二,一种快速的专用硬件,叫图形处理器,也就是 GPU。
第三,大数据。比如我的实验室花了数年时间整理的一千五百万张图像,我们把它叫做 ImageNet。
它们合力开启了现代 AI 的时代。一路走来,我们已经走了很远。
在当年,光是能给图像打上标签就是重大突破。而如今,这些算法的速度和准确率都在飞速提升。
由我的实验室主办的年度 ImageNet 挑战赛,衡量着这一进展的表现。
在这张图上,你能看到逐年的进步和一个个里程碑式的模型。我们又向前迈了一步,做出了能够分割物体、或预测物体之间动态关系的算法——这些成果都出自我的学生和合作者之手。
还不止如此。还记得上次我给你们展示过第一个能用人类自然语言描述照片的计算机视觉算法吗?
那是我和我才华横溢的学生安德烈·卡帕西一起做的。当时我贪心地问了句:「安德烈,我们能不能让计算机反过来做——由文字生成图像?」
安德烈说:「哈哈,那不可能。」可你从这个帖子里也看得出来,最近,这个「不可能」已经变成了可能。
这要归功于一类扩散模型,它驱动着今天的生成式 AI 算法——能把人类输入的文字提示,变成全新的照片和视频。
你们很多人都见过 OpenAI 的 Sora 最近那些令人惊艳的效果。但即使没有海量的 GPU,我的学生和合作者早在 Sora 之前几个月,就开发出了一个叫 Walt 的生成式视频模型。
你们看到的就是它的一些效果。当然还有改进空间——你瞧那只猫的眼睛,还有它钻进浪花底下却一点也没湿的样子。
真是一场「猫」难。(笑声)如果说往事是序章,那我们会从这些错误中学习,创造出我们所设想的未来。
在这样的未来里,我们希望 AI 能替我们、或帮我们,做尽一切它能做的事。
多年来我一直在说:拍下一张照片,和真正看见并理解,是两回事。
今天,我想再补充一句:仅仅看见,还不够。
看见是为了行动和学习。当我们在三维的空间与时间中对这个世界施加行动时,我们就在学习,并学会把「看」和「做」都做得更好。
大自然创造了这样一个「看」与「做」的良性循环,而驱动它的正是「空间智能」。为了让你们体会自己的空间智能时刻都在做些什么,请看这张图。
如果你有种「想动手做点什么」的冲动,请举手。(笑声)就在刚才那一瞬间,你的大脑已经看清了这只杯子的几何形状、它在三维空间中的位置,以及它和桌子、猫,还有其他一切的关系。
而你能预判接下来会发生什么。这种想要行动的冲动,是一切拥有空间智能的生命与生俱来的,它把感知和行动连在了一起。
如果我们想让 AI 超越现有的能力,我们要的就不只是一个能看、能说的 AI。
我们要的是一个能「做」的 AI。而事实上,我们正取得令人振奋的进展。
空间智能近来的一系列里程碑,就是在教会计算机去看、去学、去做,并学会把看和做都做得更好。
这并不容易。大自然花了数百万年才进化出空间智能:它依靠眼睛接收光线,把二维图像投射到视网膜上,再由大脑把这些数据转译成三维信息。
直到最近,谷歌的一组研究者才开发出一种算法,能把一堆照片转化成三维空间——就像我们在这里展示的这些例子。
我的学生和合作者又进了一步,做出了一种算法:只需输入一张图像,就能把它变成三维形状。
这里还有更多例子。还记得吗,我们刚才提到过能把一句人类语言变成视频的计算机程序。
密歇根大学的一组研究者想出了一种办法,能把那一句话转译成三维的房间布局,就像这里展示的这样。
而我在斯坦福的同事和他们的学生,开发出了一种算法:只需一张图像,就能生成无穷无尽、看起来都合情合理的空间,供观者去探索。
这些都是原型,是一种未来可能性初露端倪的最初征兆。
在那样的未来里,人类可以把我们整个世界转化为数字形态,并把它的丰富与微妙一一建模呈现。
大自然曾在我们每个人的头脑里悄然完成的事,空间智能技术有望为我们的集体意识去完成。
随着空间智能不断加速发展,这个良性循环的新纪元,正在我们眼前徐徐展开。
这种看与做的往复,正在催化机器人学习——而对任何需要理解并与三维世界互动的具身智能系统来说,机器人学习都是关键一环。
十年前,我实验室的 ImageNet 提供了一个包含数百万张高质量照片的数据库,帮助训练计算机去「看」。
如今,我们正用行为和动作做同样的事,来训练计算机和机器人如何在三维世界里行动。
但这次我们不是去收集静态图像,而是构建由三维空间模型驱动的仿真环境,让计算机拥有无穷无尽的可能性,去学习如何行动。
你们看到的,只是我实验室主导的一个叫 Behavior 的项目里,用来教机器人的一小部分例子。
我们在机器人语言智能方面也取得了令人振奋的进展。借助以大语言模型为基础的输入,我的学生和合作者是最早一批能让机械臂根据口头指令完成各种任务的团队之一——比如打开这个抽屉,或是拔掉一部充好电的手机的充电线。
又或者做三明治——用上面包、生菜、番茄,甚至还给使用者备上一张餐巾纸。
一般来说,我的三明治我还想多加点料,不过这已经是个不错的开端了。(笑声)在那片原始的海洋里,在我们的远古时代,「看见并感知周遭环境」的能力,引爆了与其他生命形式互动的寒武纪大爆发。
今天,那束光正照进数字的心智。空间智能让机器不仅能彼此互动,还能与人类互动,与三维世界——无论真实还是虚拟——互动。
随着那样的未来逐渐成形,它将深刻地影响许许多多人的生活。
以医疗为例。过去十年里,我的实验室率先迈出了一些步子,把 AI 用于应对那些影响患者治疗效果、以及医护人员职业倦怠的难题。
我们和斯坦福医学院的合作者以及合作医院一起,正在试点一种智能传感器:它能检测出医护人员在没有正确洗手的情况下走进病房。
它也能追踪手术器械的去向,或在患者面临身体风险(比如跌倒)时,向护理团队发出警报。
我们把这类技术视为一种「环境智能」,就像一双双额外的眼睛,而它们确实能带来改变。
但我更希望为我们的患者、医生和护理人员提供更具互动性的帮助——他们同样迫切地需要多一双手。
想象一下:一台自主机器人在运送医疗物资,好让护理人员专注于照顾患者;又或者借助增强现实,引导外科医生做出更安全、更快、创伤更小的手术。
再想象一下:严重瘫痪的患者,仅凭意念就能操控机器人。
没错,就是用脑电波,去完成那些你我习以为常的日常事务。
在我实验室最近的这项试点研究里,你正瞥见那个未来的一角。在这段视频中,机械臂正在做一顿日式寿喜烧,而操控它的,仅仅是通过脑电帽无创采集到的大脑电信号。
(掌声)谢谢。五亿年前视觉的出现,把一个黑暗的世界彻底颠覆。
它引发了最深远的一场进化进程:动物世界中智能的诞生与发展。
过去十年 AI 令人屏息的进展同样惊人。但我相信,这场数字版寒武纪大爆发的全部潜力,要等到我们用空间智能去驱动计算机和机器人——就像大自然当年赋予我们所有人的那样——才能真正完全释放。
这是一个激动人心的时刻:我们教会数字伙伴学会推理,学会与这个我们称之为家园的美丽三维空间互动,还能创造出更多我们都可以去探索的新世界。
要实现这样的未来并不容易。它需要我们所有人审慎行事,去开发那些始终把人放在中心的技术。
但只要我们做对了,由空间智能驱动的计算机和机器人,就不仅会是有用的工具,更会是可信赖的伙伴——它们在提升与增强我们生产力和人性的同时,尊重每个人的尊严,并抬升我们共同的繁荣。
未来最让我兴奋的,是这样一个未来:AI 变得更善于感知、更富洞察、更懂空间,并加入我们的求索,与我们一同,永远去追寻一种更好的方式,去缔造一个更好的世界。
谢谢大家。(掌声)