transcript.txt12,621 字符
ASR 提醒机器转写可能有专名、数字与断句误差,请结合原视频复核。
我们正在构建人工智能的下一个前沿,也就是我们所说的空间智能伦理。我们正在开发真实到仿真再到真实的流程。我们可以用数字世界里那些能规模化生成的数据,来替代我们在真实环境中需要的所有数据或评估。想想人类的智能,我们在脑海中进行了大量的模拟。为什么?因为模拟扮演着一个真实世界数据无法扮演的重要角色,那就是反事实推理。我们正在构建的是一个始终一致的世界,无论在空间上、时间上还是从不同的视角面对不同类型的互动,它都保持一致。为什么北极星我要相关工作?我们生活的世界可以是一个多元宇宙,我们创造技术让人们、建设者和开发者在不同的空间里行动。你认为我们有可能制造出能效与人类相当的机器人吗?我们离这个目标有多远?是五年吗?还是永远不可能?简单来说就是好吧。很高兴你们两位能来到这里。李飞飞给那些可能不太了解背景的听众,你能不能简单介绍一下 World Labs 是做什么的?World Labs 是成立两年的初创公司。我觉得我们应该认识到,这其实是一个前沿实验室。我们正在构建人工智能的下一个前沿,也就是我们所说的空间智能。空间智能指的是创造一种人工智能,让它能够生成、理解、推理,并且与空间进行互动,不管是物理空间还是虚拟空间。当然,实现空间智能的一个手段就是去构建大型的世界模型,而这正是 World Labs 目前主要关注的领域。是的,你从一开始就在讲这个观点,也就是机器具备感知空间、对空间进行推理,并且能在空间中采取行动的能力。但之前有一种假设认为在空间中的行动是某种遥远的未来的事情。但现在你们收购了一家机器人公司,那么也许我们可以稍微聊聊这个决定为什么选在现在这个时机,以及背后的意图是什么?是的,首先要在空间中行动或互动并不一定需要机器人,对吧?我的意思是,你看创意领域,不管是视觉特效、游戏还是设计,很多场景你都可以在虚拟空间里去创造、去操作。World Labs 一直以来的观点是,我们生活的这个世界本身就可以是一个多元宇宙,而我们创造技术就是为了让普通人、建设者和开发者能够在不同的空间里自由行动。话虽如此,能够在物理空间中真正采取行动,这种能力可以说是未来人工智能世界里最令人兴奋也最具深远意义的能力之一。所以机器人技术正是如此。World Labs 一直认为,机器人技术不仅是空间智能和世界建模的一个重要应用,也是一个非常典型的使用场景。因此邀请 C X 和 C X 加入 World Labs,这是我们长期愿景和使命的一部分。我们一直致力于此,太棒了。那么楚你是 C X 的联合创始人,也许可以给大家简单介绍一下你的背景,以及 C X 具体是做什么的?好的,我是尹祖,我目前是 C I C S 的联合创始人,同时也是哥伦比亚大学的助理教授。我的研究始于 M I T 博士后,在50实验室做博士后。真的世界很小,非常小。在我的职业生涯中,我的目标一直很简单,就是帮助机器人更好地感知物理世界并与之互动。我是一个非常务实的人,我希望我的机器人在真实的物理环境中工作。对于 C I C S 来说,我们看到的独特机遇在于当前通用机器人的发展正面临不少瓶颈,尤其是在训练环节和评估环节这两块。作为 C I C S,我们正在开发一个我们称之为真实到仿真再到真实的流程,明白吗?我们接下来要做的就是把真实环境映射到数字世界里去,而且这个数字世界要和真实环境保持高度一致。所谓对齐,我们指的是数字世界里发生的事情也会同样发生在真实环境里。这样一来,我们就可以用数字世界中能够规模化生成的数据,去替代真实环境中原本需要的所有数据和评估。这就是 C I C S 一切的开始。我们组建了非常强大的团队,专注于机器人技术、机器人学习以及仿真和渲染,来构建这个真实到仿真再到真实的技术栈,以解决一些关键瓶颈。你们两位能合作真是太棒了。是的,这里有一个有趣的故事,因为你会觉得我们之所以合作是因为他曾是我出色的博士后。我们谈论 C I C S 和 World Lab 的整合已经谈了很长时间了,实际上并非如此,他们以客户身份进入 World Labs。去年冬天大约11月12月,当我们发布名为 Marble 的生成模型第一个版本时,C I C S 就注册了。没开玩笑,就是客户。我当时甚至不知道那是什么,后来我才意识到这是尹祖的公司。我听到风声后就想,哇,这是你的公司,你们。然后我们意识到有。
太多的协同效应。也许菲菲,你快速描述一下 Marble 是什么?是的,Marble 就是 World Labs 一直在训练和迭代的那个基础模型系列的代号。目前 Marble 公开版本的基本能力就是接收一个提示,这个提示可以是一张图片,也可以是几张图片或者是一段文字,然后把它变成一个几何上一致的世界。这个世界的三 D 几何是可以表示的,不管是用高斯泼溅还是网格。实际上,CICS 团队现在在做的事情就是试图解决机器人领域里一个特别棘手的问题,数据不足。不管是训练的时候还是评估的时候,数据都远远不够用,这跟语言模型的情况非常不一样,因为互联网上数据非常丰富。我们知道为了让机器人技术发挥作用,我们必须以某种方式释放规模法则的力量,但这力量从何而来?这是一个深刻的问题,是机器人领域每个人都在努力解决的。谈谈这种能量很好,你们组建了一支非常有才华的团队,一支非常非常有才华的团队。那么这两者之间在多大程度上是存在重叠的呢?这是一种延伸吗?也许可以谈谈这个。是的,这实际上就是互补性所在。简单来说就是非常互补,并且拥有共同的使命。银祖是我们的三位技术联合创始人之一,另一位是张希,他是一位哥伦比亚大学教授,也是仿真领域的世界级技术专家。张希的背景也涉及视觉特效,他曾在维塔工作室工作,在腾讯工作过,也是一位企业家。还有桑尼,他是一位非常出色的工程领导者,之前也在初创公司待过,那家公司多年前被亚马逊收购了。他在亚马逊工作期间接触过计算机视觉领域里很多不同的技术栈。当我们开始更认真的讨论这件事的时候,我意识到 C X 在人才方面确实有几点是相当突出的。Labs 与世界各地的实验室形成了极强的互补,这显然展现了不可思议的思想领导力,以及在机器人领域扎实的技术实力,对吧?所以真从硬件开始全栈机器人,即使当时他还在斯坦福做博士后,你其实已经拿到了教职邀请,所以他只在那里待了一年。我希望他能多待几年,但他得去承担一份真正的工作。他是一位全栈机器人研究员,从建模到硬件样样都精通。当然,I drew 和他的学生们组成的 CICS 团队正是 World Lab 此前所缺少的人才库。在工具方面,他拥有非常惊人的模器能力,对吧?他本人就是一位资深的研究员,专门从事模拟技术方面的研究。World Lab 所做的很大程度上就是把模拟世界和现实世界连接起来,所以我觉得他们做的这件事本质上就是在搭建这两者之间的桥梁。我们明显欠缺的其实是在生成模型和三维重建这一块的能力,而这恰恰是 World Lab 特别擅长的地方。这是 Cine X 需要的一项技术,这两方面结合起来就能让整体变得更加完整。Fefer 的动机是这是进入机器人领域的一种延伸和补充。我也曾面临是否出售公司的抉择,所以特别想听听你的想法。你怎么看待加入 World Lab 这件事?觉得那里适合你吗?还有你当初为什么会做出这个决定?是的,最开始的时候我们其实是想着各自继续走下去的,但后来聊了聊,发现中间有很多可以互相配合的地方,这样一来两边合在一起就变得特别顺理成章了。比如说作为 Cine X,我们一直在做的事情就是真实到近乎过真的那种,对环境进行高保真重建。我们捕捉环境的外观、环境的几何结构,还有环境的动态特性,也就是说当你施加动作时,环境会如何变化。目前密集重建的计算量仍然比较大,处理起来会有些吃力。而 World Lab 目前所做的涉及很多围绕稀疏重建和生成方面的深层能力,所以我们看到了很多机会,可以利用 Marble 以及 World Lab 的其他类似能力来实现对环境非常高效的重建和建模。World Lab 会推出机器人基础模型吗?他们确实正在构建这个基础模型。Martin 你也知道,我们正在打造这个基础模型,而随着技术不断演进,现在最让人兴奋的那批基础模型就是全模态模型,对吧?它们能够接收多模态的输入,同时也能生成多模态的输出。那么对于机器人来说,所谓的基础模型又指的是什么呢?它很可能涉及动作,而且除了世界状态之外,它还会把动作的结果也一并输出出来。绝对不排除这种可能。是的。比如说基础模型,它本质上就得是多模态的,也就是说它得把帧、文本、图像、时间序列这些不同类型的模态都考虑进去,而动作是这些模态中非常重要的一部分。如果你把帧和动作作为输入,这本质上就是一个模拟器,它会预测当你施加。
特定动作时环境将如何变化?当动作是输出时,这本质上就是一个策略模型。它试图预测为了实现特定目标,那在真实环境中你该采取什么行动才能更接近那个目标呢?这种全模态模型实际上可以带来很多好处,为机器人社区提供巨大的价值,帮助他们理解如何建模环境,同时如何在环境中行动。这也可以作为一个骨干框架,帮助你进一步深入到具体的机器人应用中去,确保它真正达到客户所期望的可靠性和效率。如果你不介意我这个外行投资者问个问题的话,我看到很多机器人公司,现在他们进来时一个很流行的做法就是,我们会用视频模型,你知道的,这就是主流方法,而你们用的就是那种三 D 模拟,这是一种非常不同的方法。也许你可以对比一下这种只使用视频的流行方法和你们这里的雄心壮志有何不同?是的,为了创建机器人能理解的世界,这个世界需要捕捉问题的本质结构,正如我之前提到的,对这些世界来说,一个非常重要且必要的要求就是一致性,这就是我看到的与 Marble 的强烈协同效应,因为我们正在构建一个一致的世界,一致性既体现在空间上,也体现在时间上,还体现在不同的视角以及不同类型的互动中。而 Marble 生成的世界也提供了一个基础设施,是整个世界的组成部分,我们认为这对机器人训练是必要的。想象一下如果机器人向前推一个物体,物体却神奇的消失了,这是许多现有视频预测模型存在的问题,这为机器人提供了足够好的信号,让它知道什么是正确的做法。显然现在已经有大量的研究都在致力于打造越来越出色,越来越强大的视频模型。我们确实看到了一条路径,我们构建的一些基础设施可以提供初始动力,推动数据飞轮从更偏模拟驱动的模型转向机器人策略模型,在真实环境中执行并收集新数据,数据会回流回来,模型不一定非得纯粹基于物理,也不一定纯粹基于学习,而是处在两者之间的某个位置,这样既能抓住问题的核心结构,同时又能随着数据越积越多,不断扩展,不断变得更好。你知道我和 Safe 密切合作了一段时间,你一直有这个北极星来驱动这一切,你之前也提到过这个愿景可以用三 D 的方式,还有其他好几种不同的说法来阐述。我只是想知道对你来说是否也有类似的哲学层面的北极星,还是你更务实,像我一样构建系统完成任务?我的目标是让机器人工作,太棒了,在真实环境中我非常务实,我希望机器人能工作。为什么?这其实是我和 Phi Phi 合作时发现的一个有意思的事,在我的第一次演讲中,我们构建了一个基准,我们做了一项调查,问公众希望机机器人为他们做什么,在我们收集的任务中,1/3是关于清洁的,人们就是不喜欢做那些又脏又累的活,这些正是我们希望能有机器人解决方案来应对的场景。Martina 接着你刚才的问题,关于 Sillics 我特别喜欢的一点是,现在有很多机器人公司都在做模型开发这类事情,我真正喜欢 Sillics 的一点是,Rindu 和他的联合创始人对机器人技术有着极其务实的态度,而且他们本身是学术界出身,对吧?Sony 不是这样,但 Rindu 有时候来自学术界,不过他们的第一反应是跟真实行业里的设计伙伴和客户合作,无论是工业实验室、仓库,还是大家都很熟悉的电子组装领域,这种合作方式都让人耳目一新,确实可以说是看待机器人技术的一种全新角度,这让我非常兴奋的想要与他们合作,也许这是问 Vik 的,但我只是出于个人好奇。在我看来,机器人技术必须非常精确,不是完美,但要非常接近,但对于 World Labs 所做的创意用例,很多时候你不需要那么精确,因为有时候错误甚至是风格化的或故意的。从技术角度来看,调和这两者之间的挑战到底是什么?还是说他们根本就不会被调和?是不是在设计空间里永远都会存在两个不同的点?从长远来看,他们当然会被调和,而且环境的建模本身也不必做到完美。机器人模型不必完美。顺便问一下,这纯粹是出于好奇,有没有更正式一点的说法就是不完美到底是什么意思?就是非常接近,让我这么说吧,比如说模型在各类机器人应用的开发过程中一直扮演着非常重要的基石角色,看看现有的机器人应用,比如 Roomba 扫地机器人,还有四足机器人、双足机器人,这些模型一直他们从模拟环境转到实际机器人上的关键方式。但如果你看看那些运动机器人,比如四足和双足机器人,他们可以在雪地行走,在灌木丛中行走,但你不需要一个模拟器来精确模拟所有的灌木和雪,你需要有一个。
模拟,它要能抓住问题的核心结构,然后在数字环境里做各种不同类型的随机化处理,这就是我们的目标。我们和 Synix 以及 Support Apps 一起正在研究一个问题,除了机器人之外要建模这个物理世界,我们需要多高的保真度?我说过,我们将能够把在模拟环境和数字世界中训练的机器人系统转移回现实环境中。作为投资人,我听过其他研究者,比如 Sergey Levine 说过,模拟最终总会偏离物理世界,所以真实世界的数据收集绝对至关重要。那么也许可以稍微谈谈这种方法的可行性,也就是把模拟作为基石,而不是采用其他方法,这样两者之间就不会产生矛盾。所以如果你考虑模拟的话,模拟本质上就是在预测,当你施加动作之后,环境会怎么变化,这本质上就是一个世界模型,它不一定是纯粹的物理,也可以是物理和学习的结合。我们正在收集真实世界的数据,之后也会用这些数据,整个过程就像是一个数据飞轮,只是现在处于不同的阶段而已。也许在最开始的时候,我们会更强调物理的部分,用更多的物理来确保我们得到正确的一致性和结构,这样我们才能更好的理解这个世界,也才能训练好机器人的策略。随着我们不断积累越来越多的数据,一方面是通过数据收集,另一方面也是通过与客户的合作,我们手里的这些数据会逐渐朝着更基于学习的环境建模方式去发展。所以这种转变以及这种数据飞轮确实是关键因素,既能让我们兼得物理几何和一致性方面的优势,也能充分利用数据和计算带来的强大能力。我想补充一点,稍微从哲学的角度来说,模拟和不模拟之间并不是一个非此即彼的二选一,所有这些因素都是结合在一起的共同作用,才能让机器人技术真正发挥作用。想想人类的智能,我们在脑海中会进行大量的模拟。你知道模拟为什么能扮演一个真实世界数据无法扮演的重要角色吗?那就是反事实推理,你可以推演那些尚尚未发生或者根本不可能发生的事件,也可以推演那些在现实中你手头数据不足,没法真正去实现的事件,而在推演的过程中,你就学会了如何应对。人类一直都在这样做,我们可能没有意识到而已。你知道的,我们刚刚我知道你之前去了世界杯现场,恭喜西班牙队夺冠。我相信在每场比赛的规划过程中都会有模拟这个环节,不管它是数字化的,还是画在白板上的,或者用其他什么方式,而模拟所起到的作用其实就是反事实推理,这在机器人领域非常重要,因为我们根本不可能拥有足够的真实世界数据来做到这一点。这里有一个现实生活中的例子,在自动驾驶汽车这个行业里,Waymo 官方表示他们使用了数1000Mh的模拟。实际上 Waymo 更侧重于模拟,而不是单纯依赖真实世界数据,这些都是真实的例子。而且如你所知,自动驾驶汽车是最简单的机器人类型,所以很明显模拟在机器人学习中扮演着巨大的角色。我还想再补充一点,关于乐高的话,更具体一点来说,模拟能够带来两个层面的好处,第一个层面是可靠性,第二个层面则是效率。关于可靠性这个问题,如果你想让机器人在真实环境中可靠地工作,那你需要有足够的数据来系统性地覆盖机器人可能遇到的所有状态空间以及各种变化情况,这样你才能知道数据是否足够稳健。而通过模拟你可以系统性地随机化和控制光照、摩擦力、几何形状、物体类型以及各种物理参数的变化,以确保你对状态空间有足够的覆盖,这就是能给机器人系统带来可靠性的东西。第二点则是关于效率,现在很多人在做遥操作,如果你看看那些遥操作设备,想象一下你实际使用的那些骨架,你会发现你收集数据的速度实际上比人类执行任务的速度还要慢,但对许多客户来说,人类速度不够快,他们想要更快,所以机器人要移动的更快,这不仅仅是让机器人跑得更快那么简单,因为重力本身是不会变的,但在模拟中,你可以系统地加速机器人的行为来训练它,让它考虑到环境中所有的动态变化,这就是为客户带来效率提升的地方。所以不管是从可靠性还是效率的角度来看,模拟确实能提供一些非常独特的价值。刚才我们已经聊到了技术和平台,当谈到人们具体用它来做什么的时候,基本上有两个特别典型的应用场景,一个是训练,另一个是评估。我们先从评估这块开始讲,评估这件事在机器人领域经常被大家忽略,但如果你是在训练机器人模型,你就必须清楚它到底表现的好不好,而这是你进行迭代的唯一信息来源。顺便说一句,每个 A I 从业者都真正理解评估是什么。
并且一直在使用它,但非 AI 人士通常对它的理解会有些不同。所以也许值得具体描述一下你所说的评估是什么意思?好的,我所说的评估是指我们能够了解对于这个特定的检查点,它的表现如何。比如它是在百95的时间里表现良好,还是在99点900分之的时间里表现良好?业界用的关键标准就是这得花多长时间,也就是说你需要多少工作时间才能把一个百分之之准确率的检查点跟一个99.2准确率的检查点区分开来。如果你只在真实环境里做这些区分,那不妨想想你得花多长时间才能完成这件事。如果你再仔细想想现在机器人评估的情况,人们在真实环境里做的这些评估,它们的迭代速度比那些语言模型的迭代速度要慢上好几个数量级。所以机器人要执行的任务不仅非常非常多样化,而且你实际上还得真的去做这件事。也就是说你得让原子在空间中移动。没错,而且物理定律的限制。你看过那些机器人视频吗?每个视频都得开10倍速八倍速来看,因为画面动得太慢了,确实是这样。所以它不光是慢,而且危险成本又高,同时呢速度还比正常情况慢了好几个数量级。所以我们的一些客户确实需要这种数字环境来评估他们的机器人系统,因为我们的数字环境已被证明与现实世界具有一致性。这意味着在场景中发生的事情也很可能在真实环境中发生。如果一个检查点在模拟中表现更好,那么它在真实环境中也很可能表现更好。正如我们在博客文章中讨论的那样,这实际上给了我们的客户很强的信心,让他们可以使用来自数字环境的数据和信号,对其机器人系统进行可扩展、安全且快得多的评估,对吧?这就是关于评估的部分,接下来是训练方面,基本上就像我提到的,这关乎可控性。我们想要控制所有可能的状态参数,光照、摩擦力、物理参数,甚至物体几何形状和物体类型的变化。我们想确保你充分覆盖了各种不同的场景,这样的数据集才能为你的机器人生成有信息量的数据,使其变得稳健,而这在真实环境中是极难做到的。就像我们讨论过的,如果你做遥操作,收集数据的速度会很慢,你还会受到机器人数量和遥操作设备数量的限制,而且围绕这些数据操作和模拟也会出现各种不同类型的挑战。在模拟中一切都可以控制,一切都可以系统化,一切都可以达到一个你确切知道并能够声称自己覆盖了哪些数据分布的水平,从而对分布内的情况建立信心。我们知道机器人会正常工作,所以这种信心、效率和可扩展性正是我们的客户所看重的,他们愿意使用我们的数字世界来训练机器人系统。有件特别疯狂的事,甚至在我们开始讨论这个话题之前,我们的 inbound 客户就已经表现出了这种需求。我们现在确实还服务不了这些客户,但已经接到不少电话了,很多都是来自机器人行业,尤其是那些早期阶段的机器人公司,他们有的还在开发模型,有的已经做到下非常落地的应用场景了。当人们听说你们要进军机器人领域时,我们就看到了这些需求。他们想象的是这样的场景,你拿出一台三 D 打印机,然后开始制造各种硬件,然后你要给机器人编程大脑,把它装进机器人身体里,这样一来你就拥有一台机器人了。但我觉得你们在这里讨论的不是这个,你们可以谈谈你们所了解的部分,也就是在机器人创造的生命周期中,你们处在哪个环节,你们的终点在哪里,然后生态系统的其余部分又是从哪里开始的?我们在构建的你可以想象成类似基础设施的东西,围绕这些基础设施提供软件,让人们自由构建机器人可以学习和评估的世界。这些基础设施天然就是模型无关和形态无关的。我想说清楚一点,虽然这看起来很明显,但这是一个很微妙的点。也就是说根据你所说的,我们并不是在制造机器人,我们构建环境让其他公司放入机器人大脑来导航和学习。是的,我们的客户现在有各种不同的机器人,有些用的是单臂机器人,有些是双臂的,有些是固定手臂,有些是移动机械臂,有些用夹爪,还有些用更复杂的末端执行器版本。所以我们的平台现在天然就是形态无关的,我们可以非常容易的把不同类型的机器人形态整合进来,然后把它们放进我们生成并数字化好的世界里。这样一来我们就能让每一个机器人都具备在真实环境中执行任务的能力,在真实环境中以合适的可靠性和效率水平完成正确的任务。而且我们也模型无关,我们可以用我们世界生成的数据来训练不同的模型,无论是从零开始训练还是对现有的基础模型进行后训练,比如视觉语言动作模型或世界动作模型,所以对我们来说这不重要。
我们只想要有基础设施和所有词汇,让机器人能在真实环境中可靠工作。你之前跟我说过,你觉得很多关于人形机器人的预测有点过于激进了。我们更可能看到的是在仓库之类的受限场景中逐步部署。你能谈谈这个观点吗?以及它如何影响你们在 World Labs 要做的事?这个问题问得很好。我们来看一下机器人应用在真实环境中的发展历程,它其实一直遵循着这样一个趋势从完全结构化的环境,逐步进入半结构化的环境,最后再走向非结构化的环境。所谓完全结构化的环境,就是说你对环境里的所有配置都了如指掌,并且能完全掌控,比如工厂,像汽车制造厂,这些地方已经自动化几10年了。然后还有半结构化的环境,在这种环境里你对环境有一定的控制,比如说像亚马逊的仓库或者像餐厅、酒店,这些地方你对环境有一定的控制。这样一来机器人的任务就会变得更容易,但显然还有很多其他物体,比如衣服,这些是你无法控制的物体。然后对于非结构化环境,就像你的家和我的房子,我觉得这是最难的挑战,尤其是我的房子,相信我有三只狗。五岁孩子还有狗,没错。如果你思考鲁棒性是从哪里来的,它其实来自于对机器人可能遇到的各种场景的充分覆盖。所以至少在目前这个阶段先专注于半结构化环境,然后再去处理非结构化环境,这样会容易得多,也更容易上手。我们最终会朝那个方向走,只是我们想采取一个更可持续、更现实的方法。我觉得你这里的观点是人形机器人是在模仿人体,而进化已经让人类身体优化到能适应各种非结构化环境。所以说我们的手指,我们的腿并不是做某一件事情的最佳工具。比如说如果我们人类这个物种的唯一目标就是爬树,那我们就不一定会拥有现在这样的身体,对吧?我们会长出完全不同的手指来。但人类最终进化出来的是这样一种非常通用的身体形态,它不一定在每件事上都是最擅长的,但这样的身体是为了在非结构化的环境中生存。但从商业的角度来看,再从务实的技术角度来看,这种非结构化的环境再加上一个通用型的身体,这两者结合起来实际上才是最难解决的问题。这不一定是解决问题最正确的办法,关键在于我们要走专业化路线,用更专业的团队去应对更聚焦的问题。但对 Figure 来说,挑战在于他们需要变得更加形态无关,这样一来他们的基础设施才能适应不同的身体,也能应对各种半结构化的环境。看待这个问题的一个常见视角是经济视角,对吧?也就是把它和生成式大语言模型相比较,它们生成散文或代码的速度比人类快10倍甚至百倍,成本也比人类低得多,所以经济上的理由很充分,因为我们的大脑在这方面效率并不高。然而我们的大脑和身体在三维导航方面却非常高效,对吧?你知道就像在现实世界里移动或者伸手去拿东西那样。所以这只是一个预测性的问题,你觉得在可预见的未来,我们有没有可能造出这样的机器人,在干那些体力活的时候,能效跟人类差不多?比如说基本上就是最低工资水平那种工作,我们离这个目标还有多远?是五年吗?还是永远不可能?我认为这需要很长时间。如果你真正考虑机器人在真实环境中的应用,归根结底它始终是一个系统问题。所以每一个在真实环境中工作的机器人作为一个系统都需要非常仔细的考虑各个部分如何协同工作,包括硬件、软件、大脑,甚至细化到比如你手指的摩擦系数是多少。所以要让这些东西成为现实,你需要考虑很多因素,而且需要不断迭代。但让我感到兴奋的是我一直都站在机器人学习领域的最前沿,也在努力把前沿往前推,可是这个前沿技术总是比我预想的跑得更快。所以我目前专注和研究的方向跟我当初刚开始读博士那会儿相比已经大不一样了,这说明了整个生态系统发展得有多快,所有构建机器人系统的不同部分都开始整合到一起了。但我们也得对预测保持校准,不能太乐观或太悲观。所以接下来我们会看到很多进展,但要达到人类水平的效率和能力还需要更长时间。Martin,当今 AI 领域最难的事情是保持适度且理性的乐观。我的意思是即便是 LLM 也没有达到人脑那样的效率,要知道人脑运行起来功耗只有30瓦。是的,所以我们离那个目标还很远。但就性能功耗比来说可能已经接近了,对吧?在像软件工程这类比较狭窄的任务上确实是这样,对吧?是的,我也这么认为,机器人领域还差得远,这点已变。你如何看待你们团队在战略?
长能够去追求的雄心水平,我是说,这是否已经改变了,还是说仍然和你最初创业时的预期保持一致?它确实以非常深刻的方式改变了我们的发展轨迹。我们看到了很多可能性,通过环境建模就能把整个过程完成,效率高了很多,扩展性也大大增强,尤其是跟 World Labs 合作之后效果更加明显。我还想补充两点,如果你考虑一下当前语言模型的状态的话,这些模型拥有令人难以置信的能力,但你仍然不会完全信任它去帮你订机票或预订酒店,你肯定还是会先仔细阅读那些语言模型给出的输出结果,但这与人们使用机器人模型的方式截然不同,人们期望的是开箱即用的实用机器人模型,机器人要在真实环境可靠工作,我们还没数据,我们甚至还没有所有必要的基础设施让机器人能够开箱即用,在真实环境中可靠的工作。基于这些原因,能够创建这些数字世界,这些可扩展的数字世界,让机器人可以在其中学习和评估,这将释放出巨大的潜力,用来替代那些昂贵且不安全的数据,取代真实环境中昂贵且不安全的数据,让机器人能够进行可扩展的学习和评估。我见过很多这种类型的整合,在这个阶段,当他们有这么多对齐时,他们实际上运作的很好,这很棒。但总是存在这样一个问题,是现在就整合到当前正在发生的事情中,还是保持相对独立,提供一个长期的路线图,在未来的几年内逐步实现。你如何看待这个权衡是立即整合,还是作为一个独立的长期项目?好问题,我觉得到目前这个阶段你也知道,Andrew Tanzisani、Justin Ben 还有我,我们一直在聊这件事,接下来我们会认真考虑一步一步来推进,我们不会急着把从代码库到团队的所有东西都整合到一起,因为我觉得 Scenicx 这个方案确实是经过深思熟虑的,一个经过深思熟虑的,我不会说它完全独立,但相当自成体系的技术栈,以及他们的客户和他们正在构建的产品类型,我们会花时间的这一点是肯定的,我们已经有了仿真这一块,同时也有基于潜力的模型以及动作条件模型这一边,我们已经开始洽谈了,而且他们正在把 Marvel 作为内部客户来使用,所以我们会进行整合,但我们不会急于把团队像沙拉碗一样完全搅在一起。地理位置这块你们是怎么考虑的?会跟着 C X 一起迁移吗?是会留在原地,还是说 Run Drew 要搬到别的地方去?哦,好吧,欢迎,是的,搬到旧金山,就像佛罗伦萨之于文艺复兴那样。完美,我觉得我们实验室现在算是正式成为一家双海岸公司了,总部就设在旧金山,我住在帕洛阿尔托,我感觉自己好像身在另一个州,但我其实特别兴奋,因为我们马上要在纽约设立办公室了,这样就能帮我们在东海岸吸引更多人才。此外我们一直在讨论要确保在两个办公室都部署好机器人,这样我们就能实际测试并完善我们的工程系统,为后续的远程操作打好基础,我们可以远程操控机器人,因为不管怎样我们本来就得为客户做到这一点。Fifi,我们不妨把它具体化,两年内最理想的成功案例是啥样?比如你们秀什么产品,谁在使用它,他们怎么用,就说个大概。比如我会非常高兴的看到 Scenicx 团队和 World Labs 团队,能够在少数几个重要的垂直应用场景中真正拥有那些经过验证的客户。在这些实际应用场景里,我们的系统和基础设施已经充分证明了他们确实能够很好的满足他们在自动化方面的需求,而这些客户就成了我们业务扩展中的灯塔案例,为我们后续的规模化发展指明了方向。打个比方,正在收听这个节目的人,假如他经营着一家机器人公司,那他应该在什么阶段去跟 World Labs 接洽呢?是非常早期吗?还是中期某个阶段?所以现在对我们的客户来说,因为我们正在构建这种从真实到仿真再到真实的流程,也就是仿真本质上就是世界本身,我们将提供训练和评估的场地,有些客户只需要真实到仿真的部分,他们想把机器人的任务数字化,并能够对他们的机器人系统进行评估,有些客户需要从真实到仿真再到真实的整个流程,这样他们就能让策略在自己的硬件上运行,所以我们的平台在设计上也是比较灵活的,可以根据客户的具体需求来随时调整。与此同时,我们合作的客户实际上已经非常接近部署阶段了,所以他们基本上都在处理非常非常实际的任务,这些任务一旦被替代,当我们有了现成的机器人解决方案,就能立即创造价值,而且他们至少有几10。
甚至几百个这样的场景都在考虑做自动化。所以跟 World Labs 合作的话,我们就能针对这些场景开发出可靠的解决方案。正如我们已经展示的,我们在博客文章中已经实例化了许多场景,我们将能够进一步研究,看看它们如何真正解决现实世界部署所面临的关键需求和约束。具体来说,如果你们是一家机器人公司,现在联系 World Labs 会不会太晚或者太早?不,我们希望大家都能联系我们,我们想了解你的用例。太好了,如果你在听这个节目且与任何机器人项目或公司有关,请联系 World Labs。是的,谢谢,我们绝对开门营业,随时欢迎合作,不会太早。好的,做机器人相关的事联系 World Labs,感谢两位到来,谢谢。