-
张建伟:《多模态具身智能与未来机器人》
2026-08-13 19:10:03
作者:张建伟(中国工程院外籍院士、德国科学与工程院院士)
今天的我们处于一个智能物联网的时代。如果从未来实际需求来讲,我们现在把人工智能基础技术驱动的方法和未来需求相比,我们看到它们中间的差距是非常远的。现在ChatGPT版本是纯粹的一种技术驱动的方法,它现在要代替的很多白领工作,并不是我们特别希望它们来代替的。在制造、未来出行、大健康、农业、家庭和建筑等方面,我们希望替代更多的是辛苦的蓝领工作,比如工厂里重复单调的装配、帮助照顾我们的父母、农业里的除草、采摘等,但是到目前为止,我们还没有很好的方案,现在非具身人工智能解决不了这些问题。
现在大家都在思考未来在手机、手表、眼镜之后,会是一个什么样的形态,把手机替代的是什么样的形式,现在新发布的VR/AR眼镜,不外乎还是一种信息和视觉、听觉交互形式的改变。未来,我们说从非具身智能走向具身的智能,需要我们在传统的信息通讯系统上,加上body运动执行互动功能,加上高层智能功能,从基本的识别到记忆、到推理,乃至意识。集成这三部分为一体,就使得我们能从信息世界通讯走向物理世界交互,创造新的巨大的应用蓝海。
如何打通基础研究到应用研究再到最后的创新应用?用这张图把技术成熟度一到十的步骤整合起来。技术成熟度一至三的基础研究包括人脑模型、深度学习模型、知识图谱等等。我们把关键的基础研究结果打造成技术成熟度从四到七的模块,用共享的软件ROS机器人操作系统来解决这些开源模块,包括识别、抓取、情感交互等,把它们整合起来解决未来的制造、医疗、健康、出行和家庭服务等。
打通从基础到应用,我们投入了近二十年的工作。在二十年前我们做双臂立体装配机器人,现在工业界对立体产品装配方面呈现非常多重要的需求。我们的研究也影响了协作机器人这个新的技术形态,思灵协作机器人作为独角兽公司,产品现在在富士康iPhone装配工厂已经得到了应用,未来在医疗物理服务方面也会为人类起到更多的作用。我们都盼望着未来我们的父母能够有尊严独立生活不需要护工,利用人工智能、机器人实现助老助残。在未来新感知状态层面,我们从二维数字图像感知到未来三维感知也是走上了新的台阶,今天另一家独角兽公司“梅卡曼德机器人”,基于结构光测的原理,实现了3D点云相机的产业化,已经应用到广泛的制造、物流领域,也在做创新的具身智能的实践。
当然具身智能还有非常大的挑战,现在仅基于互联网和大数据的非具身的智能实现了一些应用场景,正在替代一些白领的工作,但是未来要替代物理世界很多蓝领的工作,我们还需要克复非常多的挑战,比如未知、非结构化环境的建模挑战、灵巧操作挑战、多模态自然交互挑战等等。现在我们在家里能够触摸到、买到的机器人还只是能够单功能扫地、吸尘。在酒店、博物馆和工厂,我们能看到一些运载服务的机器人。但是在未来,各行各业其实有非常大的需求,例如,我们现在智能制造急需的应用场景,70%工厂属于用手操作的劳动密集型,需要多模态机器人化的制造系统;需要帮助我们收割、除草、施肥的农业机器人;需要在家里做家务,和我们互动,陪伴我们健康养老的类人机器人;未来出行城市的交通系统,建筑机器人等,都给我们未来人工智能理论和技术提出了巨大的需求和挑战。
近来,人工智能在四个方面取得了突飞猛进的进展:
1、算力的增长。和30年前相比,30年后算力的增长不是30倍,而是百万倍。如果我们再放眼今后10年,算力会再增加百倍。在这种大的算力引擎的支持下,我们需要充足的数据燃料。
2、多模态数据的感知。从单模态的视觉、听觉、多肢体感觉等巨型数据的收集和融合、自动聚类、自主决策等,都取得了快速进展。
3、算法日新月异发展。从,能够识别的CNN,卷积神经网络处理视觉算法的发展突飞猛进,Segment anything,把所有的二维图像都能分割;处理语音文本RNN、实现语言大模型的应用;以及具身智能在智能体和机器人进行的“增强学习”。现在每天都有上百篇非常专业的论文发表,体现了在算法方面的突飞猛进。
4、机器人正在掌握如何学习。例如Sim2real,把各种机器模型、人工交互模型在仿真里进行测试训练,把仿真里的测试再迁移到实物机器人上面。我们把行走的技术、上身操作的技术、仿人表情机器人头的技术融合在一起,做一个真正实现人功能的仿人机器人。
如何把多模态信息整合在一起,也是整合技术方面非常重要的方向。10年前在深度学习、多模态、ChatGPT尚处于萌芽状态的时候,我们已经筹划并启动了人工智能基础合作项目,“跨模态学习”。针对如何用类脑地形式实现机器整合多模态并进行学习的科学问题,和神经科学家、心理学家共同合作,来研究人是有什么样的机理,能够把视觉、听觉、触觉有机融合在一起,进行存储、表达、交互和学习。我们最近也做出了一系列能够融合多模态深度学习的算法,比如在3D感知的时候用新的算法能够把遮挡的不完全信息自动的补齐,以及我们通过自然语言,能够进行图像自由的处理和分割。
未来,如何把机理模型和大数据学习的新方法融合在一起,是特别重要的一个科学方向。我们把机器人整个控制的等级进行划分,比较低的等级,包括位置控制、力控制等领域,已经有稳定的机理模型,在其基础上可以进行快速的控制。但机器人智能层次和交互的层级越高,它需要多模态的形式就越丰富,包括视觉、触觉、感觉和声音等。在这方面,还欠缺很好的、基于大脑的可计算的模型,所以我们今天还需要很多大数据的支撑。在大模型AI时代,各行各业如何能做出自己的反应?从人工智能的角度讲,我们现在要实现更加透明的人工智能,要集成多模态的信息,研究真实世界的具身智能,而且我们要高度重视以人为本的AI伦理,要用重大需求作为牵引,而不仅仅是技术驱动。从其他非人工智能从业者来讲,我建议大家要扬长我们人类的多模态,在二维视觉到三维视觉到未来的机器人系统中,要增加不同模态的感知,我们要学会跨学科的合作,基于项目的学习方法;不管是学习什么样的专业,要理解AIGC是怎么工作的,要知道它还不能做什么,要学会和人工智能进行合作,要更加有富有想象力、好奇心和创造力,问好的问题。
人工智能在模型和大数据的融合方面,还需要克服非常多的挑战,需要产学研的国际合作,以及具有国际视野的、跨学科卓越工程师的出现。未来我们应该更好地进行全球范围合作来应对重大挑战,交叉协同,注重AI伦理,共创和谐社会、美好生活。
作者介绍:
张建伟:机器人和人工智能专家,中国工程院外籍院士、德国科学与工程院院士、德国汉堡科学院院士,德国汉堡大学信息学科学系教授、多模态智能机器人系统研究所所长,清华大学杰出访问教授。张建伟院士多年从事及领导智能系统的感知、学习和规划、多传感信息处理与融合、跨模态信息表达、机器人操作系统、多模态人机交互等方向的研究,为工业4.0、未来出行、康复医疗、家庭助老服务等应用领域提供强人工智能的理论框架与计算模型,并领导智能系统的感知学习和规划、多传感信息处理与融合、复杂物体抓取与操作、智能机器人技术、人机交互的研究与开发等研发方向。主持德国科学基金重点项目、联邦教研部与工业合作项目、欧盟ICT、中德跨学科重大研究中心等多项重大机器人研究项目;主持中德NSFC/DFG跨学科重大研究中心NSFC/DFG"跨模态学习"等项目;拥有50余项发明专利,发表500余篇论文及专著,并多次获得国际会议最佳论文奖。
邀请老师演讲、授课请致电:19821197419 阎老师[微信同号]
免责声明:以上内容(包括文字、图片、视频)为用户上传并发布,本平台仅提供信息存储服务。如涉及版权问题,请联系我们并提供版权证明,我们将立即删除!
手机:19821197419
地址:上海市闵行区莲花南路1951号