手机版
公众号
手机网站
热门关键词:
政府官员
经济学家
国学文化
企业家
企业培训
网站首页
名师推荐
党史党建
军事国防
国际关系
经济金融
经管智慧
科技前沿
历史文化
名家智库
高校教授
院士专家
政府专家
文化学者
商界精英
实战讲师
协会专家
大咖论道
大咖观点
大咖现场
培训动态
名家课程
师质优选
讲师课件
关于名家
名家业务
企业文化
资质荣誉
宣传视频
联系我们
网站首页
名师推荐
名家智库
大咖论道
培训动态
讲师课件
关于名家
联系我们
名师推荐
名家智库
大咖论道
培训动态
讲师课件
关于名家
联系我们
热门
黄奇帆:新质生产力的核心是要抓好新制造、新服务、新业态!
2024-01-19
请大咖,找名家!请大咖,找名家!
2023-12-01
大咖论道
大咖观点
大咖现场
文章
黄奇帆:新质生产力的核心是要抓好新制造、新服务、新业态!
企业要转型突破,得从组织架构调整开始!
金一南:从历史看什么样的领导值得追随?
张建伟:《多模态具身智能与未来机器人》
来源:
名家讲堂
日期:
2026-08-13
点击:
891
属于:
大咖观点
作者:张建伟(中国工程院外籍院士、德国科学与工程院院士)
今天的我们处于一个智能物联网的时代。如果从未来实际需求来讲,我们现在把人工智能基础技术驱动的方法和未来需求相比,我们看到它们中间的差距是非常远的。现在ChatGPT版本是纯粹的一种技术驱动的方法,它现在要代替的很多白领工作,并不是我们特别希望它们来代替的。在制造、未来出行、大健康、农业、家庭和建筑等方面,我们希望替代更多的是辛苦的蓝领工作,比如工厂里重复单调的装配、帮助照顾我们的父母、农业里的除草、采摘等,但是到目前为止,我们还没有很好的方案,现在非具身人工智能解决不了这些问题。
现在大家都在思考未来在手机、手表、眼镜之后,会是一个什么样的形态,把手机替代的是什么样的形式,现在新发布的VR/AR眼镜,不外乎还是一种信息和视觉、听觉交互形式的改变。未来,我们说从非具身智能走向具身的智能,需要我们在传统的信息通讯系统上,加上body运动执行互动功能,加上高层智能功能,从基本的识别到记忆、到推理,乃至意识。集成这三部分为一体,就使得我们能从信息世界通讯走向物理世界交互,创造新的巨大的应用蓝海。
如何打通基础研究到应用研究再到最后的创新应用?用这张图把技术成熟度一到十的步骤整合起来。技术成熟度一至三的基础研究包括人脑模型、深度学习模型、知识图谱等等。我们把关键的基础研究结果打造成技术成熟度从四到七的模块,用共享的软件ROS机器人操作系统来解决这些开源模块,包括识别、抓取、情感交互等,把它们整合起来解决未来的制造、医疗、健康、出行和家庭服务等。
打通从基础到应用,我们投入了近二十年的工作。在二十年前我们做双臂立体装配机器人,现在工业界对立体产品装配方面呈现非常多重要的需求。我们的研究也影响了协作机器人这个新的技术形态,思灵协作机器人作为独角兽公司,产品现在在富士康iPhone装配工厂已经得到了应用,未来在医疗物理服务方面也会为人类起到更多的作用。我们都盼望着未来我们的父母能够有尊严独立生活不需要护工,利用人工智能、机器人实现助老助残。在未来新感知状态层面,我们从二维数字图像感知到未来三维感知也是走上了新的台阶,今天另一家独角兽公司“梅卡曼德机器人”,基于结构光测的原理,实现了3D点云相机的产业化,已经应用到广泛的制造、物流领域,也在做创新的具身智能的实践。
当然具身智能还有非常大的挑战,现在仅基于互联网和大数据的非具身的智能实现了一些应用场景,正在替代一些白领的工作,但是未来要替代物理世界很多蓝领的工作,我们还需要克复非常多的挑战,比如未知、非结构化环境的建模挑战、灵巧操作挑战、多模态自然交互挑战等等。现在我们在家里能够触摸到、买到的机器人还只是能够单功能扫地、吸尘。在酒店、博物馆和工厂,我们能看到一些运载服务的机器人。但是在未来,各行各业其实有非常大的需求,例如,我们现在智能制造急需的应用场景,70%工厂属于用手操作的劳动密集型,需要多模态机器人化的制造系统;需要帮助我们收割、除草、施肥的农业机器人;需要在家里做家务,和我们互动,陪伴我们健康养老的类人机器人;未来出行城市的交通系统,建筑机器人等,都给我们未来人工智能理论和技术提出了巨大的需求和挑战。
近来,人工智能在四个方面取得了突飞猛进的进展:
1、算力的增长。和30年前相比,30年后算力的增长不是30倍,而是百万倍。如果我们再放眼今后10年,算力会再增加百倍。在这种大的算力引擎的支持下,我们需要充足的数据燃料。
2、多模态数据的感知。从单模态的视觉、听觉、多肢体感觉等巨型数据的收集和融合、自动聚类、自主决策等,都取得了快速进展。
3、算法日新月异发展。从,能够识别的CNN,卷积神经网络处理视觉算法的发展突飞猛进,Segment anything,把所有的二维图像都能分割;处理语音文本RNN、实现语言大模型的应用;以及具身智能在智能体和机器人进行的“增强学习”。现在每天都有上百篇非常专业的论文发表,体现了在算法方面的突飞猛进。
4、机器人正在掌握如何学习。例如Sim2real,把各种机器模型、人工交互模型在仿真里进行测试训练,把仿真里的测试再迁移到实物机器人上面。我们把行走的技术、上身操作的技术、仿人表情机器人头的技术融合在一起,做一个真正实现人功能的仿人机器人。
如何把多模态信息整合在一起,也是整合技术方面非常重要的方向。10年前在深度学习、多模态、ChatGPT尚处于萌芽状态的时候,我们已经筹划并启动了人工智能基础合作项目,“跨模态学习”。针对如何用类脑地形式实现机器整合多模态并进行学习的科学问题,和神经科学家、心理学家共同合作,来研究人是有什么样的机理,能够把视觉、听觉、触觉有机融合在一起,进行存储、表达、交互和学习。我们最近也做出了一系列能够融合多模态深度学习的算法,比如在3D感知的时候用新的算法能够把遮挡的不完全信息自动的补齐,以及我们通过自然语言,能够进行图像自由的处理和分割。
未来,如何把机理模型和大数据学习的新方法融合在一起,是特别重要的一个科学方向。我们把机器人整个控制的等级进行划分,比较低的等级,包括位置控制、力控制等领域,已经有稳定的机理模型,在其基础上可以进行快速的控制。但机器人智能层次和交互的层级越高,它需要多模态的形式就越丰富,包括视觉、触觉、感觉和声音等。在这方面,还欠缺很好的、基于大脑的可计算的模型,所以我们今天还需要很多大数据的支撑。在大模型AI时代,各行各业如何能做出自己的反应?从人工智能的角度讲,我们现在要实现更加透明的人工智能,要集成多模态的信息,研究真实世界的具身智能,而且我们要高度重视以人为本的AI伦理,要用重大需求作为牵引,而不仅仅是技术驱动。从其他非人工智能从业者来讲,我建议大家要扬长我们人类的多模态,在二维视觉到三维视觉到未来的机器人系统中,要增加不同模态的感知,我们要学会跨学科的合作,基于项目的学习方法;不管是学习什么样的专业,要理解AIGC是怎么工作的,要知道它还不能做什么,要学会和人工智能进行合作,要更加有富有想象力、好奇心和创造力,问好的问题。
人工智能在模型和大数据的融合方面,还需要克服非常多的挑战,需要产学研的国际合作,以及具有国际视野的、跨学科卓越工程师的出现。未来我们应该更好地进行全球范围合作来应对重大挑战,交叉协同,注重AI伦理,共创和谐社会、美好生活。
作者介绍:
张建伟:机器人和人工智能专家,中国工程院外籍院士、德国科学与工程院院士、德国汉堡科学院院士,德国汉堡大学信息学科学系教授、多模态智能机器人系统研究所所长,清华大学杰出访问教授。张建伟院士多年从事及领导智能系统的感知、学习和规划、多传感信息处理与融合、跨模态信息表达、机器人操作系统、多模态人机交互等方向的研究,为工业4.0、未来出行、康复医疗、家庭助老服务等应用领域提供强人工智能的理论框架与计算模型,并领导智能系统的感知学习和规划、多传感信息处理与融合、复杂物体抓取与操作、智能机器人技术、人机交互的研究与开发等研发方向。主持德国科学基金重点项目、联邦教研部与工业合作项目、欧盟ICT、中德跨学科重大研究中心等多项重大机器人研究项目;主持中德NSFC/DFG跨学科重大研究中心NSFC/DFG"跨模态学习"等项目;拥有50余项发明专利,发表500余篇论文及专著,并多次获得国际会议最佳论文奖。
邀请老师演讲、授课请致电:19821197419 阎老师
[微信同号]
免责声明:以上内容(包括文字、图片、视频)为用户上传并发布,本平台仅提供信息存储服务。如涉及版权问题,请联系我们并提供版权证明,我们将立即删除!
上一文章:
黄其励:《大力发展光热发电,加快新能源建设》
下一文章:
贾振元:《探索高校科技创新的新路径》
媒体导航网站
凤凰网
腾讯新闻
中国新闻网
搜狗
新浪
CMS系统
百度搜索
科研机构导航
国务院发展中心
北京大学
清华大学
CMSw
复旦大学
交通大学
网站首页
名师推荐
名家智库
大咖论道
培训动态
讲师课件
关于名家
联系我们
地址:
上海市闵行区莲花南路1951号
联系人:
阎老师
技术支持:
友点软件
名家讲堂 界定(上海)文化传播有限公司
版权所有
沪ICP备2023033760号
友情链接
名家讲堂
本网站上图片、文字、字体等,若发现侵害了您的版权,请联系mingca2019@163.com,我们尽快处理!
公众号
手机网站
技术支持:
友点软件
名家讲堂 界定(上海)文化传播有限公司
版权所有
沪ICP备2023033760号