的“小脑”和肢体发展较快,在运动控制和机械本体方面已经取得明显进步,但负责感知、分析和决策的“大脑”仍面临算力、算法和数据等多重约束。
他认为,现阶段应当客观看待具身智能的发展水平,机器人有望率先在家庭服务、陪伴和工业生产中的简单、固定场景落地,但不能期待其短期内像人一样处理所有复杂任务。具身智能的发展方向是明确的,实现过程则需要长期积累。
孙立宁: 以人形机器人为例,首先是本体设计。它有双腿、双臂和多个自由度,需要在有限空间内集成大量部件,因此轻量化、紧凑化和仿生化设计非常关键。
第二是关节。大家看到翻跟头、跳跃,背后需要关节在很小的体积内提供较强的爆发力和较高的功率密度,同时还要解决长时间工作时的发热和可靠性问题。
第三是感知。要像人一样与外部环境交互,就要具备视觉、听觉、触觉、嗅觉、温觉和滑觉等能力。比如,一只尺寸有限的灵巧手要集成电子皮肤,并感知不同物体,对材料、集成电路、MEMS、芯片和传感器技术都提出了很高要求。
第四是运动控制,也就是机器人的“小脑”。机器人跳跃、抓取或者全身协同运动,涉及多个自由度的动力学控制。
第五是机器人的“大脑”。人给机器人一个任务后,它需要把语言指令转化为一系列动作,并结合视觉、声音和力觉等信息,判断下一步做什么。这涉及大模型以及对多种传感信息的分析和决策。
孙立宁: 早期工业机器人没有感知能力,只能按照预先编好的程序重复动作,可以称为第一代可编程示教机器人。第二代机器人具备一定的局部感知能力,比如通过视觉识别焊缝位置,或者感知抓取物体的重量。
现在探索的第三代机器人,不只是感知,还要能够分析和决策。比如,人只告诉机器人“把杯盖打开”,而不再逐步教它如何操作,机器人需要自己决定怎样拿起杯子、放在哪里以及用多大的力。
但目前距离像人一样理解和处理复杂环境还有很大差距。现有人工智能在图像、语义和文字识别方面进步很快,可以辅助人解决一些复杂识别问题;放到机器人上以后,还要处理图像、声音、力觉和操作过程中的大量不确定因素。相关数据尚未被充分采集,系统对复杂环境的理解和决策能力仍然有限,更多是框架式、局部式的智能。对此要客观评价,不能过度夸大。
孙立宁: 人有很多难以直接表达的经验知识。以炒菜为例,先让机器人完整模仿人的动作,只能实现知识迁移。如果食材数量、温度或者火候发生变化,原来的动作参数可能就不再适用。
要让机器人在变化的条件下仍然完成任务,就要建立评价和反馈机制,让它通过学习逐渐积累经验。但“少许”是多少、“熟了”是什么状态、“香”如何量化,这些连人都很难完整描述。机器人要获得足够复杂的数据,并建立有效反馈,才能逐渐形成适应环境的能力。理论框架是成立的,具体执行却非常复杂。
孙立宁: 不要指望一个机器人短期内什么都能做。更现实的路径,是先进入简单、明确和重复性较强的场景。
在家庭中,可以先在扫地机器人等产品上增加简单操作能力,例如捡起地上的袜子或鞋子,这类功能有望较快实现。家庭康养方面,机器人可以按照固定生活习惯提醒老人吃药,或者帮助拿取咖啡、手机、充电器和拖鞋等物品。此类相对简单的服务,未来三年左右有望逐步实现。
但如果要求机器人像护工一样,处理搀扶、如厕、喂饭以及认知障碍老人照护等复杂任务,短期内并不现实。未来三到五年,市场上可能会出现一批以情感陪伴为主、价格相对可接受的专用机器人。
工业场景也会从单一任务开始。比如,让机器人长期重复完成拧盖子等工作,并根据物体变化调整力度,多模态感知和控制有望在这类限定场景中发挥作用。不能期待机器人突然具备与人相同的能力,但让机器人逐步变得更智能,这条技术路线是成立的。
孙立宁: 新技术出现时,社会往往会给予很高期待。关注和投入能够调动更多力量参与研发,推动技术进步,这是积极的一面。
但如果公众预期过高,认为机器人三年内就能像人一样工作,现实产品又达不到这种水平,就会感到失望。具身智能是一个循序渐进的过程。它的理念和方向没有问题,但不能把它放大成“一夜之间改变世界”。
科技进入生活通常也是渐进的。汽车从机械化发展到具备影音、导航、辅助驾驶和自动泊车等功能,人们未必能感受到每一步变化,但智能化一直在持续。具身智能也会沿着类似路径,一段一段地实现。
孙立宁: 近几年,中国机器人在机械本体和运动控制方面进步明显。从早期只能缓慢行走,到能够跑步、参赛,再到尝试进入工厂工作,“小脑”和肢体的发展比较快。
但目前展示的机器人还不等于理想状态下的具身智能。有些依赖遥控,有些依赖示教,有些只是重复动作,另一些只能进行简单反馈。即使安装了多种,也未必能够充分分析和利用这些信息。
“小脑”和肢体在产品推出后,经过三到五年迭代,有机会达到较好的水平;“大脑”则是更长期的课题。要达到科幻作品中那种接近人的综合智能,可能需要二三十年持续攻关,最终形态也未必与今天的设想完全一致。
首先是算力。模型既要快又要准,需要高性能芯片支撑,现有计算能力仍然存在约束。其次是算法。即使算力提高,模型对复杂环境的适应能力也未必足够,智能算法还需要持续突破。最后是数据。人的每一个动作都会产生大量视觉、触觉和运动数据,获取、标注和处理这些数据都很困难。
这三方面需要共同进步。随着芯片性能提升、算法不断改进,以及更多高质量数据被采集和利用,机器人的智能水平会逐步提高。就像移动电话和计算机经历长期演进一样,具身智能不会一步到位,而会慢慢进入生产和生活。
发表回复
要发表评论,您必须先登录。