清华赵明国团队登Science Robotics顶刊,22年教会机器人踢足球

发布时间:2026-08-25 21:30  浏览量:5

本篇介绍了清华大学自动化系赵明国教授团队在机器人顶刊《Science Robotics》发表的最新成果。 研究提出统一感知-运动强化学习框架,让机器人仅靠机载视觉,在球场上自主完成找球、追球和射门。球位置估计误差降低46%,决策时间缩短64%,前场射门成功率达90%。

《Science Robotics》是国际机器人领域公认的顶级期刊,隶属美国科学促进会(AAAS)旗下《科学》系列,影响因子高达26.1,长期稳居全球机器人学期刊第一梯队。今年8月,该刊推出人形机器人专题特刊,全球仅收录三家人形机器人公司平台——加速进化、宇树、波士顿动力,代表了全球人形机器人研究的最前沿阵列。

在这期特刊中,清华大学自动化系赵明国教授团队发表了一篇题为《Learning Vision-Driven Reactive Soccer Skills for Humanoid Robots》(学习视觉驱动的人形机器人反应式足球技能)的研究论文。论文提出一套面向真实世界视觉不确定性的统一感知-运动强化学习框架,让人形机器人仅依靠机载视觉,在动态环境中连续完成找球、追球、调整步态和多方向射门。支撑这项研究的硬件平台,是加速进化(Booster)的人形机器人。

论文链接:

项目主页:https://humanoid-kick.github.io/

01

足球:具身智能的“压力测试”

足球对机器人来说,是一个相当苛刻的测试。

奔跑、平衡、射门,都不是最大难题,真正的瓶颈在于——机器人在运动中“看不清”世界。

奔跑时,摄像头剧烈晃动;阳光下,球体和场地混为一谈;对手冲撞时,目标瞬间从视野中消失。对人来说,这些只是“看不清楚”;对机器人而言,这意味着决策系统的彻底失能——没有可靠的感知,就没有可靠的运动。

传统机器人足球系统大多采用“感知—规划—控制”的模块化流水线:先让视觉模块“看”,再把结果传给规划模块“想”,最后由控制模块“动”。这套方法方便调试,但也容易产生误差和延迟的逐级传递,并且在完美仿真中训练出的策略,到了真实世界可能因光照、噪声、遮挡而出现明显性能下降。

最近几年,深度强化学习开始被用在人形机器人足球上,但不少工作还是依赖动捕系统提供的特权状态,或者要为特定场景做昂贵的三维重建和训练。

赵明国团队把问题重新定义成“感知约束下的控制问题”——不追求先“看得准”再“动得对”,而是让策略在感知不完美的条件下,也能做出正确的动作。

02

不追求“看得准”,而是让策略“适应看不清”

论文的核心贡献是一个统一的感知-运动强化学习框架,将视觉感知与运动控制置于同一个优化目标下进行端到端训练,砍掉了传统架构中间所有的“翻译”环节。

机器人到底“看”什么?

策略并不直接处理高维的原始图像,而是接收一些和足球任务高度相关的结构化线索。比如球相对于机器人的位置、球门中心在哪、球门朝向哪里,以及机器人自己的身体状态(关节角度、姿态等)。新框架通过强化学习,让感知模块不再追求“识别得准不准”,而是追求“能不能让机器人更快更稳地完成任务”。感知和运动共享同一个奖励信号,联合优化——机器人看到的同时就在准备动。

为了让策略在真实世界里足够稳,团队引入了两个关键设计。

一是“虚拟感知系统”。研究团队没有假设仿真里的视觉是完美的,而是故意把真实世界的干扰建模进训练。他们让真实机器人在不同距离和视角下观察足球,累计采集约一小时的数据,再与动捕系统记录的真实位置进行对照,由此得到位置噪声、检测成功率、更新频率和延迟等感知特征。

比如,视场内球体检测概率约90%,意味着有10%的情况可能看不到球;延迟约116毫秒,对踢球这种快速动作来说,已经不小了;更新频率约25赫兹,也就是每秒更新25次,远低于仿真里的理想频率。

这些真实感知特性被注入仿真训练,让策略在训练阶段就必须面对不完美的视觉反馈。

二是“编码器—解码器架构”。策略不是只看当前一帧,而是输入过去50帧的历史观测,差不多1秒的时间窗口,然后编码成一个64维的隐状态表征。解码器再从这个隐状态中重建球体的真实位置等关键信息——这有点像人踢球时会根据前几眼的信息预判球路,而不是只盯着当前瞬间。

为了让机器人动作更自然,团队还采用了对抗运动先验(AMP)方法。

AMP是强化学习中用来让机器人运动更自然的关键技术,但此前几乎只在仿真环境里有效,遇到真实世界的光照变化、遮挡、运动模糊就失灵。赵明国团队首次将AMP成功拓展至真实世界的动态视觉场景,实现了从仿真到真机的零样本部署。

团队的训练数据包括约 76 秒的人类全向行走动作和 30 秒脚弓射门动作数据。判别器负责判断机器人动作与人类示范的接近程度,强化学习策略继续围绕追球和进球优化。

镜像对称约束进一步帮助机器人掌握左右脚射门,避免收敛到单侧踢球。最终,找球、追球、调整落脚点和射门被放进同一个策略,控制器以 50Hz 输出关节位置指令。

训练过程中还涌现出不少自主行为。

足球接近视野边缘时,机器人会主动转头和转身,把球重新移回视野。步态也会随足球距离变化——距离较远时采用较慢的步频以维持稳定观察,接近足球后周期缩短到0.3至0.4秒,通过更短、更快的步伐微调落脚点。当球门位于机器人身后,策略甚至会生成一种旋转钩射动作,省去重新站位的时间。

03

误差降46%,准备时间缩短64%

实验数据证明了这套控制器的有效性和鲁棒性。

踢球成功率:仿真做了8192次测试,靠近球门区域成功率约90%。真实机器人上,前场位置连续10次测试成功率约80%—90%,后场区域也有60%—70%。所有真实试验中机器人都保持稳定,没有记录到跌倒事件。

误差与效率:踢球前最后1秒,策略对球位置的估计误差从0.344米降到0.186米——降幅约46%。踢球准备时间最高缩短64%:规则策略需约2-5秒,学习策略在所有朝向上都稳定在1.5秒左右。转向敏捷性也更高,最大转向角速度达到3-4 rad/s。

实战验证:清华大学Hephaestus(火神)队将该控制器作为独立模块,应用于RoboCup 2025成人尺寸人形机器人联赛及2025年世界人形机器人锦标赛,最终以76粒进球、仅失11球的战绩夺得双料冠军。今年7月,清华火神队在2026年RoboCup韩国仁川赛事中成功卫冕冠军——这标志着该技术方案在连续两届世界顶级赛事中经受了最严格的实战检验。

04

二十二年,一场跨越三代的技术接力

这篇论文背后,是一段跨越二十二年的故事。

2004年,赵明国带领学生成立清华火神机器人足球队。次年,他们带着自行研制的机器人参加RoboCup。早期机器人只有约50厘米高,行走缓慢,比赛时还需要保护人员防止摔倒。

此后的二十多年里,火神队几乎每年参赛,机器人逐渐长到一米以上,学会自主起身、快速奔跑和大力射门。足球场成为团队长期检验视觉、决策、运动控制和整机可靠性的试验场——视觉识别慢了多少毫秒,落脚点偏了多少厘米,机器人在哪个方向容易踢空,都能在真实对抗中直接呈现。

赵明国长期从事类脑计算与机器人控制研究。他参与研制的「天机芯」类脑芯片及无人自行车研究曾登上《Nature》封面,并入选2019年度中国科学十大进展。

随着岁月流转,火神队的成员一届届更替。加速进化创始人程昊曾是火神队第三任队长,从清华毕业后历经互联网创业的锤炼,以及在字节跳动担任飞书产品副总裁的履历积累,2023年选择重新出发,创办「加速进化」。曾经在火神队并肩作战的多名成员也纷纷加入。

论文第一作者王与时,则来自火神队的新一代。

从2004年火神队创立,到2026年论文登上国际顶刊——这是一场跨越二十二年的技术接力。从类脑计算到机器人足球,赵明国关注的始终是同一个命题:感知、判断和行动如何在同一系统中连续运行。