这个“魔术表演”是如何运作的呢?首先,该系统充当了一副能够纠正扭曲视角的眼镜。因为拍摄比赛的摄像机通常固定在墙上或三脚架上,视角看起来会发生拉伸和变形。系统利用数学方法来“压平”视频,将杂乱的摄像角度转化为完美的、俯瞰式的球场地图,就像电子游戏一样。接下来,它使用高速摄像机之眼来捕捉每一个机器人和球,逐帧追踪它们的运动轨迹。但最棘手的部分在于:如果你只是要求一个超级智能的 AI 去“描述这段视频”,它可能会开始胡编乱造,或者产生“幻觉”,比如在机器人并没有进球的情况下说机器人进球了。为了阻止这种情况,研究人员建立了一个安全网。他们创建了一套严格的逻辑规则(就像裁判的规则手册),首先进行判断:“好吧,球移动得很快,并且朝着球门方向移动,所以这是一个射门。”只有在这一逻辑步骤确认了该事件之后,AI 作家才会介入,将这个枯燥的事实转化为一句有趣的句子,例如:“瞧啊!一记强力的射门直奔球门而去!”
该团队在真实的机器人足球比赛上测试了这个系统,其中包括一个拥有更大机器人和更大场地的新型联赛。他们发现,该系统能够以令人印象深刻的准确度追踪机器人,即使机器人在快速移动且球场巨大(14 x 9 米)的情况下,追踪误差通常也保持在约 0.6 到 0.9 米之间。他们展示了通过将严格的逻辑与创意写作相结合,该系统可以生成既符合事实又引人入胜的解说,而不会编造虚假的进球或混淆参赛队伍。
研究人员认为,这种方法是一个巨大的进步,因为它不仅仅是在观察比赛,更是在理解比赛的“故事”。他们指出,以往的方法要么依赖于机器人内部完美的传感器(我们无法始终信任或获取这些数据),要么试图直接从视频中猜测动作,这往往会导致错误。通过使用一种“神经符号”方法——即将 AI 的模式匹配能力与规则手册的严格逻辑相结合——他们成功地弥合了冰冷数据与人类兴奋感之间的鸿沟。虽然该系统目前还不完美(如果人类裁判移动球或追踪出现故障,它有时会感到困惑),但作者表明,这是一个坚实的未来基础。他们相信,这最终可以让世界各地的任何人都能观看机器人足球赛,并听到多语言的实时解说,让机器人背后的科学研究也像比赛本身一样令人热血沸腾。
技术摘要:一种基于大语言模型(LLM)的机器人足球赛自动解说解决方案
问题陈述
RoboCup 倡议旨在推进人工智能与机器人技术的发展,其最终目标是到 2050 年挑战人类 FIFA 世界杯冠军。在这一追求过程中,一个关键但往往被视为次要的挑战是社区进展的可解释性与可理解性。虽然视觉统计数据和比赛追踪对于衡量演进至关重要,但将原始运动学数据转化为人类可读、流畅的解说词仍然存在困难。