← 最新论文
💻 computer science

Design and Development of a Low-Cost AI-Based Robotic Face for Real-Time Visual Tracking and Voice Interaction

本文介绍了一种基于树莓派的低成本机器人脸的设计与评估,该机器人利用 OpenCV 进行实时视觉追踪,并通过舵机控制驱动以模拟人类的面部表情和头部动作,在实现 92.4% 检测准确率及极低延迟的同时,还解决了智能交互系统的安全性考量问题。

原作者: Kashif Ahmed Siddiqui, Abdul Rahman Owaise, Mohammed Abdul Baseer farhan, Mohammed Noorullah Khan

发布于 2026-09-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Kashif Ahmed Siddiqui, Abdul Rahman Owaise, Mohammed Abdul Baseer farhan, Mohammed Noorullah Khan

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

人类天生就会关注脸部。当我们彼此交谈时,我们不仅仅是在倾听语言;我们还在观察眼睛的转动、头部的转向以及嘴部如何随着声音而律动。这种持续且无声的视觉线索交换,正是让对话显得鲜活的关键。几十年来,工程师们一直试图制造能够参与这种交换的机器,创造出能够注视着我们并向我们说话的机器人。然而,这些机器中最具说服力的例子通常被锁在昂贵的实验室或封闭的企业大门之后,耗资数万美元,并且需要复杂且专有的技术,这使得其他人难以进行研究或改进。这在推动可能性的前沿的高端研究与学生、教师及独立发明家所需的廉价工具之间,造成了一道鸿沟。

来自印度海德拉巴穆法卡姆·贾大学工程技术学院(Muffakham Jah College of Engineering and Technology)的一个研究小组致力于弥补这一差距。他们提出了一个简单却困难的问题:能否仅使用低成本、易获取的零件,构建一个能够模仿人类实时互动的机器人脸部?他们的目标不是创造一个能表达喜悦或悲伤等复杂情感的机器,而是构建一个能够完成人类在交谈中所做的基本动作的机器:注视说话的人、自然地眨眼,并使嘴部动作与声音同步。通过将一台小型且价格低廉的计算机与摄像头以及几个电机相结合,他们创造了一个系统,证明了精密的交互并不需要巨额财富。

他们制造的设备是一个机器人头部,大小约为人类头部,由3D打印的塑料零件构成。内部有一个小型计算机板充当大脑,而摄像头则作为它的眼睛。研究人员编写程序,让这台计算机不断扫描房间以寻找人脸。当它发现一个人时,它会计算该人相对于摄像头视野中心的相对位置。机器人并不仅仅是呆板地盯着,而是利用这些信息物理性地转动眼睛和头部来跟随人的移动。如果一个人向左走,机器人的眼睛就向左转;如果他们后退,机器人也会调整视线。这种追踪是持续进行的,从而创造出机器正在专注注视的错觉。

为了让互动感觉更加自然,团队加入了一层人工智能,使机器人能够说话。当人对着机器人说话时,麦克风会捕捉声音,随后将其发送到云端服务进行文本转换。语言模型处理这些文本以生成回复,然后再将回复转化为语音。这个过程中最具挑战性的部分不仅是听和说,而是让机器人的嘴部动作与声音相匹配。研究人员通过将机器人的下颚与音频输出相连解决了这个问题。当机器人说话时,一个小电机以一种模拟人类语言自然发音的节奏开合下颚。这种同步至关重要;如果没有它,机器人听起来就像是从一个静止物体中传出的声音,这会让观察者感到不自然且不安。

研究人员对他们的作品进行了严格测试,以观察其在不同条件下的表现。他们发现,在光线良好的情况下,该系统检测人脸的准确率约为92%。机器人识别面部、处理图像并移动眼睛所需的时间非常快,在180到250毫秒之间。为了直观理解,这个延迟非常短,以至于人类观察者会感知到机器人的反应几乎是瞬时的,从而实现流畅的对话而没有尴尬的停顿。即使在人移动时,系统依然保持稳定,能在定义的范围内追踪头部运动而不会丢失目标。

然而,这项研究也强调了使用低成本组件的局限性。研究人员指出,在弱光条件下或当人距离较远时,由于摄像头难以捕捉必要的细节,机器人的性能会显著下降。他们还观察到,机械部件——特别是用于移动眼睛和下颚的小型电机——会引入轻微的延迟,且无法像高端研究机器人中的昂贵电机那样运动得如此平滑。此外,由于系统依赖互联网来处理语音并生成答案,网络连接的任何延迟都会减慢机器人的响应速度。这些因素意味着,虽然机器人在受控环境中表现良好,但尚未准备好应对繁忙公共场所中不可预测的混乱情况。

尽管存在这些局限性,该项目仍代表了迈向机器人技术普及化的重要一步。团队证明了通过专注于核心行为——追踪、眨眼和同步语音——人们可以创造出一种虽然成本极低却令人感到惊人地具有人性化的机器。整个设计,包括代码和3D打印说明,都已向公众开放。这种开放性邀请其他研究人员和学生在这一成果的基础上进行构建、测试新想法,并或许有一天能创造出不仅能注视我们、而且能真正理解我们的机器人。这项工作表明,人类与机器人互动的未来并不只属于富有或精英阶层,任何人只要拥有一台相机、一台计算机和几个电机,都可以参与其中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →