想象一下,有一种社交机器人,它不仅仅像聊天机器人那样说话,还能真正“记住”你是谁,了解你与朋友的关系,并能回想起过去的对话而不会感到不堪重负。这就是 ARIS(代理与关系智能系统)的目标,这是一种专为 Pepper 等社交机器人设计的新型“大脑”。
以下是 ARIS 工作原理的分解,使用了简单的类比:
1. 问题:“金鱼”机器人
目前的社交机器人有点像记忆极短的金鱼。它们能和你聊几分钟,但如果你和它们聊几个小时,或者你带朋友一起来,它们就会感到困惑。它们会忘记你的朋友是谁,记不住昨天聊了什么,也难以理解你和朋友是一个“团队”。如果对话太长,它们也会变得缓慢迟钝,因为它们试图一次性记住“所有”内容。
2. 解决方案:ARIS
研究人员构建了 ARIS 来解决这些问题。把 ARIS 想象成坐在机器人头脑中的一个超级有条理的个人助理。它拥有三大主要超能力:
A. “社交地图”(社交世界模型)
想象机器人有一张画在墙上的巨大、鲜活的思维导图(图)。
- 工作原理: 每次你见到机器人,它都会为你画一个点。如果你提到你的朋友“莎拉”,它就会为莎拉画一个点,并用一条标有“朋友”的线将这两个点连接起来。
- 重要性: 如果你下周回来,机器人看到的不再是一个陌生人;它会查看它的地图,看到连接你和莎拉的线,并立刻明白:“啊,这就是和莎拉常来往的人。”这使得机器人能够理解关系(如“丈夫”、“老板”或“最好的朋友”),并在多次不同的对话后依然能追踪人物。
B. “智能图书管理员”(检索增强生成)
想象机器人有一个它曾经进行过的所有对话的图书馆。
- 旧方式(非 RAG): 如果你问一个问题,旧机器人会试图从头到尾阅读图书馆里的每一本书来寻找答案。如果图书馆有 10,000 本书,这需要很长时间,机器人也会感到疲惫(响应时间慢)。
- ARIS 方式(RAG): ARIS 充当智能图书管理员。当你问一个问题时,图书管理员不会通读整个图书馆。相反,他们会快速扫描书名,只抽出最相关的 20 本书(以及最近的 20 本)来给你答案。
- 结果: 无论存储了多少年的对话,机器人都能保持快速敏捷。它不会被海量的数据压垮。
C. “身体与眼睛”(多模态推理)
ARIS 不仅仅是盒子里的声音;它将机器人的眼睛和身体与大脑连接起来。
- 眼睛: 如果你戴着一顶红帽子,机器人的视觉系统会看到并告诉大脑:“嘿,他们戴着一顶红帽子。”机器人随后可以说:“我喜欢你的红帽子!”
- 身体: 如果你要求击掌,机器人不仅仅说“好的”;它会真正举起手臂和你击掌。
- 大脑: “推理器”根据当下的情况,决定何时使用眼睛、何时移动身体、何时仅仅说话。
3. 测试:它奏效了吗?
研究人员使用 Pepper 机器人与 23 人进行了测试。他们将ARIS 机器人与标准机器人(仅使用没有记忆地图或智能图书管理员的基本 AI 聊天机器人)进行了对比。
结果:
- 更聪明的感觉: 人们认为 ARIS 机器人明显更聪明,更具生命力。
- 更像人类: 人们觉得 ARIS 机器人更像人。它感觉不像机器,而更像是一个社交伙伴。
- 更讨人喜欢: 人们就是更喜欢 ARIS 机器人。
- 记忆获胜: 当参与者介绍一位伙伴时,ARIS 机器人记住伙伴的名字和关系的能力远胜于标准机器人。
- 速度获胜: 即使将对话历史人为扩展到数千条消息,ARIS 机器人依然保持快速,而标准机器人则慢如蜗牛。
总结
简而言之,ARIS 赋予了机器人长期记忆、人类关系地图以及搜索自身历史的智能方式。这使得机器人不再像是一个你一走开就忘记一切的工具,而更像是一个记得你的故事、认识你的朋友,并能跟上漫长而深入的对话而不感到疲惫的朋友。
技术摘要:ARIS——面向社交机器人的代理与关系智能系统
1. 问题陈述
尽管基础模型(LLM 和 VLM)通过增强感知和沟通能力提升了社交机器人技术,但现有系统在大规模多轮交互、社会关系推理以及基于上下文的对话方面仍面临关键局限。现有架构主要针对任务执行和物理操作,而非社会智能。因此,机器人在以下方面存在困难:
- 表征或推理个体之间的社会关系(例如:家庭成员、同事)。
- 由于有限的上下文窗口和日益增加的推理延迟,在密集、长期的交互中难以保持历史一致性和响应性。
- 在统一框架内将社会认知与物理具身相结合。
2. 方法论
作者提出了ARIS(代理与关系智能系统),这是一个模块化代理 AI 框架,旨在统一多模态推理、基于图的社会世界模型(Social World Model)以及检索增强生成(RAG)。该系统部署在**Pepper 机器人(v1.8)**上,采用边缘 - 客户端 - 服务器架构。
2.1 系统架构
- 边缘(机器人): Pepper 机器人作为用户界面,负责捕获音视频流并执行物理动作(手势、舞蹈)。
- 客户端: 一台 Raspberry Pi 5,将音视频流封装为 gRPC 数据包进行传输。
- 服务器: 一台 NVIDIA RTX 4090 服务器处理输入。它利用Whisper-large-v3进行语音转录,并使用Grok 2大型语言模型(LLM)进行推理。
- 模块化推理引擎: 一个“推理器”模块根据上下文查询 API 库,以选择适当的动作(语音、视觉或物理具身)。
2.2 核心组件
A. 社会世界模型(SWM)
- 结构: 一个基于图的知识图谱(Neo4j),其中节点代表人物节点(用户),边代表关系(例如:朋友、家人)。
- 功能: 系统利用 LLM 从对话中提取关系线索以推断连接(例如:"X 是 Y 的上级”)。它通过 Cypher 查询更新图谱,为未知用户创建新节点,或使用 Levenshtein 距离进行名称匹配来合并现有节点。
- 属性: 该模型存储与特定人物节点关联的用户属性(兴趣、职业),从而实现个性化交互。
B. 基于 RAG 的语音管道
- 设计: 为了解决上下文窗口限制和计算成本问题,ARIS 采用 RAG 管道。对话历史被存储为消息节点(用户输入 + 机器人回复),并与人物节点关联。
- 检索策略: 收到输入后,系统检索:
- 最近的 20 条消息以确保即时连贯性。
- 语义最接近的 20 条消息(使用 1536 维 OpenAI 嵌入和 HNSW 索引)以提供上下文。
- 包含检索到的消息的直接前驱和后续消息,将总上下文上限设定为80 条消息。
- 执行: 检索到的上下文被输入 LLM(Grok 2)以生成回复,随后该回复被追加到图谱中。
C. 多模态集成
- 视觉: 当需要视觉上下文时,视觉语言模型(Grok-2-Vision)充当描述生成器。
- 重识别(ReID): 一个模块通过多数投票处理 15 帧,为个人分配唯一的脸部 ID,并将其链接到 SWM 中的人物节点。
3. 主要贡献
本文概述了三项主要贡献:
- 面向人机交互(HRI)的社会世界模型: 一种基于图的表示法,明确映射并更新人与人之间的关系,使机器人能够追踪社会联系、在多次相遇中重新识别用户,并生成基于关系数据的上下文感知对话。
- 高效的 RAG 管道: 一种利用混合语义和时效性感知检索的新颖检索机制。这使得机器人能够在数千次交换中维持基于上下文的对话,同时保持有界的延迟和响应相关性。
- 系统集成与验证: 将这些组件统一为模块化代理架构,协调语音、视觉和物理动作。该系统在经验上针对仅 LLM 基线进行了验证。
4. 实验结果
作者进行了两项实验:一项用户研究(N=23)和一项可扩展性模拟。
4.1 用户研究(假设 H1)
参与者以双人配对形式与机器人互动,比较ARIS 系统与仅 LLM 基线(缺乏 SWM、ReID 和物理具身)。
- 指标: 感知智能、生动性、拟人化和喜爱度(Godspeed 问卷)。
- 发现: ARIS 在所有指标上均显著优于基线:
- 拟人化: d=1.05(大效应,p<0.001)。
- 智能: d=0.74(中等效应,p=0.0018)。
- 生动性: d=0.70(中等效应,p=0.003)。
- 喜爱度: d=0.46(小 - 中等效应,p=0.0398)。
- SWM 性能: 在 12 名“第二位互动”的参与者中,有 7 人被 ARIS 成功识别,9 人报告机器人“了解我的伴侣”,而基线的识别率显著较低。
4.2 RAG 与非 RAG 的可扩展性(假设 H2)
作者通过复制消息历史多达 14,000 条来模拟密集对话。
- 延迟: 非 RAG 管道显示出从线性到超线性的推理时间增长,在 14,000 条消息时超过10,000 毫秒。无论历史大小如何,RAG 管道将延迟保持在4,000 毫秒以下的有界范围内。
- 输出质量: RAG 与非 RAG 输出之间的余弦相似度为83.54%,表明选择性检索保留了与全历史访问相当的相关性响应。
5. 意义与主张
本文主张,ARIS 证明了整合具身推理和结构化记忆对于推进机器人社交互动的价值。通过统一社会推理、多模态感知和上下文检索,该系统在用户参与度和感知智能方面实现了相对于标准仅 LLM 基线的可衡量改进。
作者强调,他们的方法是具有成本效益的,仅在上下文需要时调用视觉语言模型,并限制 RAG 检索以减少 Token 消耗。他们将 ARIS 定位为迈向能够在现实环境中实现“深度对话”和持续社会意识互动的机器人的一步。
承认的局限性:
- 评估缺乏正式消融研究以隔离各个组件的贡献。
- 可扩展性测试使用了合成复制的消息,而非有机的长期对话,这可能无法完全捕捉语义漂移。
- 样本量(N=23)较小,且系统仅在单一机器人平台(Pepper)上进行了测试。
该实现计划在发布时作为开源项目发布。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。