Multimodal Rapport Estimation in Real-World HRI
تُظهر هذه الدراسة أن الدمج متعدد الوسائط لنماذج اللغات الكبيرة ذات التعلم الصفري (وتحديداً Gemini 2.5 Flash) مع نماذج صوتية وبصرية مدربة مسبقاً (Hubert و V-JEPA) يُقدر بفعالية مستوى الألفة المقيم من قبل طرف ثالث في بيئات التفاعل بين الإنسان والروبوت الواقعية، متفوقاً بذلك على النماذج الفردية ومسلطاً الضوء على ضرورة مراعاة التباين السياقي مثل مدة التفاعل وحجم المجموعة.