← أحدث الأبحاث
💬 NLP

IndicTalk: A Large-Scale Persona-Based Multilingual Conversational Corpus for Indic Languages

تقدم هذه الورقة البحثية IndicTalk، وهو متن لغوي ضخم تم إنشاؤه تلقائياً يضم أكثر من 1.3 مليون محادثة قائمة على الشخصيات ومرتبطة بالأحداث ومتعددة اللغات (code-mixed) عبر 18 نوعاً من 9 لغات هندية، صُمم لتعزيز الذكاء الاصطناقي للمحادثات متعدد اللغات في المناطق غير الممثلة كفاية.

المؤلفون الأصليون: Sahil Deepak Gawande, Mayank Singh

نُشر 2026-07-28
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Sahil Deepak Gawande, Mayank Singh

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل الإنترنت كأنه ساحة مدينة عالمية صاخبة ومزدحمة. لفترة طويلة، كان المتحدثون باللغة الإنجليزية يمتلكون أضخم مكبرات الصوت وأكثر المقاعد راحة، بينما كان على المتحدثين باللغات الأخرى غالباً أن يصرخوا فوق الضجيج أو يجلسوا على الهامش. في عالم الذكاء الاصطناعي، هذه "الساحة العامة" هي المكان الذي تتعلم فيه الحواسيب كيف تدردش. مؤخراً، أصبحت هذه الحواسيب — التي تُسمى النماذج اللغوية الكبيرة (LLMs) — بارعة للغاية في إجراء المحادثات، لكنها تعلمت ذلك في الغالب من خلال الاستماع إلى المتحدثين بالإنجليزية.

ومع ذلك، في أجزاء كثيرة من العالم، لا يتحدث الناس لغة واحدة فقط؛ بل يمزجون بينها. وهذا ما يسمى "الخلط اللغوي" (code-mixing). تخيل صديقاً يروي قصة حيث ينتقل فجأة من لغته الأم إلى الإنجليزية في منتصف الجملة، أو حتى يكتب كلماته الأصلية باستخدام الحروف الإنجليزية (مثل كتابة "hello" بدلاً من "नमस्ते"). هذه هي الطريقة التي يتحدث بها ملايين البشر عبر الإنترنت فعلياً. المشكلة هي أن معظم روبوتات الدردشة المدعومة بالذكاء الاصطناعي تشبه المعلمين الصارمين الذين لا يفهمون إلا لغة واحدة في كل مرة؛ فهم يرتبكون عندما تخلط بينهما، مما يجعل من الصعب عليهم الدردشة بشكل طبيعي مع مليارات الأشخاص الذين يتحدثون بهذه الطريقة الممزوجة. ولإصلاح ذلك، نحتاج إلى مكتبة ضخمة من محادثات التدريب التي تلتقط هذا المزيج الفوضوي والجميل من اللغات.

هنا يأتي دور IndicTalk، وهو مشروع جديد ضخم يبني بالضبط هذا النوع من المكتبات للغات الهند. أدرك الباحثون وراء هذا العمل أنه بينما توجد مجموعات بيانات وفيرة للغة الإنجليزية، لم يكن هناك شيء تقريباً للغات المختلطة والمعقدة التي تدور في المحادثات عبر تسع لغات هندية مختلفة. كانت الموارد الموجودة إما صغيرة جداً، أو تركز فقط على زوج لغوي واحد (مثل الهندية والإنجليزية)، أو كانت مجرد قوائم من الجمل بدلاً من كونها محادثات كاملة وانسيابية.

ولحل هذه المشكلة، أنشأ الفريق "مصنع محادثات" مؤتمتاً بالكامل. فبدلاً من توظيف آلاف الأشخاص لكتابة الحوارات يدوياً، قاموا ببناء مسار يبدأ من أخبار حقيقية من الواقع. فكر في الأمر كأنك تأخذ عنواناً من صحيفة، وتلخص الحقائق الرئيسية، ثم تغذي هذا الملخص لذكاء اصطناعي فائق الذكرامة. بعد ذلك، يُعطى هذا الذكاء الاصطناعي "شخصية" محددة — مثل صديق فضولي، أو معلم صارم، أو فرد من العائلة قلق — ويُطلب منه إجراء محادثة حول هذا الخبر الإخباري. يقوم النظام بذلك مراراً وتكراراً، مولداً ملايين الدردشات.

والنتيقة هي IndicTalk، وهي مجموعة بيانات هائلة تحتوي على أكثر من 1,328,604 محادثة متعددة الأدوار. هذه ليست مجرد دردشات عشوائية؛ فهي مستندة إلى أحداث حقيقية وتغطي 18 نوعاً لغوياً مختلفاً عبر 9 لغات هندية (بما في ذلك البنغالية، والهندية، والتاميلية، والتيلوغو). وما يجعلها مميزة هو أنها تلتقط طريقتين للكتابة: النصوص الأصلية التقليدية (مثل خط ديفاناغاري أو الخط التاميلي) والنسخ المكتوبة بالحروف اللاتينية (حيث تُكتب تلك اللغات باستخدام الحروف الإنجليزية)، وهي الطريقة التي يكتب بها الكثيرون عبر هواتفهم.

لم يكتفِ الباحثون بضخ البيانات فحسب؛ بل أخضعوها لفحص جودة صارم. فقد استخدموا فلاتر آلية للتأكد من أن المحادثات تمزج اللغات بشكل صحيح ولم تنزلق بالخطأ إلى الإنجليزية فقط أو إلى لغة أصلية واحدة فقط. كما عمل خبراء بشريون ونماذج ذكاء اصطناعي قوية أخرى كحكام لتقييم الدردشات. وكانت النتائج واعدة: حيث وُجد أن المحادثات تتسم بالطلاقة، والتماسك، والخلط اللغوي الطبيعي، تماماً مثل الدردشات البشرية الحقيقية.

باختصار، تشير هذه الورقة البحثية إلى أنه من خلال استخدام مسار ذكي ومؤتمت، يمكننا إنشاء مورد عالي الجودة وضخم الحجم يساعد الذكاء الاصطناعي على فهم الطريقة الحقيقية والمختلطة التي يتحدث بها الناس. وبينما يشير المؤلفون إلى أن هذه المحادثات هي محادثات اصطناعية (مولدة حاسوبياً) وقد تفتقر إلى بعض العيوب الصغيرة والفوضوية التي تميز الكلام البشري الحقيقي، فقد نجحوا في إثبات أنه من الممكن بناء مجموعة بيانات ضخمة ومتنوعة تجسر الفجوة بين الذكاء الاصطناعي الجامد والواقع المرن للحياة متعددة اللغات. هذه المجموعة من البيانات متاحة الآن للآخرين لاستخدامها، مما قد يساعد في بناء روبوتات دردشة ومساعدين صوتيين يشعرون أخيراً بأنهم ينتمون إلى الساحة العالمية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →