← أحدث الأبحاث
💻 computer science

Mi:dm 2.0 Korea-centric Bilingual Language Models

تقدم شركة KT نموذج Mi:dm 2.0، وهي عائلة نماذج لغوية كبيرة ثنائية اللغة تضم نسختين بـ 11.5 مليار و2.3 مليار معلمة، والتي تستفيد من خط معالجة بيانات شامل ومواءمة ثقافية لتحقيق أداء رائد في المعايير المرجعية الخاصة بكوريا مع دعم التطبيقات البحثية والتجارية تحت رخصة MIT.

المؤلفون الأصليون: Donghoon Shin, Sejung Lee, Soonmin Bae, Hwijung Ryu, Changwon Ok, Hoyoun Jung, Hyesung Ji, Jeehyun Lim, Jehoon Lee, Ji-Eun Han, Jisoo Baik, Mihyeon Kim, Riwoo Chung, Seongmin Lee, Wonjae Park, Yoonseo
نُشر 2026-01-15
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Donghoon Shin, Sejung Lee, Soonmin Bae, Hwijung Ryu, Changwon Ok, Hoyoun Jung, Hyesung Ji, Jeehyun Lim, Jehoon Lee, Ji-Eun Han, Jisoo Baik, Mihyeon Kim, Riwoo Chung, Seongmin Lee, Wonjae Park, Yoonseok Heo, Youngkyung Seo, Seyoun Won, Boeun Kim, Cheolhun Heo, Eunkyeong Lee, Honghee Lee, Hyeongju Ju, Hyeontae Seo, Jeongyong Shim, Jisoo Lee, Junseok Koh, Junwoo Kim, Minho Lee, Minji Kang, Minju Kim, Sangha Nam, Seongheum Park, Taehyeong Kim, Euijai Ahn, Hong Seok Jeung, Jisu Shin, Jiyeon Kim, Seonyeong Song, Seung Hyun Kong, Sukjin Hong, Taeyang Yun, Yu-Seon Kim, A-Hyun Lee, Chae-Jeong Lee, Hye-Won Yu, Ji-Hyun Ahn, Song-Yeon Kim, Sun-Woo Jung, Eunju Kim, Eunji Ha, Jinwoo Baek, Yun-ji Lee, Wanjin Park, Jeong Yeop Kim, Eun Mi Kim, Hyoung Jun Park, Jung Won Yoon, Min Sung Noh, Myung Gyo Oh, Wongyoung Lee, Yun Jin Park, Young S. Kwon, Hyun Keun Kim, Jieun Lee, YeoJoo Park

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت ليس فقط اللغة الكورية، بل روح الثقافة الكورية. هذا هو بالضبط ما فعله الفريق في شركة KT (Korea Telecom) مع ابتكارهم الجديد، Mi:dm 2.0.

فكر في معظم نماذج الذكاء الاصطناعي الحالية كأنها سياح حفظوا كتاب جمل جاهزة. يمكنهم قول "مرحباً" و"شكراً" باللغة الكورية، لكنهم قد لا يفهمون لماذا تنحني، أو كيفية استخدام مستوى اللباقة المناسب لمديرك مقابل صديقك، أو المراجع التاريخية العميقة في نكتة ما. أما Mi:dm 2.0، فقد صُمم ليكون مقيماً محلياً. فهو لا يتحدث اللغة فحسب؛ بل يفكر، ويستنتج، ويشعر وكأنه ينتمي إلى المجتمع الكوري.

إليك تفصيل لكيفية بنائه، باستخدام تشبيهات بسيطة:

1. المشكلة: "السائح" مقابل "المقيم المحلي"

لاحظ المؤلفون أنه بينما يمكن للعديد من نماذج الذكاء الاصطناعي التحدث بالكورية، إلا أنها غالباً ما تبدو غير طبيعية أو تفتقر إلى الفروق الثقافية الدقيقة. الأمر يشبه سائحاً يحاول طلب الطعام في سوق محلي ولكنه يتسبب في الإساءة للطاهي عن غير قصد لأنه لم يكن يعرف العادات المحلية. لقد تم تدريب النماذج الموجودة على بيانات كانت إما صغيرة جداً، أو منخفضة الجودة، أو ببساطة لم تلتقط "الجو العام" الخاص بالحياة الكورية.

2. الحل: "حمية ثقافية"

لإصلاح ذلك، لم يكتفِ الفريق بتغذية الذكاء الاصطناعي بمزيد من البيانات؛ بل غدّوه ببيانات أفضل. لقد عاملوا بيانات التدريب مثل طاهٍ يُعد وجبة فاخرة:

  • المكونات (البيانات): لم يجمعوا كل شيء من الإنترنت فحسب. بل بنوا نظام "رقابة جودة" صارم. تخيل مصفاة تستبعد الجمل المكسورة، والتعليقات المسيئة، والنصوص المربكة، وتحتفظ فقط بالقصص والأخبار والكتب الواضحة وعالية الجودة وذات الصلة ثقافياً.
  • المكمل الاصطناعي: بما أن البيانات الكورية عالية الجودة نادرة (مثل العثور على توابل نادرة ومحددة)، فقد أنشأوا بيانات "اصطناعية". لقد أخذوا المعرفة الموجودة وأعادوا كتابتها في تنسيقات جديدة، مثل تحويل مدخل موسوعي جاف إلى درس في كتاب مدرسي أو تحويل قصة إخبارية إلى محادثة، مما ضمن تعلم الذكاء الاصطناعي من مصادر متنوعة.
  • القائمة المتوازنة: لاحظوا أن الذكاء الاصطناعي كان يتناول الكثير من "العلوم الإنسانية" (التاريخ، الأدب) وليس بما يكفي من "العلوم والتكنولوجيا والهندسة والرياضيات" (STEM). لذا، قاموا بطهي "أطباق STEM" إضافية عمداً لضمان أن يكون الذكاء الاصطناعي متوازناً ولا يصاب بالمرض من نظام غذائي أحادي الجانب.

3. النموذجان: "كبير الطهاة" و"السكين الجيب"

لقد أصدروا نسختين من هذا الذكاء الاصطناعي لتناسب احتياجات مختلفة:

  • Mi:dm 2.0 Base (11.5 مليار معلمة): فكر في هذا كـ كبير الطهاة. إنه ضخم وقوي، ويتعامل مع المهام المعقدة مثل الاستنتاج العميق، أو كتابة قصص طويلة، أو حل مسائل رياضية صعبة. تم بناؤه عبر أخذ نموذج أصغر (بـ 8 مليارات معلمة) و"مطّه" بشكل أعمق (إضافة المزيد من الطبقات) لجعله أكثر ذكاءً دون تغيير بنيته الأساسية.
  • Mi:dm 2.0 Mini (2.3 مليار معلمة): هذا هو السكين الجيب. إنه صغير، وخفيف الوزن، ومصمم للعمل على الأجهزة ذات القدرة المحدودة (مثل الهاتف أو الكمبيوتر المحمول). لقد أخذوا معرفة "كبير الطهاة" و"قلمموها" للأسفل، مع الاحتفاظ بأهم المهارات لكي يتمكن من القيام بعمل رائع دون الحاجة إلى مطبخ ضخم.

4. التدريب: من "القراءة" إلى "المحادثة"

  • ما قبل التدريب (قراءة المكتبة): أولاً، قرأ الذكاء الاصطناون الملايين من المستندات لتعلم أساسيات اللغة، والحقائق، والمنطق.
  • ما بعد التدريب (التلمذة): بعد القراءة، خضع الذكاء الاصطناعي لتلمذة متخصصة. لقد علموه مهارات محددة:
    • اتباع التعليمات: تعلم قول "نعم يا سيدي" وفعل ما تطلبه بالضبط، وليس فقط ما يعتقد أنك تريده.
    • السلامة: تعلم ما لا يجب قوله. لقد علموه التعرف على المواضيع الضارة (مثل خطاب الكراهية أو الأفعال غير القانونية) ورفض المشاركة فيها بأدب، ليتصرف كبالغ مسؤول.
    • استخدام الأدوات: تعليمه كيفية استخدام أدوات خارجية، مثل الآلة الحاسبة أو محرك البحث، للحصول على إجابات في الوقت الفعلي.

5. النتائج: اجتياز "اختبار المقيم المحلي"

اختبر الفريق Mi:dm 2.0 مقابل نماذج ذكاء اصطناعي شهيرة أخرى باستخدام اختبارات كورية خاصة (مثل اختبار الذكاء الثقافي).

  • الحكم: لم يكتفِ Mi:dm 2.0 باجتياز الاختبارات فحسب؛ بل تفوق فيها. لقد سجل درجات أعلى من النماذج الأخرى في فهم التاريخ والثقافة والمواقف الاجتماعية المعقدة في كوريا.
  • "الإبرة في كومة القش": اختبروا ما إذا كان بإمكان الذكاء الاصطناعي العثور على معلومة صغيرة في مستند ضخم (مثل العثور على إبرة في كومة قش). كان Mi:dm 2.0 ممتازاً في هذا، مما أثبت قدرته على التعامل مع محادثات طويلة ومفصلة دون أن يتوه.
  • السلامة: عندما تم خداعه بأسئلة ملتوية مصممة لجعله يقول شيئاً مسيئاً أو خطيراً، حافظ Mi:dm 2.0 على ثباته بشكل أفضل من منافسيه، مما أظهر امتلاكه لـ "بوصلة أخلاقية" قوية.

ملخص

Mi:dm 2.0 هو ذكاء اصطناعي ثنائي اللغة (الكورية والإنجليزية) تم هندسته خصيصاً ليكون مركزياً حول كوريا. بدلاً من أن يكون روبوتاً عاماً يتحدث الكورية بالصدفة، فقد تمت تربيته على حمية من البيانات عالية الجودة والغنية ثقافياً لفهم الفروق الدقيقة والفكاهة والقيم في المجتمع الكوري. سواء كنت بحاجة إلى عقل قوي للمهام المعقدة (Base) أو مساعد رشيق للمهام اليومية (Mini)، فإن هذا الذكاء الاصطناعي مصمم ليشعر بأنه أقل شبهاً بالآلة وأكثر شبهاً بصديق محلي واسع المعرفة.

ملاحظة: تذكر الورقة البحثية أن النماذج تُصدر بموجب رخصة MIT لأغراض البحث والاستخدام التجاري، ويقر المطورون أنه رغم سعيهم لتحقيق السلامة، لا يوجد ذكاء اصطناعي مثالي ويمكن أن يرتكب الأخطاء أيضاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →