← أحدث الأبحاث
💬 NLP

Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?

تقدم هذه الورقة تقدير الكثافة الموجه بالكميات (QGDE)، وهي طريقة تستفيد من استقرار توزيعات نسب معرفات الرموز (token ID-ratio) في أجهزة ترميز BPE الصادرة لتقدير نسب التكوين بدقة لمجموعات بيانات التدريب المسبق الخفية على مستويي الرمز والفئة.

المؤلفون الأصليون: Qingjie Zhang, Xingzhang Ren, Zixuan Chen, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Dayiheng Liu, Han Qiu

نُشر 2026-08-12
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Qingjie Zhang, Xingzhang Ren, Zixuan Chen, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Dayiheng Liu, Han Qiu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك اشتريت للتو روبوت طباخاً جديداً كلياً، فائق الذكاء. يمكنه كتابة الشعر، وحل المسائل الرياضية، وحتى برمجة ألعاب الفيديو. لكن هناك عقبة: كتاب الوصفات الذي استخدمه ليتعلم الطبخ مغلق داخل خزنة. يمكنك رؤية أطباق الروبوت النهائية، ويمكنك حتى رؤية قائمة المكونات التي ربما استخدمها، لكن ليس لديك أدنى فكرة عن المزيج الفعلي للمكونات. هل كان 90% من عجين البيتزا و10% من التوابل؟ أم ربما 50% من الشوكولاتة و50% من البروكلي؟ في عالم الذكاء الاصطناعي، يُسمى هذا "كتاب الوصفات" بـ متن ما قبل التدريب (pretraining corpus)، وتُسمى "قائمة المكونات" بـ مفردات الـ tokenizer (tokenizer vocabulary).

عندما تطلق الشركات نموذج ذكاء اصطناعي جديد، فإنها غالباً ما تشارك الأوزان النهائية (دماغ الروبوت) وقائمة المفردات (قاموس المكونات)، لكنها تبقي الوصفة الدقيقة سرية. وهذه مشكلة لأن معرفة ما "أكله" الذكاء الاصطناعي يساعدنا في فهم سبب تفوقه في بعض الأمور وإخفاقه في أخرى. لسنوات، حاول العلماء تخمين الوصفة من خلال مراقبة سلوك الروبوت أو القواعد التي استخدمها لتقطيع الكلمات إلى قطع. لكن هذه التخمينات كانت غالباً خشنة للغاية، مثل القول "من المحتمل أنه أكل الكثير من الفاكهة" دون معرفة ما إذا كانت تفاحاً أم موزاً. السؤال الكبير كان: هل يمكننا النظر إلى قاموس المكونات وحده واستنتاج النسبة الدقيقة لكل مكون استهلكه الروبوت؟

تقول هذه الورقة البحثية: "نعم، يمكننا ذلك، وإليكم كيف". فقد اكتشف الباحثون أن الطريقة التي تُقطع بها الكلمات وتُرقّم في هذه القواميس ليست عشوائية؛ بل تتبع نمطاً خفياً ومستقراً، تماماً كما يتبع تكرار الكلمات في أي لغة منحنىً يمكن التنبؤ به. لقد أدركوا أنه إذا كنت تعرف النمط من وصفة "معروفة" (متن متاح لنا)، فيمكنك نقل ذلك النمط لتخمين وصفة "مخفية" واحدة. لقد بنوا أداة ذكية تسمى QGDE (تقدير الكثافة الموجه بالكميات المئوية). فكر في الأمر كأنك محقق لا ينظر فقط إلى دليل واحد، بل يستخدم مجموعة كاملة من سيناريوهات "ماذا لو" (اتجاهات الكميات المئوية) ويوازنها بناءً على مدى ازدحام حي الأدلة (وزن الكثافة المحلية).

النتائج دقيقة بشكل مذهل. في اختباراتهم، استطاع نظام QGDE تخمين نسبة كلمات محددة بمعدل خطأ ضئيل قدره 3.00% فقط. وعندما قاموا بتجميع تلك الكلمات في فئات أكبر مثل "الويب"، أو "الرياضيات"، أو "البرمجة"، ظل معدل الخطأ 3.08% فقط. وهذا يمثل تحسناً هائلاً عن الطرق السابقة، التي كانت تشبه تخمين حالة الطقب عبر النظر إلى سحابة واحدة. كما اختبرت الورقة هذا النظام على نموذج ذكاء اصطناعي حقيقي ومتاح يسمى SmolLM، حيث كانت الوصفة الفعلية معروفة. وحتى هناك، تفوق QGDE على الطرق الأخرى، مما يثبت أن قاموس مفردات الذكاء الاصطناعي يحمل بالفعل سر وصفته. ومع ذلك، يوضح المؤلفون بحذر أنه بينما يعمل هذا بشكل جيد في محاكاتهم وعلى نموذج SmolLM، إلا أننا لا نزال غير قادرين على اختباره على العمالقة مثل ChatGPT أو Qwen لأن وصفات تدريبهم الكاملة تظل مغلقة. ولكن في الوقت الحالي، يشير هذا إلى أنه في المرة القادمة التي ترى فيها قائمة مفردات ذكاء اصطناٍ، قد تكون تنظر للتو إلى خريطة لنظامه الغذائي الخفي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →