← أحدث الأبحاث
🤖 machine learning

TabTreeFormer: Tabular Data Generation Using Hybrid Tree-Transformer

تقدم هذه الورقة البحثية TabTreeFormer، وهي بنية محولة هجينة تدمج الانحيازات الاستقرائية القائمة على الأشجار ومجزئ رموز مدركاً للتعقيد لتوليد بيانات جدولية عالية الدقة بكفاءة، متفوقة بذلك على النماذج الحالية عبر مقاييس المنفعة، والدقة، والخصوصية.

المؤلفون الأصليون: Jiayu Li, Bingyin Zhao, Zilong Zhao, Uzair Javaid, Kevin Yee, Biplab Sikdar

نُشر 2026-07-29
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jiayu Li, Bingyin Zhao, Zilong Zhao, Uzair Javaid, Kevin Yee, Biplab Sikdar

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت فهم العالم، ولكن بدلاً من إظهار أفلام أو كتب له، أنت تعطيه فقط جداول بيانات. هذه الجداول موجودة في كل مكان: فهي تحتوي على سجلاتك الطبية، وكشوفات حساباتك البنكية، ودرجاتك المدرسية. لكن هناك مشكلة؛ فهذه الجداول مليئة بالأسرار. إذا تركت الروبوت يتعلم مباشرة منها، فقد يحفظ تفاصيلك الخاصة عن طريق الخطأ ويفضح المستور. ولحل هذه المشكلة، يبتكر العلماء "بيانات اصطناعية" — جدال بيانات مزيفة تبدو وتتصرف تماماً مثل الجداول الحقيقية، ولكنها لا تحتوي على أي أشخاص حقيقيين. الأمر يشبه صنع تمثال شمعي مثالي لشخص ما؛ يبدو حقيقياً، لكنه آمن للمس.

المشكلة هي أن الروبوتات التي نستخدمها عادةً لصنع هذه الجداول المزيفة تكون خرقاء بعض الشيء مع الأرقام. فهي بارعة في فهم الجمل (مثل برامج الدردشة الآلية) أو الصور (مثل الكاميرا)، لكنها تعاني مع الطبيعة الغريبة والمتعرجة لبيانات الجداول. فالأرقام في العالم الحقيقي غالباً ما تقفز فجأة في خطوات (مثل انخفاض السعر من 100 دولار إلى 50 دولاراً في لحظة) بدلاً من التدفق بسلاسة مثل النهر. كما أن هذه الروبوتات غالباً ما تكون بطيئة وتستهلك الكثير من الذاكرة للتعامل مع جداول ضخمة من البيانات. السؤال الكبير الذي يواجه العلماء هو: كيف نبني روبوتاً ذكياً بما يكفي لنسخ الطبيعة الفوضوية والمتقفزة للبيانات الحقيقية دون أن يحفظ الأسرار أو ينهار بسبب ضغط العمل؟

هنا يأتي دور TabTreeFormer، وهو نوع جديد من الروبوتات المصممة خصيصاً لإتقان فن نسخ جداول البيانات. أدرك الباحثون وراء ابتكاره أن أفضل طريقة لفهم جدول البيانات ليست باستخدام روبوت "قارئ نصوص" قياسي، بل باستعارة خدعة من نوع آخر من الآلات: "شجرة القرار". يمكنك التفكير في شجرة القرار كأنها لعبة "20 سؤالاً". لمعرفة نوع حيوان ما، تسأل: "هل لديه فراء؟" إذا كانت الإجابة نعم، "هل ينبح؟" وإذا كانت لا، "هل يموء؟" هذا المسار الذي يعتمد على خطوات "نعم أو لا" مثالي للتعامل مع القفزات المفاجئة والقواعد المحددة الموجودة في البيانات الحقيقية.

قام الفريق ببناء TabTreeFormer عبر دمج منطق "الـ 20 سؤالاً" هذا مع روبوت قوي لتعلم اللغة (يسمى "ترانسفورمر" أو Transformer). وقد منحوا الروبوت "مترجماً" خاصاً (tokenizer) يحول الأرقام الفوضوية إلى كود بسيط. وبدلاً من محاولة تذكر كل فاصلة عشرية لرقم مثل 3.14159، يقوم المترجم بتجميعها في مجموعات (مثل "صغير"، "متوسط"، "كبير") ثم يضيف علامة دقيقة للحصول على القيمة الفعلية. هذا يجعل البيانات أصغر بكثير وأسهل في استيعابها من قبل الروبوت، مع الحفاظ في الوقت نفسه على التفاصيل المهمة.

النتائج مبهرة. فعند اختباره على تسعة أنواع مختلفة من مجموعات البيانات الواقعية، نجح TabTreeFormer باستمرار في إنشاء بيانات مزيفة كانت أكثر فائدة لتدريب نماذج الذكاء الاصطناعي الأخرى من البيانات التي صنعتها ثماني طرق رائدة أخرى. وفي السيناريوهات التي كان الهدف فيها هو الحصول على أفضل جودة بيانات ممكنة (ولم تكن الخصوصية هي الهم الرئيسي)، حسّن النسخة الأفضل من TabTreeFormer الأداء بنسبة 44% مقارنة بأقرب منافسيه. كما تمكن من القيام بذلك باستخدام حجم نموذج أصغر بكثير وتوليد بيانات بشكل أسرع من العديد من الروبوتات الضخمة التي واجهها.

ومع ذلك، يحرص البحث على ملاحظة أن هذا ليس عصا سحرية تحل كل شيء. فقد وجد الباحثون أنه إذا قمت بإيقاف تشغيل ضمانات الخصوصية للحصول على أفضل جودة ممكنة، فقد يصبح الروبوت بارعاً جداً في عمله لدرجة حفظ البيانات الحقيقية بدقة شديدة. لقد أظهروا أن هناك مقايضة: كلما حاولت حماية الخصوصية أكثر، كانت البيانات أقل كمالاً، والعكس صحيح. ولكن بشكل عام، يشير TabTreeFormer إلى أنه من خلال دمج أسلوب "شجرة القرار" (الـ 20 سؤالاً) مع نماذج اللغة الحديثة، يمكننا بناء طريقة أفضل وأسرع وأكثر دقة لإنشاء البيانات المزيفة التي تشغل مستقبل الذكاء الاصطناعي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →