GAICo: A Deployed and Extensible Framework for Evaluating Diverse and Multimodal Generative AI Outputs
إنّ GAICo هو إطار عمل مفتوح المصدر بلغة بايثون، مُنشر ومُفعّل، يعمل على توحيد وتسهيل عملية تقييم مخرجات الذكاء الاصطناً التوليدي المتنوعة ومتعددة الوسائط من خلال مجموعة موحدة وقابلة للتوسيع من المقاييس، وأدوات التصور، وإمكانيات إعداد التقارير لتعزيز قابلية التكرار وموثوقية النظام.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك رئيس طهاة في مطبخ ضخم فائق التقنية. لقد وظفت فريقًا من الطهاة الآليين (الذكاء الاصطناعي التوليدي) لابتكار وجبات معقدة لزبائنك. بعض الطهاة بارعون في كتابة الوصفات (النصوص)، وبعضهم مذهلون في تزيين الأطبى (الصور)، وآخرون خبراء في تسجيل أصوات طقطقة الطهي (الصوت).
المشكلة هي أنه حتى الآن، لم تكن هناك طريقة واحدة لتذوق كل هذه الأطباق المختلفة في وقت واحد. إذا كانت الوجبة سيئة، فلن تعرف ما إذا كان كاتب الوصفة قد أخطأ في التعليمات، أم أن فنان التزيين قد أسقط الطعام، أم أن مهندس الصوت سجل الكثير من الضجيج. كان المطورون عالقين في كتابة "سكربتات تذوق" خاصة وغير منظمة لكل طبق على حدة، مما جعل من المستحيل مقارنة من هو الطاهي الأفضل حقًا.
إليك GAICo: ناقد الطعام العالمي.
تقدم هذه الورقة البحثية GAICo (مقارن الذكاء الاصطناعي التوليدي)، وهي أداة جديدة مفتوحة المصدر تعمل كناقد طعام ذكي ومعياري للذكاء الاصطناعي. إليك كيف تعمل، مقسمة إلى مفاهيم بسيطة:
1. المشكلة: "برج بابل" لاختبار الذكاء الاصطناعي
قبل GAICo، إذا أردت اختبار ذكاء اصطناعي يكتب خطة سفر، ويرسم خريطة، ويسجل دليلًا صوتيًا، كان عليك استخدام ثلاث أدوات مختلفة تمامًا.
- لفحص النص، كنت تستخدم "مسطرة نصية".
- لفحص الخريطة، كنت تستخدم "مسطرة بكسلية".
- لفحص الصوت، كنت تستخدم "مقياس صوت".
كان الأمر يشبه محاولة قياس ارتفاع كعكة بشريط قياس، ووزنها بمسطرة، ومذاقها بميزان. كان الأمر مربكًا، وبطيئًا، ولم يكن بإمكانك القول بسهولة: "طاهي النصوص رائع، لكن طاهي الصوت يحتاج إلى تدريب".
2. الحل: "قائمة تذوق" عالمية
GAIC o هو مجموعة أدوات موحدة (مكتبة بايثون) تتحدث جميع اللغات. سواء كان مخرج الذكاء الاصطناعي عبارة عن فقرة نصية، أو قائمة خطوات (مثل خطة سفر)، أو توقعات لأسعار الأسهم (سلاسل زمنية)، أو صورة، أو أغنية، فإن GAICo لديه "مسطرة" محددة لكل منها.
- الـ "BaseMetric" (الشوكة العالمية): تخيل شوكة يمكنها أكل الحساء، والستيك، والآيس كريم. يحتوي GAICo على تصميم أساسي يسمح لك بتوصيل أي طريقة جديدة لقياس الجودة. إذا ابتكرت طريقة جديدة لتقييم الفن الناتج عن الذكاء الاصطناعي غدًا، يمكنك ببساطة "تركيبها" في GAICo، وستعمل فورًا.
- الـ "Experiment" (الناقد الرئيسي): هذا هو الجزء الأسهل. بدلًا من كتابة 50 سطرًا من الكود لاختبار 5 نماذج ذكاء اصطناعي مختلفة، ما عليك سوى إخبار "الناقد الرئيسي" (فئة Experiment): "إليك الأطباق من الطاهي أ، والطاهي ب، والطاهي ج. وهذا هو الطبق المثالي الذي نريد منهم محاكاته. اذهب وتذوقهم جميعًا وقدم لي تقريرًا."
- يقوم تلقائيًا بحساب الدرجات.
- يرسم مخططات جميلة (مثل المخططات الرادارية) حتى تتمكن من رؤية نقاط القوة والضعف.
- يخبرك ما إذا كان الطبق قد نجح أم فشل بناءً على قواعدك.
3. الاختبار الواقعي: "وكيل سفر الذكاء الاصطناعي"
لإثبات نجاحه، بنى المؤلفون نظام "وكيل سفر ذكاء اصطناعي" معقدًا. تخيل ثلاثة فرق مختلفة تحاول بناء رحلة لمدة 3 أيام إلى باريس:
- الفريق (أ) يستخدم أفضل الأدوات المتاحة.
- الفريق (ب) يستخدم أدوات مفتوحة المصدر.
- الفريق (ج) يستخدم أدوات جوجل.
كان على كل فريق إنتاج:
- خطة: مسار رحلة نصي (مثال: "زيارة برج إيفل في الساعة 2 ظهرًا").
- صورة: صورة لبرج إيفل.
- صوت: تسجيل صوتي يصف الرحلة.
بدون GAICo: كان المطورون سيقضون أسابيع في كتابة سكربتات منفصلة للتحقق مما إذا كان النص منطقيًا، وما إذا كانت الصور تبدو صحيحة، وما إذا كان الصوت واضحًا. كانوا سيضيعون في بحر من البيانات.
مع GAICo: قاموا بتشغيل النظام بالكامل عبر "الناقد الرئيسي" في دقائق.
- النتيجة: كشف GAICo سرًا! "كاتب الخطط" (الذكاء الاصطناعي النصي) لدى الفريق (ب) كان سيئًا للغاية في وضع الجداول الزمنية، لكن "فنان الصور" لديهم كان جيدًا في الواقع. أما الفريق (ج) فكان رائعًا في التخطيط، لكن "المؤدي الصوتي" لديهم بدا آليًا.
- الفائدة: لأن GA-ICo فصل بين درجة "الخطة" ودرجة "الصورة/الصوت"، عرف المطورون بالضبط من يجب فصله ومن يجب توظيفه. لم يضطروا للتخمين؛ فقد أخبرتهم البيانات بالضبط أين تكمن المشكلة.
4. لماذا يهم هذا: "التحرك بشكل أسرع وأكثر أمانًا"
فكر في تطوير الذكاء الاصطناعي مثل بناء سيارة.
- قبل GAICo: كنت تختبر المحرك، والمكابح، والراديو بثلاثة أشخاص مختلفين باستخدام ثلاث أدوات مختلفة. إذا تعطلت السيارة، فلن تعرف أي جزء قد فشل.
- مع GAICo: لديك محطة اختبار مؤتمتة واحدة تفحص المحرك، والمكابح، والراديو في آن واحد وتعطيك تقريرًا واضحًا وموحدًا.
هذا يسمح للشركات بـ:
- التحرك بشكل أسرع: لا يضيعون الوقت في كتابة اختبارات مخصصة. فقط قم بتوصيل نموذج الذكاء الاصطناعي الجديد الخاص بك واحصل على النتائج فورًا.
- التحرك بشكل أكثر أمانًا: يمكنهم اكتشاف سلوك الذكاء الاصطناعي السيئ مبكرًا. إذا بدأ الذكاء الاصطناعي في تقديم نصائح سفر سيئة أو إنشاء صور مسيئة، فإن GAICo يرصد الفشل المحدد قبل وصول المنتج إلى الجمهور.
الملخص
GAICo هو "السكين السويسري" لاختبار الذكاء الاصطناعي. إنه يأخذ المهمة الفوضوية والمربكة لمقارنة مخرجات الذكاء الاصطناعي (النصوص، الصور، الصوت، الخطط) ويحولها إلى عملية نظيفة ومعيارية وسهلة. يساعد المطورين على التوقف عن التخمين والبدء في معرفة مدى جودة ذكائهم الاصطناعي حقًا، مما يضمن أن أنظمة الذكاء الاصطناعي التي نبنيها موثوقة، عالية الجودة، وآمنة للاستخدام من قبل الجميع.
منذ إصداره، قام آلاف المطورين بتحميله، مما يثبت أن المجتمع كان يتوق تمامًا لهذا النوع من الأدوات لجعل انفجار الذكاء الاصطناعي أمرًا مفهومًا.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.