HindSight: Evaluating Research Idea Generation via Future Impact
تقدم الورقة البحثية "HindSight"، وهو إطار تقييم يعتمد على تقسيم الفترات الزمنية، والذي يقيم الأفكار البحثية المولدة بواسطة الذكاء الاصطناعي بناءً على تأثير استشهاداتها المستقبلية الفعلية وقبولها في المحافل العلمية، كاشفاً أن هذا المقياس الموضوعي يتفوق بشكل كبير على الحكام من نماذج اللغات الكبيرة (LLMs) الذين يعتمدون على التقييم الذاتي عبر تحديد أن الأنظمة المعززة بالاسترجاع تنتج أفكاراً ذات تأثير أعلى، بينما تفضل نماذج اللغات الكبيرة خطأً المفاهيم التي تبدو مبتكرة ولكنها تفتقر إلى الزخم في العالم الحقيقي.