Distilling Answer Set Programming Theories from Large Language Models
تبحث هذه الورقة في قدرة النماذج اللغوية الكبيرة على استخلاص نظريات برمجة مجموعات الإجابات (Answer Set Programming) كاملة وصحيحة بشكل مستقل لمهام الإجابة على الأسئلة البصرية ضمن حد زمني قدره ساعة واحدة، حيث أظهرت النماذج الرائدة مثل Claude Sonnet 4.6 وClaude Opus 4.7 وDeepSeek V4 Pro دقة تقارب المثالية في عدة معايير مرجعية، بينما أظهر GPT-5 تباينًا كبيرًا في الأداء وحساسية تجاه البيانات المرجعية.