StructEval: Benchmarking LLMs' Capabilities to Generate Structural Outputs
يقدم البحث StructEval، وهو معيار شامل يضم 18 تنسيقاً و44 نوعاً من المهام التي تقيم قدرة النماذج اللغوية الكبيرة على توليد وتحويل المخرجات المهيكلة غير القابلة للعرض والقابلة للعرض على حد سواء، مما يكشف عن فجوات كبيرة في الأداء حيث تعاني حتى النماذج الأكثر تطوراً من دقة الهيكلية، لا سيما في مهام التوليد والمحتوى المرئي.