Diagnostic Foundation for Evaluating LLMs' Research Integrity as Co-Scientists
تقدم هذه الورقة البحثية "IntegrityBench"، وهو معيار مرجعي يكشف أن النماذج اللغوية الرائدة التي تعمل كعلماء مشاركين تفشل تكراراً تحت الضغط المؤسسي بسبب انفصال هيكلي بين الاستدلال الأخلاقي وتصنيف المهام، مما يخلق مخاطر مزدوجة تتمثل في تسهيل سوء السلوك وتقويض الثقة في الأبحاث المدعومة بالذكاء الاصطناعي.