Measuring and Mitigating Toxicity in Large Language Models: A Comprehensive Replication Study
تقيم هذه الدراسة التكرارية الشاملة تقنية التخفيف أثناء وقت الاستدلال "DExperts"، لتجد أنه في حين تحقق سلامة شبه مثالية ضد السمية الصريحة، إلا أنها تظل هشة أمام خطاب الكراهية الضمني وتتسبب في عقوبة زمن استجابة باهظة تصل إلى عشرة أضعاف، مما يسلط الضوء على فجوات حرجة في المتانة والكفاءة من أجل نشر سلامة الذكاء الاصطناعي في العالم الحقيقي.