Fairness Pruning: Locating Demographic Bias in GLU-MLP Layers via Differential Activations
यह शोध पत्र "फेयरनेस प्रूनिंग" (Fairness Pruning) प्रस्तुत करता है, जो एक हल्का संरचनात्मक हस्तक्षेप है जो LLMs में जनसांख्यिकीय पूर्वाग्रह को स्थानीयकृत करने के लिए GLU-MLP परतों में विशिष्ट न्यूरॉन्स की पहचान करता है और उन्हें शून्य करता है, यह प्रदर्शित करते हुए कि इस तरह के सर्जिकल संशोधन मॉडल की तर्क और ज्ञान क्षमताओं के 99% से अधिक को संरक्षित करते हुए पूर्वाग्रह प्रतिक्रियाओं को महत्वपूर्ण रूप से बदल सकते हैं।