Pretraining Data Can Be Poisoned through Computational Propaganda
यह शोध पत्र प्रदर्शित करता है कि सार्वजनिक चर्चा इंटरफेस के माध्यम से भाषा मॉडलों के लिए बड़े पैमाने पर प्रीट्रेनिंग डेटा को विषाक्त किया जा सकता है और "HalfLife" का परिचय देता है, जो वेब क्रॉलिंग और क्यूरेशन के बाद ऐसे प्रतिकूल कंटेंट के समावेश का अनुमान लगाने के लिए एक नवीन विश्लेषण पद्धति है।