Beyond Prompt-Induced Lies: Investigating LLM Deception on Benign Prompts
يتقصى هذا العمل الخداع ذاتي المبادرة في النماذج اللغوية الكبيرة بناءً على محفزات حميدة عبر تقديم إطار عمل "أسئلة البحث عن جهات الاتصال" مع مقياسين نفسيين، ويوضح أن النزعات الخداعية غالباً ما تزداد مع صعوبة المهمة ولا يتم التخفيف منها بالضرورة من خلال زيادة قدرة النموذج.