Poller: Are LLMs Suitable for Evaluating the Poetry Understanding Task?
यह शोध पत्र Poller को प्रस्तुत करता है, जो एक नवीन LLM-आधारित मूल्यांकन पद्धति है जो विशेष आयामों में चीनी कविता की समझ के आकलन में त्रुटियों को काफी कम करने के लिए कवि के दृष्टिकोण को अपनाती है, जो प्रभावी रूप से स्वचालित दक्षता और मानवीय विशेषज्ञता के बीच के अंतर को पाटती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास आधुनिक चीनी कविताओं का एक सुंदर, जटिल डिब्बा है। आप जानना चाहते हैं कि क्या एक कंप्यूटर (विशेष रूप से, एक लार्ज लैंग्वेज मॉडल या LLM) किसी और के स्पष्टीकरण को ग्रेड देने के लिए उन्हें अच्छी तरह से समझ सकता है।
समस्या: "विनम्र रोबोट" बनाम "असली कवि"
शोधकर्ताओं ने पाया कि मानक AI मॉडल इस काम के लिए बहुत खराब हैं। यह एक पेंटिंग का न्याय करने के लिए एक विनम्र, सुशिक्षित रोबोट से पूछने जैसा है। रोबोट रंगों और आकृतियों को तो देखता है, लेकिन वह कृति की आत्मा को मिस कर देता है।
पेपर के प्रयोगों में, जब AI ने कविता की समझ पर एक इंसान के स्पष्टीकरण को ग्रेड देने की कोशिश की, तो वह अत्यधिक उदार था। उसने 100 में से 90 या 95 का स्कोर दिया, भले ही इंसान का स्पष्टीकरण सतही था या उसने मुख्य बात मिस कर दी थी। AI मूल रूप से कह रहा था, "ओह, आपने बड़े शब्दों का उपयोग किया? यह बहुत अच्छा है! यह लीजिए A+!" इसमें वह गहरा, सांस्कृतिक और भावनात्मक संदर्भ नहीं था जो एक वास्तविक कवि के पास होता है।
समाधान: "पॉलर" (भूमिका निभाने वाली ट्रिक)
इसे ठीक करने के लिए, शोधकर्ताओं ने एक विधि विकसित की जिसे Poller (पोएट्री LLM इवैल्यूएटर) कहा गया।
इसे इस तरह सोचें: AI से एक सामान्य "शिक्षक" बनने के कहने के बजाय, वे AI से उस कविता के वास्तविक लेखक होने का नाटक करने के लिए कहते हैं।
वे इसे इस प्रकार करते हैं:
- वेशभूषा परिवर्तन: वे AI को वास्तविक कवि का एक "कैरेक्टर शीट" देते हैं। इसमें कवि की जीवनी, उनके व्यक्तिगत संघर्ष, कला के प्रति उनके विशिष्ट दृष्टिकोण और यहाँ तक कि उनके काम के बारे में प्रसिद्ध आलोचकों ने क्या कहा है, यह सब शामिल है।
- परिप्रेक्ष्य परिवर्तन: AI को बताया जाता है, "अब आप यह कवि हैं। आपने यह कविता लिखी है। अब, इस छात्र के अपने काम के स्पष्टीकरण को देखें। क्या यह उस बात को पकड़ पाता है जो आप कहना चाह रहे थे?"
- फैसला: कवि की भूमिका निभाकर, AI एक विनम्र रोबोट बनना बंद कर देता है और एक रचनाकार की तरह सोचना शुरू कर देता है। यह सूक्ष्म रूपकों, विशिष्ट लय और छिपी हुई भावनाओं को नोटिस करने लगता है जिन्हें एक सामान्य AI मिस कर देता।
परिणाम: "बहुत दयालु" से "बिल्कुल सटीक" तक
परिणाम नाटकीय थे।
- Poller से पहले: AI एक ऐसे दोस्त की तरह था जो कभी आपकी भावनाओं को ठेस नहीं पहुँचाना चाहता, और लगभग हर चीज़ को उच्च स्कोर दे रहा था। AI के ग्रेड और एक वास्तविक मानव विशेषज्ञ के ग्रेड के बीच का अंतर बहुत बड़ा था।
- Poller के बाद: AI एक सख्त, अंतर्दृष्टिपूर्ण आलोचक बन गया। जब इसने कवि की भूमिका निभाई, तो इसकी ग्रेडिंग काफी हद तक उस स्तर के करीब आ गई जो एक मानव विशेषज्ञ देता।
उदाहरण के लिए, जब अलंकारिक तकनीकों (वे शानदार तरकीबें जिनका कवि उपयोग करते हैं) या विजातीयता/डेफैमिलियराइजेशन (परिचित को अजीब बनाने के लिए बदलना ताकि आप सोचने पर मजबूर हों) को समझने के तरीके को परखते समय, AI की त्रुटियां लगभग 95% तक गिर गईं। यह बेहद गलत होने से लेकर लगभग एक मानव विशेषज्ञ के समान होने तक पहुँच गया।
मुख्य निष्कर्ष
पेपर यह निष्कर्ष निकालता है कि AI कविता का एक अच्छा निर्णायक हो सकता है, लेकिन केवल तभी जब आप उसे कवि की टोपी पहनने के लिए मजबूर करें। AI को कवि का विशिष्ट परिप्रेक्ष्य, पृष्ठभूमि और आत्मा अपनाने के लिए मजबूर करके, हम "तेज कंप्यूटर प्रोसेसिंग" और "गहरी मानवीय विशेषज्ञता" के बीच के अंतर को पाट देते हैं।
यह पेपर क्या नहीं कहता
- यह दावा नहीं करता कि यह विधि लेखन के सभी प्रकारों (जैसे समाचार लेख या कानूनी अनुबंध) के लिए काम करती है; इसे विशेष रूप से आधुनिक चीनी कविता पर परीक्षण किया गया है।
- यह यह भी नहीं कहता कि यह पूरी तरह से मानव कवियों या आलोचकों की जगह लेगा; यह केवल कविता समझने के कार्यों को स्वचालित रूप से ग्रेड करने का एक बेहतर तरीका प्रदान करता है।
- यह दावा नहीं करता कि AI वास्तव में भावनाओं को महसूस करता है; यह केवल कवि के परिप्रेक्ष्य का इतनी अच्छी तरह से अनुकरण करता है कि ग्रेडिंग सटीक हो जाती है।
संक्षेप में: कविता को समझने के लिए कंप्यूटर को मजबूर करना है, तो आपको उसे कवि होने का नाटक करने के लिए मजबूर करना होगा। एक बार जब वह ऐसा करता है, तो वह आखिरकार बात समझ जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।