Bee: A High-Quality Corpus and Full-Stack Suite to Unlock Advanced Fully Open MLLMs
यह शोध पत्र Honey-Data-15M को प्रस्तुत करता है, जो दोहरे-स्तरीय चेन-ऑफ-थॉट (Chain-of-Thought) संवर्धन के साथ एक उच्च-गुणवत्ता वाला 15-मिलियन-पेयर डेटासेट है, साथ ही HoneyPipe क्यूरेशन पाइपलाइन और Bee-8B मॉडल भी, जो सामूहिक रूप से यह प्रदर्शित करते हैं कि सिद्धांतपूर्ण डेटा गुणवत्ता सुधार पूरी तरह से ओपन मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को सेमी-ओपन समकक्षों के प्रतिस्पर्धी स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करने में सक्षम बना सकते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।