UpstreamQA: A Modular Framework for Explicit Reasoning on Video Question Answering Tasks
UpstreamQA एक मॉड्यूलर फ्रेमवर्क है जो बड़े रीजनिंग मॉडल्स का उपयोग करके स्पष्ट मध्यवर्ती चरण—जैसे कि वस्तु पहचान और दृश्य संदर्भ—जनरेट करता है ताकि डाउनस्ट्रीम मल्टीमॉडल मॉडल्स की व्याख्यात्मकता और मल्टी-हॉप रीजनिंग क्षमताओं को बेहतर बनाया जा सके, जिससे वीडियो क्वेश्चन अनस्वर्सिंग में सुधार होता है।