Towards Visually Grounded Multimodal Summarization via Cross-Modal Transformer and Gated Attention
यह शोध पत्र SPeCTrA-Sum प्रस्तुत करता है, जो एक एकीकृत मल्टीमॉडल सारांशीकरण ढांचा (unified multimodal summarization framework) है जो अधिक सटीक और अर्थपूर्ण रूप से सुसंगत सारांश उत्पन्न करने के लिए पदानुक्रमित क्रॉस-मोडल संरेखण (hierarchical cross-modal alignment) हेतु एक डीप विजुअल प्रोसेसर और सिद्धांत-आधारित छवि चयन (principled image selection) के लिए एक विजुअल रिलेवेंस प्रेडिक्टर का उपयोग करता है।