FreeRet: MLLMs as Training-Free Retrievers
FreeRet 是一个无需训练、即插即用的框架,它利用现成的多模态大语言模型(MLLMs)作为强大的两阶段检索器,通过为候选搜索生成语义嵌入并利用其固有的推理能力进行精确重排序,从而在不需额外微调的情况下超越经过大量训练的模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位博学多才的图书管理员,他读过数百万本书,见过无数张图片。这位管理员极其聪明,能理解复杂的故事,甚至能创作新故事。然而,传统上,如果你想让这位管理员充当搜索引擎(根据查询查找特定项目),就必须让他经历数年艰苦且昂贵的再训练。你不得不迫使他死记硬背特定的“搜索规则”,并忽略他自然具备的“对话”和“思考”能力。
论文FreeRet提出了一个简单的问题:如果我们根本不需要重新训练这位管理员呢?如果我们只需利用他现有的脑力来执行搜索任务呢?
以下是他们如何实现这一点的解释,分为三个简单步骤:
1. “最终过滤器”问题(跳过词汇化层)
类比:想象这位管理员试图总结一本复杂的书。他完全理解了深层含义。但是,在他开口说话之前,必须将他的思想通过一个“翻译器”,该翻译器强迫他只能使用简单、常见的词汇(如“猫”、“跑”、“快乐”)来匹配字典。这个翻译器对说话很有用,但却破坏了书中深刻而微妙的含义。
解决方案:论文发现,人工智能大脑的最后部分(“最终 MLP 层”)就像这个翻译器。它迫使人工智能专注于简单的词语匹配,而非深层含义。
- FreeRet 的窍门:他们简单地让人工智能跳过这个最终的翻译器。他们在思想被强制转化为简单词汇之前,直接提取“思想”。这为他们提供了更丰富、更准确的图像或文本“摘要”,从而在不修改一行代码的情况下,使初步搜索变得更加智能。
2. “模糊摘要”问题(受控生成)
类比:如果你问一个聪明人:“用一句话总结这张图片”,他可能会说“东西”或“玩意儿”。这在技术上是一个词,但对于稍后找到正确的图片毫无用处。或者,他可能会说“生长”(关注了图片中错误的部分)。
解决方案:论文意识到,仅仅要求“一个词”过于宽松。
- FreeRet 的窍门:他们在人工智能开口前,给它一套严格的指令(即“提示”)。他们说道:“观察图片和文本。捕捉主要含义。不要使用像‘的’或‘是’这样的小词。专注于主题。"
- 通过给出这些具体规则,人工智能生成的“一个词”摘要更加精确,实际上有助于找到正确的匹配项。
3. “框架效应”问题(重排序技巧)
类比:想象你是一位法官,正在判定嫌疑人是否有罪。
- 如果你问:“嫌疑人是对还是错?”你可能会感到一种道德压力,倾向于回答“对”,因为这听起来像是一种道德判断。
- 如果你问:“嫌疑人的陈述是真还是假?”你可能会感到更加中立。
- 论文发现,人工智能的回答会根据你提问的方式而改变,即使含义相同。这被称为“框架效应”。
解决方案:论文发现,简单地让人工智能回答“是”或“否”会引入偏差。
- FreeRet 的窍门:他们将问题转化为多项选择题(MCQ)。与其问“它相关吗?”,不如问:“候选项是否匹配查询?A. 是的,它匹配。B. 不,它不匹配。"
- 这种格式是人工智能在训练数据中见过数百万次的。它使人工智能表现得像一位中立的法官,忽略“是”或“错”等词语的情感重量,从而得出更准确的最终结果。
结果:即插即用的超级搜索引擎
论文在名为MMEB的庞大基准测试上对此进行了测试(该测试包含 36 种不同类型的搜索任务,从查找图片到回答视频问题)。
- 令人惊讶的是:他们的方法FreeRet,使用零训练数据且零额外成本,击败了基于数百万个示例进行训练的模型。
- 益处:由于他们没有重新训练模型,人工智能保留了所有原有的超能力。它仍然可以聊天、写故事,并对复杂主题进行推理。你不必在“搜索机器人”和“智能助手”之间做出选择;FreeRet 让同一个模型完美地同时完成这两项工作。
简而言之:FreeRet 表明,我们不需要强迫智能人工智能模型学习如何搜索。我们只需要向他们提出正确的问题,并让他们利用现有的、经过预训练的脑力来完成任务。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。