Computational Hermeneutics: Evaluating generative AI as a cultural technology
本文提出“计算诠释学”框架,主张将生成式人工智能视为“语境机器”,通过强调情境性、多元性和模糊性三大诠释挑战,推动评估范式从单纯衡量准确性的标准化测试转向关注意义生成的迭代式、以人为本且重视文化语境的评估体系。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是在给现在的生成式人工智能(GenAI,比如 ChatGPT、Midjourney 等) 做一场“体检”,但医生换了一副眼镜——他们不再用理工科的“尺子”去量,而是换上了人文学科的“显微镜”。
简单来说,这篇文章的核心观点是:别把 AI 当成只会做题的机器,它其实是一个“文化翻译官”和“意义制造机”。要评价它好不好,不能只看它答案对不对,而要看它懂不懂“语境”、能不能包容“不同观点”、以及如何处理“模棱两可”。
下面我用几个生活中的比喻来拆解这篇论文:
1. 现状:我们以前怎么“考”AI?(把文化当调料)
以前,我们评价 AI 就像考数学题。
- 做法:出题(比如“计算 1+1"或“翻译这句话”),然后看 AI 给的答案是不是标准答案(对就是 100 分,错就是 0 分)。
- 问题:作者说,现在的 AI 不仅仅是做数学题,它更像是在写小说、画画、聊天、甚至当朋友。
- 比喻:这就好比你去评价一位厨师。以前我们只问他:“这道菜盐放了多少克?”(这是变量,可以测量)。但现在,我们更关心的是:“这道菜在春节吃合不合适?”“这道菜能不能让不同口味的人都能接受?”
- 现状的误区:现在的评估体系往往把“文化”当成一道调料(比如“加点偏见修正剂”),觉得它是可以随意加减的。但作者认为,文化是食材本身,是这道菜能不能吃的根本。
2. 新视角:AI 是“语境机器”(Context Machines)
作者提出,AI 本质上是一个**“语境机器”**。
- 比喻:想象 AI 是一个超级导游。
- 如果你问它“今天天气怎么样”,它不需要查全球天气,它只需要看你在哪里、什么时候问的,就能给出最合适的回答。
- 但是,现在的评估方法往往假设导游应该有一个“上帝视角”,能说出全世界通用的真理。
- 作者说:没有“上帝视角”!所有的意义都是在特定的情境(Situatedness)下产生的。就像同一句“你吃了吗”,在早上是问候,在深夜可能是关心,在吵架时可能是讽刺。AI 必须理解这种情境,而不仅仅是字面意思。
3. AI 面临的三个“人文挑战”
作者认为,要评价 AI,必须看它能不能处理好三个难题:
A. 情境性 (Situatedness):没有“万能视角”
- 比喻:就像看同一部电影。
- 19 世纪的人看《哈克贝利·费恩》,觉得是冒险故事;21 世纪的人看,可能会关注其中的种族问题。
- AI 的挑战:AI 不能假装自己站在“上帝视角”说“这就是真理”。它必须承认自己是在特定的角度说话。好的 AI 应该能告诉你:“我是基于什么背景给出的这个建议”,而不是假装全知全能。
B. 多元性 (Plurality):萝卜青菜,各有所爱
- 比喻:就像投票。
- 在一种文化里,某种艺术形式是“神作”;在另一种文化里,可能被认为是“冒犯”。
- AI 的挑战:以前我们总想找“标准答案”(比如:这句话是褒义还是贬义?)。但在文化领域,没有唯一的标准答案。好的 AI 评估不应该问“它是不是对的”,而应该问“在这个特定的文化圈子里,它是不是合适的”。它要能容纳“一千个读者眼中有一千个哈姆雷特”。
C. 模糊性 (Ambiguity):留白才是艺术
- 比喻:就像读诗或猜谜语。
- 如果一首诗把所有意思都解释得清清楚楚,那它就不叫诗了,叫说明书。
- AI 的挑战:现在的 AI 太喜欢“消除歧义”了(比如把“苹果”强行定义为水果,而不是手机)。但在艺术和对话中,模糊性才是产生意义的地方。好的 AI 评估不应该看它是否消除了所有歧义,而要看它是否优雅地处理了模糊性,让对话或作品更有回味。
4. 未来的评估方法:三个新原则
既然旧方法(做选择题)行不通了,作者提出了三个新原则,就像给 AI 考试换了新题型:
从“一次性考试”变成“长期对话” (Iterative)
- 旧方法:问一个问题,给一个分。
- 新方法:像谈恋爱或写小说一样。要看 AI 在连续多轮的对话中,能不能跟上节奏,能不能根据上下文调整自己的理解。就像你不能只凭一句话就评价一个人,要看他长期的表现。
从“机器考机器”变成“人机共创” (Include People)
- 旧方法:用另一台 AI 来给这台 AI 打分。
- 新方法:必须让人参与进来。因为文化是人与人互动的产物。评估 AI 写诗好不好,不能只靠算法,得看人读了之后有什么感受,看人机和 AI 是怎么合作产生意义的。
从“只看答案”变成“看背景” (Measure Context)
- 旧方法:只看 AI 输出的那行字对不对。
- 新方法:要看在什么场景下说的。比如,AI 给医生看病建议,和给小朋友讲故事,标准完全不同。评估必须把文化背景算进去,而不是把背景当成干扰项去掉。
总结
这篇论文其实是在呼吁:别再用考数学题的方式去考 AI 的文化能力了。
生成式 AI 不应该只是一个“答案生成器”,它应该成为一个**“意义合伙人”**。我们要评价它,不是看它能不能背出标准答案,而是看它能不能在复杂的人类文化世界里,懂分寸、知进退、容差异,像一个真正有文化素养的伙伴一样,和我们共同创造意义。
这就好比,我们不再问 AI:“这道题的正确答案是什么?”
而是问 AI:“在这个特定的故事里,在这个特定的时刻,什么样的回答最能打动人心?”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。