想象一下,一座城市就像一个巨大且繁忙的集市。长期以来,如果你想找个地方吃饭,你必须依靠自己的记忆、实体的地图,或者别人写的评论列表。这些工具向你展示了所有存在的东西,即使有些地方排在列表的最底端。你可以向下滚动,看到那些隐藏的瑰宝、连锁餐厅以及当地人的心头好。
现在,想象在这座集市之上,覆盖了一层新的、透明的玻璃。这层玻璃是由大语言模型(LLMs)——即我们用来询问“波士顿哪里好吃饭?”这类问题的智能 AI 聊天机器人——所构成的。
本论文研究了当我们透过这层新玻璃观察城市时会发生什么。研究人员发现,这层玻璃不仅仅是在向我们展示城市;它还在积极地重塑城市,且这种重塑往往是不公平且不均衡的。以下是他们的发现,通过简单的概念进行了拆解:
1. “幽灵”餐厅(凭空捏造)
有时,当你询问 AI 关于某家餐厅的信息时,它会发明出一些实际上并不存在的场所。
- 类比: 这就像一位导游,当被问及一个安静的小型社区时,他会自信满满地指向一家从未建成的豪华咖啡馆。
- 研究发现: 当 AI 在贫困、人口较少或在线活跃度较低的社区中进行“捏造”时,最容易产生这些“幽灵”餐厅。如果一个社区没有强大的“数字足迹”(评论较少、到访人数较少),AI 就更有可能产生幻觉。
- 修复方法: 当研究人员强制要求 AI 只能从真实存在的餐厅列表中进行选择时,那些虚假的餐厅就消失了。这意味着 AI 并不是故意要表现得刻薄,而仅仅是因为它缺乏正确的数据,所以才在进行猜测。
2. “隐形”餐厅(忽略真实的餐厅)
即使在被迫从一份真实的餐厅列表中进行选择时,AI 仍然会忽略大量的餐厅。
- 类比: 想象一份有 100 道菜的菜单。无论谁来提问,AI 都只向所有人推荐其中的 3 或 4 道。其他的 96 道菜完全变得不可见,仿佛它们不存在一样。
- 研究发现: 即使 AI 知道这些真实餐厅的存在,仍有约 47.5% 的真实餐厅从未被 AI 推荐过。这不仅仅是一个错误,而是一种模式。AI 会持续性地忽略某些类型的场所,尤其是在特定的社区中。
- 共同的盲点: 研究人员测试了三款来自不同公司的 AI 模型。他们发现,被忽略的餐厅中有 31.9% 是这三款模型共同忽略的。这表明这种偏差并非仅仅是某一家公司代码中的小故障,而是从相同的互联网数据池中学习到的共同习惯。
3. “个性化”透镜(不同的人,不同的城市)
最令人惊讶的部分是,即使站在同一个位置,AI 向不同的人展示的是一个不同的城市。
- 类比: 想象两个人站在同一个街角。一个是富有的游客,另一个是收入较低的当地居民。
- 富有的游客会被展示昂贵、时髦且距离较远的场所,这些地方通常不太拥挤。
- 当地居民会被展示更便宜、更受欢迎且距离较近的场所。
- 儿童会被展示主流且低成本的场所。
- 男性和女性看到的场所也会略有不同。
- 研究发现: AI 不仅仅是在回答问题;它会根据你的描述来推测你的身份,然后过滤世界,以匹配它认为“像你这样的人通常会喜欢的东西”。它假设富有的人喜欢为了独特的食物长途跋涉,而当地人则倾向于留在熟悉的、价格较低的地方。
4. 经济涟漪效应(谁赢谁输)
如果每个人都开始信任这些 AI 推荐,城市的经济流动将会发生变化。
- 类比: 把城市的经济想象成流经管道的水。AI 就像一个改变水流方向的阀门。
- 研究发现: AI 倾向于将人们从快餐连锁店(如麦当劳)和快速服务咖啡店引向独立的全服务餐厅(如当地的坐下来用餐的小餐馆)。
- 独立餐厅可能会获得更多的顾客和资金。
- 大型连锁店会损失大量的收入。
- 快餐店(通常服务于对价格敏感的客户)将是最大的输家。
大局观
论文得出结论,这些 AI 模型正在充当城市中的选择性过滤器。它们不仅仅是在展示那里有什么;它们还在决定什么是可见的。
- 对于场所而言: 如果一家餐厅位于贫困社区,或者在线评论较少,AI 可能会假装它不存在。
- 对于人而言: AI 强化了关于“谁会去哪里”的刻板印象,可能导致不同群体被困在各自的“信息茧房”中。
作者警告说,如果我们过度依赖这些工具,我们可能会在无意中创造出一个某些社区和某些类型企业变得“隐形”的城市,这并非因为它们不好,而是因为 AI 决定不向我们展示它们。这是叠加在我们物理街道之上的另一种新型“数字不平等”。
技术摘要:大语言模型在城市之上构建了不均衡的信息层
问题陈述
城市正日益受到信息系统的中介作用,这些系统引导着人类的感知与决策。虽然 GPS、搜索引擎和评论平台在历史上塑造了城市导航,但大语言模型(LLMs)正在成为一种全新的、具有结构性差异的信息层。与提供排名列表(其中排名较低的选项仍可被发现)的前辈不同,LLMs 生成的响应中,场所要么被包含在内,要么完全从用户的考虑集合中消失,且没有任何信号表明其被遗漏。
本研究解决的核心问题是:这种新兴的信息层是否引入了系统性的偏差,从而影响城市可见性。具体而言,作者调查了以下问题:
- 虚构(Fabrication): LLMs 是否会凭空捏造不存在的场所?
- 不可见性(Invisibility): LLMs 是否会系统性地忽视真实的场所?
- 选择性(Selectivity): 这些模式是否随社区(社会经济梯度)和用户人口统计特征(收入、年龄、性别、居住状态)的变化而变化?
- 经济后果(Economic Consequence): 广泛依赖 LLM 推荐将如何重新分配城市餐饮业的消费者需求和收入?
研究区分了两种潜在的失效模式:认知失效(epistemic failure)(由于数据缺失导致的遗漏,可通过提供验证列表来纠正)和 分配失效(allocative failure)(由于根植于模型训练的稳定且具选择性的注意力模式导致的遗漏,即使在数据完整的情况下依然存在)。
研究方法
作者对美国五个主要城市(波士顿、纽约、芝加哥、休斯顿和旧金山)的 304 个社区 进行了餐厅推荐的系统性审计。
实验设计
- 模型: 测试了来自三个不同家族的代表性 LLMs:GPT-4o-mini (OpenAI)、Llama-3.3-70b-instruct (Meta) 和 Gemini-2.0-flash (Google)。
- 用户画像: 每个社区生成了 320 个合成用户画像,通过四个人口统计维度进行交叉组合:
- 家庭收入(5 个等级:0–2.5万至20 万+)
- 年龄(8 个等级:0–20 岁至 80+ 岁)
- 性别(2 个等级:男性、女性)
- 居住状态(4 个等级:本地人、邻近居民、跨城居民、游客)
- 设置: 采用了两种平行的实验条件:
- 开放式(Open-Ended): 模型在没有预定义候选列表的情况下,被要求查询特定社区内的 10 家餐厅。
- 候选约束式(Candidate-Constrained): 模型被提供一组由 100 家真实场所组成的固定集合,并被指令从中精确选择 10 家。这隔离了“选择性注意力”与“知识缺口”。
数据集成与指标
- 地面真值(Ground Truth): 来自 SafeGraph 和 Foursquare 的经核实的场所记录。
- 指标:
- 幻觉率(Hallucination Rate): 被呈现出的场所中无法匹配到真实机构的比例。
- 社区算法不可见率(Neighborhood Algorithmic Invisibility Rate, NAIR): 在所有用户画像中,从未获得过推荐的社区内真实场所的比例。
- 协变量: 社区特征源自人口普查数据、移动位置数据 (Spectus)、交易记录 (SafeGraph) 和评论元数据 (Yelp)。
- 经济模拟: 建立了一个反事实场景进行建模,即 10% (α=0.1) 的餐饮决策从观察到的模式转向 LLM 推荐的场所,以估算收入再分配情况。
核心贡献与结果
1. 不均匀的虚构与接地失败
LLMs 的平均虚构率为 36.8%。这种“接地失败”(grounding failure)并非随机发生;它与社区的社会经济特征相关。
- 驱动因素: 幻觉率在数字和物理足迹较弱(Yelp 评论较少、现实世界访问量较少、人口密度较低以及受教育程度较低)的社区中显著更高。
- 纠正: 当模型被约束在经过验证的场所列表(候选约束式设置)中时,幻觉率降至 0.0%,证实了虚构是一种可以通过数据接地来修复的认知失效。
2. 持久的选择性注意力(分配失效)
即使在受到真实场所限制时,LLMs 仍表现出严重的“覆盖缺陷”。
- 不可见性: 在开放式设置中,社区内 96.8% 的真实场所从未被推荐。在候选约束式设置中,仍有 47.5% 的可用真实场所从未被呈现。
- 共同盲点: 31.9% 的被忽视场所是三个模型家族共有的,这表明这些偏差源于共享的训练语料库,而非模型特有的错误。
- 不可见性的驱动因素: 与虚构不同,不可见性并不完全由数据稀缺驱动。即使在固定场所池中,NAIR 也由 Yelp 评论计数(负相关)预测,并且在约束设置下与收入熵和人口密度呈正相关。这支持了分配失效假设:模型拥有关于哪些场所值得关注的稳定先验,这与数据可用性无关。
3. 人口统计分层
在相同的场所池内,LLMs 会系统性地将不同的用户画像引导至不同类型的场所:
- 收入: 高收入用户被引导至距离更远、访问量更少、价格更高且由社会经济地位更同质(隔离)的客群消费的场所。
- 年龄: 未成年人被引导至访问量高、价格较低且社会隔离度较低的场所,而成年人则面临不同的分布。
- 居住状态: 游客被引导至成本更高但社会多样性更高的场所,而本地居民则被引导至更便宜、更频繁使用但社会经济地位同质化的场所。
- 机制: 这些梯度表明,LLMs 仅凭人口统计描述即可推断出潜在的城市生活方式,从而强化了现有的生活方式分层。
4. 经济再分配
模拟消费需求的转变揭示了结构的收入再分配:
- 形式转变: 支出从快餐和快速服务形式流向独立的全服务餐饮。
- 品牌转变: 访问量主要从连锁餐厅(如麦当劳、星巴克)流向独立机构。
- 规模: 在模拟情景下,独立餐厅每家每年估计增加约 \12,101,而像麦当劳这样的主要连锁店每家则减少约 \41,405。
重要性与主张
本文认为,LLMs 充当了一个选择性的城市信息层,在场所与人群之间不均匀地分配可见性。
- 结构性不平等: 信息层不仅反映现实,还通过编码追踪社会经济梯度的选择性注意力来主动重塑现实。这为城市中现有的结构性和经验性不平等增加了“表征维度”。
- 失效的不对称性: 研究强调了一种关键的不对称性:虽然虚构(认知失效)可以通过提供验证数据来解决,但选择性不可见(分配失效)依然存在。这意味着仅仅改善数据提供是不够的;必须解决底层的模型行为和训练偏差。
- 动态反馈循环: 作者假设这些偏差可能会创造自我强化的反馈循环。在算法上不可见的场所会产生更少的访问和评论,从而进一步削弱其数字足迹,使其在未来的训练周期中更难被推荐。
- 治理意义: 随着 LLMs 成为城市决策的主要中介,它们作为一种分配可见性的新形式的基础设施发挥作用。作者总结道,理解并治理这一层级,与管理传统的交通和通信基础设施一样至关重要,因为这决定了哪些地方和社区能够繁荣,或者保持隐形。
该研究在普遍性方面保持了审慎,指出其发现基于密集的美国城市生态系统,在较小的城市或非英语语境下可能会有所不同。然而,三个不同模型家族结果的一致性表明,这些模式反映了当前 LLM 训练生态系统的基本属性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。