← 最新论文
📈 economics

A Bayesian latent class reinforcement learning framework to capture adaptive, feedback-driven travel behaviour

本文提出了一种贝叶斯潜在类强化学习框架,用于对异质性、适应性的出行行为进行建模,通过对驾驶模拟器数据的分析,识别出具有独特偏好演化和探索-利用策略的三种截然不同的出行者类别。

原作者: Georges Sfeir, Stephane Hess, Thomas O. Hancock, Filipe Rodrigues, Jamal Amani Rad, Michiel Bliemer, Matthew Beck, Fayyaz Khan

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Georges Sfeir, Stephane Hess, Thomas O. Hancock, Filipe Rodrigues, Jamal Amani Rad, Michiel Bliemer, Matthew Beck, Fayyaz Khan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在学习前往学校的最佳路径。有时你会每天走同一条路线,因为它既快速又可靠。有时你又会尝试一条新街道,仅仅是为了看看它是否更快,即便这可能会让你迟到。这就是人类做决策的核心方式:我们在坚持已知(利用)与尝试新事物以获取更多信息(探索)之间寻找平衡。长期以来,研究人类出行方式的科学家一直使用一些模型,这些模型假设每个人学习的方式都是相同的,或者我们的偏好像石头一样固定不变。但在现实生活中,人类是复杂的。我们学习的速度各不相同,我们会被新信息搞糊涂,而且当我们实际在开车与当我们只是在脑海中构思一次行程时,我们的行为可能完全不同。这篇论文深入探讨了这种复杂的现实,结合心理学和数学,不仅试图弄清楚人们选择了“什么”,还试图弄清楚他们是如何随着时间的推移学会做出这些选择的。

由 Georges Sfeir 及其同事领导的研究团队决定构建一种新型的“驾驶大脑”模型,称为潜在类别强化学习(LCRS)框架。把它想象成一个侦探故事,其中的侦探们正试图弄清楚为什么不同的驾驶者行为如此不同。他们并没有假设每个人都是一样的,而是使用驾驶模拟器观察了 83 人各进行了 20 次路线选择。一半的时间里,参与者实际驾驶这些路线并感受时间的流逝(经验反馈);另一半时间里,他们只是在屏幕上点击按钮,面对的是假设的时间(陈述偏好)。随后,团队将这些数据输入到他们这个精妙的新模型中,该模型就像一台分类机。它不仅仅是说“这个人喜欢快的路线”;它还会问:“这个人是一个固守旧习、学习缓慢的人吗?是一个尝试一切的冒险者吗?还是一个会根据是在实际开车还是仅仅在思考而改变主意的决策者?”

该模型发现,驾驶员群体并不是一个单一的人群集合,而是由三种具有各自性格特征的“学习类型”组成的。大约有 22% 的人是“情境变色龙”。这些人表现得前后矛盾:当他们在电脑屏幕上仅仅是在构思一次行程时(偏好安全、可靠的路线),但当他们真正坐在模拟器的方向盘后时,他们的行为会完全反转,突然渴望那种具有风险且不可预测的路线。他们学习缓慢,需要时间来根据新的经验来更新自己的认知。

接着是最大的群体,占参与者近一半(49%),即“持久利用者”。这些驾驶员无论如何都热爱那条充满风险且不可靠的路线。无论是在开车还是仅仅点击按钮,他们都会选择那条不确定的路径,即使有时这会让他们耗时更长。他们是最顽固的利用者,坚持着他们冒险的选择,并且比最慢的那组人适应反馈的速度稍快一些,尽管他们仍然相当依赖过去的经验。

最后是第三组,约占样本的 29%,即“适应性切换者”。这些驾驶员更有可能是女性且拥有更高的收入。当他们实际在驾驶时,他们最初倾向于选择安全的路线;但当他们在回答屏幕上的问题时,他们突然变得更加大胆,选择了冒险的路线。他们表现出最强的探索倾向,在安全选项和冒险选项之间来回切换。虽然他们的学习率估计值是三组中最高的,但在统计学上并不显著,这表明他们保持着稳定的预期,这些预期是随着时间逐渐演变的,而不是进行剧烈、反复无常的转变。

论文指出,如果我们忽略了这些不同的“学习个性”,我们可能会在设计交通系统或预测人们对新道路反应时犯错。如果你把一个“情境变色龙”当作“持久利用者”来看待,你的交通建议可能会完全失效。研究人员并非仅仅猜测这些群体的存在,他们使用了一种名为变分贝叶斯(Variational Bayes)的高级数学技术,证明了将人群分为这三个类别比假设所有人学习方式相同更能拟合数据。他们甚至运行了模拟实验,以展示如果这些群体持续遇到同样的糟糕交通或同样的良好交通,他们会如何反应,从而证实了他们的“个性”确实改变了他们的学习方式。

简而言之,这篇论文认为,要理解出行,我们不能只看地图,我们必须观察驾驶员的思想。我们需要知道他们是那种固守熟悉事物的人,是那种追逐新鲜事物的人,还是那种会根据情况改变主意的人。通过构建一个能够捕捉这些差异的模型,作者希望帮助城市和规划者设计出更完善的系统,使之能服务于所有类型的学习者,而不仅仅是那个“平均水平”的人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →