How Local Should an AVM Be? Spatial Resolution, Market Regionalization in Automated Valuation Models
本文将自动估值模型(AVM)的局部性重新定义为一个涉及空间分辨率、市场区域化和外部锚点的部分聚合问题,并通过对韩国商业地产交易的全面分析证明,尽管存在最优空间分辨率且区域化能提高准确性,但这些机制仅是部分可互换的,且外部锚点会显著改变模型选择与性能。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,仅仅通过观察地图来猜测一栋建筑的价格。你可能会说它位于某个特定的城市,或者该城市内的某个特定社区,甚至可能精确到具体的街区。几十年来,自动化房产估值领域的专家一直基于一个简单的假设:关于位置的信息越具体,你的猜测就会越准确。如果计算机能看到街道地址,那么它应该比只看到邮政编码时表现得更好。这种逻辑意味着,空间细节是越多越好的。但如果过于具体反而会让计算机感到困惑呢?如果为建筑定价最准确的方式,不是尽可能地在地图上进行缩放,而是找到一个“甜点区”——即位置既足够详细以发挥作用,又足够宽泛以保证数据的可靠性?
这就是一项针对韩国商业房地产的新研究所探讨的核心谜题。研究人员不仅是在询问如何做出更好的价格估计,他们还在询问计算机模型究竟应该被允许使用多少“局部”信息。他们重点研究了三种引入局部性的方式。第一种是用于描述位置的地图网格大小。第二种是模型应该将整个国家视为一个大市场,还是将其拆分为不同城市的独立模型。第三种是模型是否可以使用外部提示,例如去年的政府评估地价,以帮助其理解局部价值,而不必从零开始进行猜测。通过针对数千笔真实的房产交易测试这三个因素,研究表明,局部化程度是存在极限的,一旦超过这个极限,预测效果反而会变差。
研究人员分析了 2018 年至 2025 年间韩国七个主要城市中超过 22,000 笔商业和办公楼交易。他们构建了一个计算机模型来预测价格,并测试了数百种不同的条件。他们尝试用各种网格来表示位置,范围从没有任何特定网格,到 5 公里、2 公里、1 公里,最后到非常精细的 500 米网格。他们还测试了模型应该是涵盖所有七个城市的单一系统,还是应拆分为每个城市或更小城市组的独立系统。最后,他们测试了提供以去年官方地价为形式的“提示”是否有助于提升性能。
结果显示出一个清晰且令人惊讶的模式。当模型完全不使用城市内部的位置信息时,其预测的中位数误差约为 27%。当研究人员引入 5 公里网格时,误差显著下降至约 22.6%,这是最好的结果。然而,随着网格变得更精细,从 2 公里、1 公里到最后的 500 米,准确度反而下降了。在最精细的 500 米尺度下,误差回升至接近 27.4%,这实际上比没有任何网格时还要差。研究证明了存在一个最优的中间地带。计算机需要足够的细节来区分不同区域,但如果网格太细,这些特定的方格就会因为缺乏数据而变得空洞。模型试图根据极少的案例来猜测微小且空洞的方格的价格,从而导致错误。
研究人员还发现,将市场拆分为不同的城市模型确实有帮助,但也仅限于一定范围内。将单一的国家模型分解为七个城市特定模型提高了准确性,但进一步将其分解为更小的城市组并没有带来更多帮助。最大的收益来自于摆脱“一刀切”的单一模型。然而,这种拆分并不能解决网格过细的问题。即使拥有七个独立的城市模型,500 米网格的表现依然很差。这意味着,拥有更具体的地理位置数据,并不能通过拥有更具体的市场定义来解决;这两个问题相关但并不等同。
研究人员测试的最强大的工具是“外部锚点”。这是从模型自身学习数据之外提供的辅助信息:即政府上一年度评估的官方地价。当模型获得这个提示时,整个情况发生了变化。当网格变得过细时出现的准确度骤降现象消失了。有了政府价格提示,无论网格是 5 公里、2 公里还是 1 公里,模型的表现几乎同样出色。外部信息的强度如此之高,以至于它消除了模型从头开始猜测局部价格水平的需求。这也意味着,有了外部提示,模型不再需要那么多独立的城市划分。与其需要五个或七个不同的模型,在有外部提示的最佳设置下,只需要三个模型即可。
研究结论指出,构建此类估值系统的问题不在于“我们可以实现多大的局部化?”,而在于“我们的数据能支持多大的局部化?”研究人员发现,对于这些城市的商业建筑,在没有外部提示的情况下,5 公里网格是代表位置最可靠的尺度。如果比这更精细,就会引入过多的噪声。如果可以获得可靠的外部价格信号,网格大小的选择就不那么重要了,模型也可以变得更简单。研究结果表明,在像商业房地产这样数据稀缺的领域,试图追求过于精确的位置信息反而会损害性能。最好的方法是找到现有数据能够实际支持的细节水平,而不是假设细节越多就一定越好。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。