Data as Transcendental Stabilizations: Symbolic Mediation and the Pre-Semantic Conditions of Data
本文认为,数据并非本体论意义上的原初要素或单纯的技术人工制品,而是通过在历史上不断变化的符号稳定化过程而涌现,这种过程将差异化的配置转化为在操作上可用的差异,从而将诸如算法偏见之类的问题重新界定为关于竞争性理解机制的争端,而非简单的技术管理问题。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你手里拿着一桶沙子。对地质学家来说,它是二氧化硅和长石的样本;对孩子来说,它是建造城堡的材料;对诗人来说,它是时间从指缝间流逝的隐喻。但在这些人说出“这是沙子”之前,某种无形的过程必须先发生。那些混乱、移动的颗粒必须被捕捉、被命名,并转化为可以被计数、分享和记忆的东西。这就是数据的秘密生命。
在科学和技术领域,我们经常把数据当作从地板上随手捡起的现实中的小砖块。我们假设如果我们有一个温度计,温度就只是“在那里”等着被记录下来。但罗德里戈·加里多(Rodrigo Garrido)的一篇新论文指出,这其实是一个陷阱。它认为数据不是我们“发现”的东西,而是我们“制造”出来的东西。要理解这一点,我们需要观察三个核心概念。首先是符号中介(symbolic mediation):即我们无法直接接触现实,我们总是需要使用工具、语言或数字来将世界翻译成我们可以理解的形式。其次是稳定化(stabilization):这是一个将混乱之物进行改变,使其保持不变以至于能够发挥作用的过程。第三是投影(projection):就像通过向三维物体投射光影来观察其二维影子一样,我们必须选择强调现实的哪些部分,以及忽略哪些部分,从而制造出一个“数据点”(datum)。为什么这很重要?因为如果我们认为数据仅仅是“原始真理”,我们可能会忽略这样一个事实:我们测量事物的方式,实际上决定了我们能看到什么、能知道什么,甚至决定了在我们的数字世界中,什么才算作“真实”。
那么,这篇论文到底在说什么?它提出,“数据点”(一个单一的数据单元)并不是宇宙中预先存在的微小碎片。相反,它是一种超越性的稳定化(transcendental stabilization)。这是一种高级的说法,意指它是一个被冻结、被包装、并通过特定规则和工具变得可重复的现实快照。
把现实想象成一条巨大的、连续的、嗡嗡作响的信息之河。它始终在流动、在变化,充满了无限的差异。你不能直接舀起河流并把它装进罐子里;它会直接洒出来。要获得“数据”,你必须建造一座大坝。你必须决定在哪里截断河流,测量什么,以及如何标记它。论文认为,建造大坝的行为本身就是创造数据的过程。在大坝建成之前,只有河流(本体论变异/ontological variation)。一旦大坝建成,水被引导进特定的管道,那才是数据。
作者使用了很酷的比喻来解释这一过程。想象你在试图描述一首歌。空气中的声波就是“河流”。如果你想把这首歌变成电脑里的一个文件(一个数据点),你必须把声音切成微小的、离散的块。在计算机领域,这被称为标记化(tokenization)。你不能把整首连续的歌喂给机器;你必须把它分解成机器可以承载的小块(tokens)。但关键在于:你切割的方式改变了这首歌。如果你按节拍切割,你会得到一种类型的数据;如果你按音高切割,你会得到完全不同的另一类数据。论文说,“数据”并不是歌曲本身,而是你决定如何切割它的那种特定方式。
论文还指出,这不仅仅是一次性的行为。一旦你切分了歌曲,你还得让这些碎片不至于散架。这就是**技术沉积(technical sedimentation)**发挥作用的地方。想象你在一张纸上写下一份食谱。这张纸是“技术支撑”。它保存了食谱,以便你明天阅读。但纸本身也有规则:它有线条,有特定的尺寸,或许还用了一种你熟悉的语言。来自过去的这些规则(纸张、语言)被“沉积”到了你的食谱中。它们决定了你能写什么以及如何书写。论文认为,我们所有的数据都是如此。它们建立在旧有的工具、旧有的规则和旧有的思维方式之上,而我们往往察觉不到这些。一个设计于20世纪80年代的数据库,可能至今仍在决定着我们今天能收集什么样的类型的数据,仅仅是因为它的构建方式如此。
作者非常明确地界定了数据“不是”什么。数据不是等待被发现的现实中的“原始”碎片。你无法在自然界中直接“发现”一个“数据点”。温度变化确实存在,但只有当温度计测量它、计算机记录它、并且科学家就如何记录它达成共识时,它才成为了一个“温度数据点”。此外,论文也反驳了“数据只是中立的真理基石”这一观点。相反,它暗示我们稳定数据的方式(我们使用的规则)实际上创造了我们所看到的真理。如果你使用一套不同的规则(一种不同的符号形式),你会得到不同类型的数据,以及不同类型的真理。
该论文并不声称找到了修复所有数据问题的魔法公式。相反,它建议我们需要改变看待数据的方式。我们不应把数据视为仅仅是“在那儿”的东西。我们应该意识到,数据是我们选择、工具和历史的产物。当我们谈论诸如“算法偏见”或“数据隐私”等问题时,论文建议我们不应只盯着数字看。我们应该审视我们建造的大坝。我们应该追问:是谁决定了在哪里截断河流?我们用了什么样的规则来切割这首歌?以及哪些陈旧的、尘封的规则仍在控制着我们今天的视野?
简而言之,这篇论文邀请我们停止将数据视为现实的镜子,转而将其视为一幅画作。画作并非现实本身;它是一个特定的、被稳定化的、被稳定下来的现实版本,是由艺术家的画笔、画布以及此前的艺术史共同创造的。正如一幅画作一样,它向我们展示的内容,既包含了它试图呈现的世界,也同样反映了创作者及其所用工具的痕迹。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。