Data as Transcendental Stabilizations: Symbolic Mediation and the Pre-Semantic Conditions of Data
이 논문은 데이터가 존재론적 원형이나 단순한 기술적 인공물이 아니라, 차별적 구성을 운영 가능한 차이로 변형시키는 역사적으로 가변적인 상징적 안정화를 통해 출현하는 것이라고 주장하며, 이를 통해 알고리즘 편향과 같은 문제를 단순한 기술적 관리 문제가 아닌 경쟁하는 이해 가능성의 체제 간의 분쟁으로 재구성한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 모래 한 양동이를 들고 있다고 상상해 보십시오. 지질학자에게 그것은 실리카와 장석의 샘플입니다. 아이에게 그것은 성을 쌓기 위한 재료입니다. 시인에게 그것은 손가락 사이로 빠져나가는 시간의 은유입니다. 하지만 이 사람들이 "이것은 모래다"라고 말하기 전에, 무언가 보이지 않는 일이 먼저 일어나야 합니다. 혼란스럽고 변화무쌍한 알갱이들이 포착되고, 이름 붙여지고, 계산되고, 공유되고, 기억될 수 있는 무언가로 변환되어야 합니다. 이것이 바로 데이터의 비밀스러운 삶입니다.
과학과 기술의 세계에서 우리는 종-종 데이터를 마치 바닥에서 그냥 집어 올릴 수 있는 작은 현실의 벽돌처럼 취급합니다. 우리는 온도계가 있다면 온도가 그저 거기 "존재하며", 기록되기를 기다리고 있다고 가정합니다. 하지만 로드리고 가리도(Rodrigo Garrido)의 새로운 논문은 이것이 일종의 속임수일 수 있다고 주장합니다. 그는 데이터가 우리가 '찾는' 것이 아니라, 우리가 '만드는' 것이라고 주장합니다. 이를 이해하기 위해 우리는 세 가지 큰 개념을 살펴봐야 합니다. 첫째, 상징적 매개(symbolic mediation): 우리가 현실을 직접 만질 수 없으며, 항상 세상을 이해할 수 있는 형태로 번역하기 위해 도구, 단어, 혹은 숫자를 사용해야 한다는 개념입니다. 둘둘째, 안정화(stabilization): 무언가 무질서한 것을 가져와서 유용할 만큼 일정하게 유지되도록 변화시키는 과정입니다. 셋째, 투영(projection): 3D 물체에 손전등을 비추어 2D 그림자를 보는 것처럼, 우리는 어떤 부분을 강조하고 어떤 부분을 무시하여 하나의 '데이터(datum)'를 만들지 선택해야 합니다. 이것이 왜 중요할까요? 만약 우리가 데이터를 단순히 "가공되지 않은 진실"이라고 생각한다면, 우리가 측정하는 방식이 우리가 무엇을 볼 수 있는지, 무엇을 알 수 있는지, 심지어 디지털 세상에서 무엇이 "실제"로 간주되는지까지 결정한다는 사실을 놓칠 수 있기 때문입니다.
그렇다면 이 논문은 실제로 무엇을 말하고 있는 것일까요? 이 논문은 하나의 "데이터(datum)"가 우주에 이미 존재하는 아주 작은 조각이 아니라고 제안합니다. 대신, 그것은 **초월적 안정화(transcendental stabilization)**입니다. 그것은 멋진 말로 표현하자면, 특정한 규칙과 도구에 의해 얼려지고, 포장되고, 반복 가능하게 만들어진 현실의 스냅샷이라는 뜻입니다.
현실을 거대하고 연속적이며 웅웅거리는 정보의 강이라고 생각해 보십시오. 그 강은 항상 흐르고, 변화하며, 무한한 차이들로 가득 차 있습니다. 당신은 그 강물을 그냥 떠서 병 안에 담을 수 없습니다. 담으면 그냥 흘러넘쳐 버릴 테니까요. "데이터"를 얻으려면 댐을 건설해야 합니다. 강을 어디서 자를지, 무엇을 측정할지, 그리고 어떻게 라벨을 붙일지를 결정해야 합니다. 논문은 이 댐을 건설하는 행위 자체가 데이터를 만든다고 주장합니다. 댐이 건설되기 전에는 오직 강(존재론적 변이)만이 존재합니다. 일단 댐이 건설되어 물이 특정 파이프로 흘러 들어가게 되면, 그것이 바로 데이터입니다.
저자는 이 과정이 어떻게 작동하는지 설명하기 위해 멋진 비유들을 사용합니다. 당신이 노래를 묘end하려고 노력한다고 상상해 보십시오. 공기 중의 음파는 "강"입니다. 만약 당신이 그 노래를 컴퓨터 파일(하나의 데이터)로 만들고 싶다면, 소리를 작고 불연속적인 덩어리들로 잘라야 합니다. 컴퓨터의 세계에서는 이를 **토큰화(tokenization)**라고 부릅니다. 기계에 노래 전체를 통째로 넣을 수는 없으므로, 기계가 감당할 수 있도록 작은 조각(토큰)들로 나누어야 합니다. 하지만 여기서 핵심은, 그렇게 나누는 방식이 노래를 바꾼다는 것입니다. 만약 비트에 맞춰 자른다면 한 종류의 데이터를 얻게 될 것이고, 음높이에 따라 자른다면 완전히 다른 종류의 데이터를 얻게 될 것입니다. 논문은 "데이터"가 노래 그 자체가 아니라, 당신이 그것을 나누기로 결정한 특정한 방식이라고 말합니다.
또한 이 논문은 이것이 단 한 번의 사건이 아니라고 주장합니다. 일단 노래를 잘라 놓았다면, 그 조각들이 흩어지지 않게 유지해야 합니다. 여기서 **기술적 퇴적(technical sedimentation)**이 등장합니다. 당신이 종이에 레시피를 적는다고 상상해 보십시오. 그 종이는 "기술적 지지물"입니다. 그 종이는 당신이 내일도 레시피를 읽을 수 있도록 그것을 붙잡아 둡니다. 하지만 그 종이 자체에도 규칙이 있습니다. 줄이 있고, 일정한 크기가 있으며, 아마도 당신이 아는 언어로 쓰여 있을 것입니다. 과거로부터 온 그 규칙들(종이, 언어)은 당신의 레시피 속에 "퇴적"되어 있습니다. 그것들은 당신이 무엇을 쓸 수 있는지, 어떻게 쓸 수 있는지를 결정합니다. 논문은 우리의 모든 데이터가 이와 같다고 제안합니다. 데이터는 우리가 미처 인지하지 못하는 오래된 도구들, 오래된 규칙들, 그리고 오래된 사고방식의 층 위에 구축되어 있습니다. 1980년대에 설계된 데이터베이스는 오늘날 우리가 어떤 종류의 데이터를 수집할 수 있는지를 여전히 결정하고 있을 수도 있는데, 이는 그 데이터베이스가 구축된 방식 때문입니다.
저자는 데이터가 무엇이 아닌지를 매우 명확하게 밝히고 있습니다. 데이터는 발견되기를 기다리는 "가공되지 않은" 현실의 조각이 아닙니다. 자연 속에서 "데이터(datum)"를 그냥 찾아낼 수는 없습니다. 온도 변화는 분명히 존재하지만, 온도계가 그것을 측정하고, 컴퓨터가 그것을 기록하며, 과학자가 그것을 어떻게 기록할지에 대해 합의할 때 비로소 "온도 데이터"가 됩니다. 또한 논문은 데이터가 단순히 진실을 위한 중립적인 구성 요소라는 생각에 반박합니다. 대신, 우리가 데이터를 안정화하는 방식(우리가 사용하는 규칙)이 우리가 보는 진실을 실제로 만든다고 제안합니다. 만약 다른 규칙(다른 상징적 형태)을 사용한다면, 당신은 다른 종류의 데이터를 얻게 될 것이고, 다른 종류의 진실을 얻게 될 것입니다.
이 논문은 우리의 모든 데이터 문제를 해결할 마법의 공식이라도 찾아냈다고 주장하는 것이 아닙니다. 대신, 우리가 데이터에 대해 생각하는 방식을 바꿔야 한다고 제안합니다. 우리는 데이터를 마치 저 바깥에 그냥 존재하는 것처럼 취급해서는 안 됩니다. 데이터는 우리의 선택, 우리의 도구, 그리고 우리의 역사의 산물임을 깨달아야 합니다. 우리가 "알고리즘 편향"이나 "데이터 프라이버시" 같은 것을 이야기할 때, 논문은 우리가 단지 숫자만을 바라서는 안 된다고 제안합니다. 우리는 우리가 만든 댐을 바라보아야 합니다. 우리는 질문해야 합니다. 누가 강을 어디서 자르기로 결정했는가? 노래를 나누기 위해 어떤 규칙을 사용했는가? 그리고 과거의 낡고 먼지 쌓인 규칙 중 어떤 것들이 오늘날 우리가 볼 수 있는 것을 여전히 통제하고 있는가?
요컨대, 이 논문은 우리가 데이터를 현실의 거울로 보는 것을 멈추고, 하나의 그림으로 보기 시작하도록 초대합니다. 그림은 현실 그 자체가 아닙니다. 그것은 예술가의 붓, 캔버스, 그리고 이전에 존재했던 예술의 역사에 의해 만들어진, 구체적이고 안정화된 버전의 현실입니다. 그리고 그림이 그러하듯, 그것은 예술가가 보여주고자 하는 세상만큼이나 예술가 자신과 그들이 사용한 도구에 대해서도 많은 것을 말해줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.