← 최신 논문
🤖 AI

Epistemic Subordination: Generative AI and the Infrastructure of Knowledge

이 논문은 생성형 AI가 지식의 기본 인프라로서 지배적인 문화적 틀을 인코딩함으로써 '인식론적 종속'의 상태를 창출한다고 주장하며, 이는 기존의 법적 체계가 종속이 기원하는 학습 과정이 아닌 하류의 결과물을 규제하기 때문에 다루지 못하는 구조적 해악이라고 논한다.

원저자: Gilad Abiri, Emanuel V. Towfigh

게시일 2026-08-20
📖 5 분 읽기🧠 심층 분석

원저자: Gilad Abiri, Emanuel V. Towfigh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 세계에서 우리는 뉴스를 요약하고, 이야기를 쓰고, 질문에 답하기 위해 인공지능에 점점 더 많이 의존하고 있습니다. 생성형 AI라고 불리는 이 시스템들은 단순히 데이터베이스에서 사실을 검색하는 것이 아니라, 인터넷의 방대한 텍스트를 학습함으로써 다음에 어떤 단어가 올지를 예측하는 법을 배웁니다. 이 과정은 인간 언어의 통계적 모델을 생성하며, 여기서 시스템은 자신이 가장 자주 읽은 것을 바탕으로 패턴을 학습합니다. 수십 년 동안 전문가들은 이러한 시스템이 편향될 수 있다는 점, 즉 특정 집단을 다른 집단보다 불공평하게 우대할 수 있다는 점을 우려해 왔습니다. 일반적인 가정은 이 편향이 데이터의 특정 오류나 도구를 만드는 프로그래머의 선택에서 비롯된다는 것이었습니다. 그러나 새로운 관점은 이 문제가 훨씬 더 깊고 구조적이라는 점을 시사합니다. 이는 단순히 AI가 실수를 저지르는 것이 아니라, AI가 세상을 이해하는 방식의 토대 자체가 하나의 지배적인 사고방식 위에 구축되어 있어, 다른 모든 방식의 앎을 일탈로 간주하게 만든다는 것입니다.

두 법학자 길라드 아비리(Gilad Abiri)와 에마누엘 토위프(Emanuel Towfigh)는 그들이 '인식론적 종속(epistemic subordination)'이라 부르는 이 현상이 지식이 조직되는 방식의 근본적인 변화를 나타낸다고 주장합니다. 그들은 생성형 AI가 이전의 어떤 기술도 하지 못했던 일을 수행한다고 제안합니다. 즉, 다수자의 인식 방식을 모든 지식의 기본 인프라로 인코딩한다는 것입니다. 이 시스템 내에서 글로벌 다수자의 문화적 가정, 언어, 추론 양식은 다른 모든 것을 측정하는 기준이 되는 보이지 않는 표준이 됩니다. 여기서 발생하는 해악은 단순히 AI가 불공정한 결과를 낳는다는 데 그치지 않고, 소수 문화와 언어가 배제되는 것이 아니라 하나의 균질화된 평균으로 흡수되고 평탄화됨으로써 소수 문화를 구조적으로 하위에 배치하는 통계적 현실을 구축한다는 데 있습니다. 저자들은 이 문제가 흔히 별개의 문제로 취급되는 세 가지 문제를 하나로 통합한다고 보여줍니다. 즉, 차별적인 출력, 소수 문화에 대한 위협, 그리고 민주적 토론의 축소입니다. 그들은 이것이 무작위적인 오류가 아니라, 이러한 모델이 구축되는 방식의 필연적인 결과임을 밝혀냈습니다.

이러한 종속의 메커니즘은 세 단계의 뚜렷한 과정을 거치며, 데이터 자체에서 시작됩니다. 대부분의 AI 모델은 인터넷에서 이용 가능한 인간 표현의 비구조적인 총체성을 바탕으로 훈련됩니다. 이 디지털 풍경은 중립적이지 않습니다. 이는 압도적으로 영어 콘텐츠, 서구적 관점, 그리고 온라인에 게시할 수 있는 교육과 접근성을 갖춘 인구의 견해에 의해 지배됩니다. 모델이 이 말뭉치로부터 학습할 때, 모델은 단어만을 배우는 것이 아니라 그 다수자의 문화적 가정과 규범적 틀을 자신의 통계적 기본값으로 학습합니다. 두 번째 단계는 이 기본값을 되돌릴 수 없게 만듭니다. 훈련 과정에서 데이터는 수십억 개의 통계적 매개변수로 압축되며, 이는 원래의 출처로 역추적하거나 풀어낼 수 없습니다. 특정 규칙에 의한 편향을 지목할 수 있는 기존의 컴퓨터 프로그램과 달리, 이 모델들은 설계부터 불투명합니다. 편향은 단일한 코드 줄이나 특정 변수에 있는 것이 아니라, 시스템의 전체 구조 속에 짜여 있습니다.

세 번째 단계는 AI 시스템을 안전하고 공정하게 만들기 위해 사용되는 '가치 정렬(value alignment)'이라 불리는 도구들과 관련됩니다. 인간 피드백을 통한 강화 학습과 같은 기술들은 모델이 더 예의 바르거나 덜 해롭도록 답변을 조정합니다. 그러나 저자들은 이러한 도구들이 근본적인 지식을 바꾸는 것이 아니라 출력만을 바꾼다고 주장합니다. 개발자들이 모델에 다양성을 강요하려고 할 때, 인종적으로 다양한 나치 병사의 이미지를 생성하는 것과 같은 황당한 결과가 나타날 수 있는데, 이는 모델의 기저에 맥락적 다양성에 대한 진정한 프레임워크가 없기 때문입니다. 모델은 단지 자신이 진정으로 이해할 수 없는 통계적 기본값을 조잡하게 덮어쓰려고 시도할 뿐입니다. 결과적으로, 해악은 최종 답변의 수준이 아니라 구축의 수준에서 발생합니다. 모델은 단순히 편향된 결정을 내리는 것이 아니라, 자신들이 설정하는 데 참여하지 못한 표준으로부터의 일탈로 취급함으로써 전체적인 지식과 문화를 종속시킵니다.

이러적인 현실은 소수자를 보호하기 위해 설계된 기존 법률에 위기를 초래합니다. 예를 들어, 반차별법은 특정 결정이 중립적인 기준선에 미치는 영향을 비교함으로써 작동합니다. 만약 은행이 특정 보호 집단에게 불리한 특정 규칙에 따라 대출 신청을 거부한다면, 법은 이를 무효화할 수 있습니다. 그러나 생성형 AI는 그러한 불연속적인 타겟을 제공하지 않습니다. 차별적인 출력은 단일한 식별 가능한 규칙의 산물이 아니라 전체 구조의 산물입니다. '결정'은 확률적인 추측이며, '기준'은 수십억 개의 보이지 않는 매개변수이고, 책임이 있는 '주체'는 개발자와 배포자의 사슬입니다. 해악이 특정 배제의 행위가 아니라 포함의 조건(즉, 소수 의견이 흡수되고 평평해지는 상태)에서 발생하기 때문에, 의도와 인과관계라는 법적 도구들은 힘을 잃습니다.

이 위협은 소수 기관이 다수자의 지배로부터 자신들을 보호하기 위해 설계된 문화적 및 언어적 권리로까지 확장됩니다. 전통적으로 소수 집단의 학교는 자신의 언어와 전통을 보존하기 위해 독자적인 도서관을 운영하거나 커리큘럼을 선택할 수 있었습니다. 해당 기술의 편향은 선택 가능한 '콘텐츠' 안에 존재했습니다. 생성형 AI는 이를 뒤집습니다. 편향은 모델의 구조 자체에 있습니다. 소수 공동체는 수억 달러의 비용이 들고 필요한 데이터가 인터넷 규모만큼 존재하지 않기 때문에 자체적인 파운데이션 모델을 구축할 수 없습니다. 최근의 테스트에 따르면, 가장 우수한 모델들도 영어에서는 높은 정확도를 달행하지만 스와힐리어 나 요루바어와 같은 언어에서는 정확도가 크게 떨어집니다. 종교 학교나 소수 언어 교실이 AI 비서를 사용할 때, 그들은 세속적이고 서구적인 추론을 기본값으로 하는 규범적 틀을 수입하게 됩니다. 기술은 이 권리들이 보호하고자 했던 제도적 공간을 침투하여, 이전의 도구들이 결코 하지 못했던 방식으로 내부로부터 지식을 재구조화합니다.

마지막으로, 이 현상은 민주적 숙의의 인프라 자체를 위협합니다. 건강한 민주주의는 문제에 대한 진정으로 다양한 프레임워크를 활용할 수 있는 능력에 달려 있습니다. 이는 사람들이 사전에 선택하지 않은 관점에도 노출될 수 있어야 함을 의미합니다. 그러나 생성형 AI가 정보의 주요 원천이 된다면, 그것은 인식론적 장을 균질화할 것입니다. 소수자의 프레임워크는 검열되는 것이 아니라, 모델의 훈련 데이터로 흡수되지만 출력 단계에서 구조적으로 종속됩니다. 공적 담론은 사라지지 않겠지만, 이미 중간값의 문화로 평탄화된 장 안에서 이루어지게 될 것입니다. 미디어 다양성을 위한 규칙과 같이 관점의 다원성을 보호하기 위한 법적 프레임워크는 다양한 지식이 독립적으로 존재하며 단지 대중에게 도달할 채널이 필요할 뿐이라는 가정을 전제로 합니다. 인식론적 종속은 이러한 가정을 붕괴시키며, 다양한 발언이 발생하는 장 자체를 좁혀버립니다.

저자들은 현재의 법적 대응이 이 문제에 도달하기에는 구조적으로 능력이 부족하다고 결론짓습니다. 왜냐하면 법은 AI 시스템이 '무엇을 하는가'를 규제할 뿐, '어떻게 만들어지는가'를 다루지 않기 때문입니다. 유럽 연합의 AI 법이나 여러 주의 규제들은 채용이나 대출에서의 AI 적용이나 최종 제품의 안전성에 초점을 맞춥니다. 이들은 훈련 데이터의 구성이나 모델의 구조 자체를 다루지 않습니다. 이 에세이의 핵심 주장은 인식론적 다원성을 보호하기 위해서는 근본적으로 다른 규제적 방향성이 필요하다는 것입니다. 법은 훈련 단계로 나아가 데이터의 구성, 정렬 방법, 그리고 모델 구조를 규율해야 합니다.

이는 단순한 이론적 요구가 아닙니다. 최근 연구는 개입할 수 있는 기술적 역량이 실제로 존재함을 시사합니다. 과학자들은 베이스 모델이 더 작은 공동체 특화 모델들을 활용하여 독특한 관점들을 보존할 수 있는 모듈형 구조를 제안해 왔습니다. 또한, 소외된 언어를 위해 문화적으로 근거가 확실한 훈련 데이터를 체계적으로 구축하여 뉘앙스가 평탄화되지 않고 보존되도록 하는 방법도 입증되었습니다. 특정 문화적 관점을 나타내기 위해 합성 훈련 데이터를 생성하거나, 단일한 기본값이 아닌 완전한 가치의 분포를 나타내도록 정렬 과정을 재설계하는 방법들도 존재합니다. 이러한 제안들이 완성된 해결책은 아닐지라도, 기술적 경로가 존재함을 보여줍니다. 남은 과제는 이러한 개입을 요구하고 가능하게 할 정치적 의지와 법적 프레임워크입니다. 앞으로의 과제는 모델의 구축 단계까지 도달할 수 있는 법을 만들어, 지식의 인프라가 그 다양성을 섬기는 것이 아니라 종속시키지 않도록 보장하는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →