Disagreement Is Not Debiasing: Human–AI Views in Portfolio Decisions
이 논문은 독립적인 AI 예측을 인간 분석가의 예측에 추가하는 것이 불일치를 통해 불확실성 추정치를 정교화함으로써 확률적 정확도를 향상시키기는 하지만, 실현된 결과에 대한 보정 없이는 공유된 체계적 편향을 수정하거나 타겟 기반 포트폴리오 의사결정을 강화하는 데는 실패한다는 점을 입증한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
투자라는 고위험의 세계에서 의사결정을 내리는 것은 마치 움직이는 표적을 겨냥하며 흔들리는 플랫폼 위에 서 있는 것과 같은 기분을 느끼게 합니다. 투자자들은 기업이 얼마나 많은 돈을 벌 것인지 추측하기 위해 예측에 의존하지만, 이러한 추측은 결코 완벽할 수 없습니다. 수십 년 동안 표준적인 접근 방식은 인간 전문가의 의견과 컴퓨터 모델의 계산을 결합하여, 한쪽의 실수가 다른 쪽의 실수를 상쇄하기를 바라는 것이었습니다. '예측 결합(forecast combination)'이라고 알려진 이 아이디어는 두 개의 불완전한 예측을 평균 내면 그 결과가 각각의 예측보다 더 정확할 것이라고 제안합니다. 그러나 이 논리는 두 출처가 서로 다른 종류의 오류를 범하고 있다는 것을 전제로 합니다. 만약 인간과 기계가 모두 동일한 문서를 보고 있고 동일한 낙관적인 분위기에 영향을 받는다면, 그들은 동시에 똑같은 실수를 저지를 수 있습니다. 이 경우, 단순히 그들의 견해를 평균 내는 것은 문제를 해결하지 못하며, 오히려 오류를 강화할 뿐입니다.
이러한 현실은 샤먼 대학교 탄카이키 대학(Xiamen University Tan Kah Kee College)의 연구진이 수행한 새로운 연구의 배경이 되었습니다. 연구진은 인공지능 시스템이 인간 금융 분석가들의 체계적인 편향을 교정할 수 있는지 테스트하고자 했습니다. 연구진은 수천 개의 기업이 전문 분석가들에 의해 추적되는 거대하고 활발한 무대인 중국 주식 시장에 초점을 맞췄습니다. 연구진은 수십 년간의 데이터를 수집하여, 인간 전문가들이 만든 수익 예측치를 대규모 언어 모델(LLance Model, 고급 AI의 일종)이 생성한 예측치와 비교했습니다. 이 AI는 동일한 기업 보고서를 읽지만, 분석가들의 예측을 보는 것은 엄격히 금지되어 있습니다. 목표는 AI가 인간의 오류를 정화하는 독립적인 제2의 의견 역할을 할 수 있는지, 아니면 두 출처가 단순히 같은 방향으로 편향되어 있어 핵심 문제를 해결하는 데 있어 그 불일치가 무용지물이 되는지를 확인하는 것이었습니다.
연구는 잘 알려진 사실을 인정하며 시작되었습니다. 인간 금융 분석가들은 지속적으로 지나치게 낙관적이라는 점입니다. 검토된 데이터에서 이 전문가들은 실제 발생한 결과보다 높은 수익을 약 4분의 3의 사례에서 예측했습니다. 연구진은 그다음 AI를 도입했는데, AI에는 동일한 원시 재무 데이터가 입력되었으나 정보적으로 독립적이도록 설계되었습니다. 즉, AI는 인간의 합의된 의견을 엿볼 수 없었습니다. 자연스러운 가정은 만약 AI와 인간이 의견이 다를 경우, 그 차이가 인간의 편향을 드러낼 것이라는 점입니다. 만약 인간은 회사가 많은 수익을 낼 것이라고 말하고 AI는 적게 벌 것이라고 한다면, 인간이 틀렸다고 가정할 수 있습니다. 그러나 연구진은 이러한 직관이 결함이 있다는 것을 발견했습니다. 인간과 AI 모두 근본적인 보고서를 읽고 있기 때문에, 공통의 사각지대를 공유하고 있었기 때문입니다. 그들은 서로 다른 정도를 보일 뿐, 동일한 방향으로 편향되어 있었습니다.
이 논문의 핵심 발견은 두 편향된 출처 사이의 불일치가 자동으로 편향을 교정하지 않는다는 것입니다. 두 예측자가 공통된 오류를 공유할 때, 그들의 불일치는 단지 그들이 서로 얼마나 다른지를 알려줄 뿐, 진실이 실제로 어디에 있는지는 알려주지 않습니다. 진실을 찾으려면 단지 두 현재 추측 사이의 차이를 보는 것이 아니라, 과거에 실제로 어떤 일이 일어났는지를 살펴보아야 합니다. 연구진은 이를 테스트하기 위해 정교한 모델을 구축했습니다. 먼저 연구진은 역사적 데이터를 기반으로 인간과 AI의 예측치를 조정했는데, 이는 모델에게 각 출처에서 나타나는 전형적인 과도한 낙관주의를 인식하고 이를 차감하도록 가르치는 과정이었습니다. 이러한 보정(calibration)이 완료된 후, 연구진은 두 견해를 결합하여 그 결과가 인간의 예측만을 사용했을 때보다 더 나은지 확인했습니다.
결과는 미묘했으며, AI를 추가하는 것이 단순히 모든 것을 개선할 것이라는 기대에 도전했습니다. 순수한 예측 정확도 수준에서, 보정된 인간과 AI의 예측을 결합하는 것은 불확실성에 대한 통계적 기술을 개선했습니다. 모델은 결과의 범위를 설명하는 데 더 능숙해졌는데, 이는 두 출처 사이의 불일치가 모델로 하여금 언제 더 주의를 기울여야 하는지를 이해하도록 도왔기 때문입니다. 인간과 AI가 의견이 다를 때, 모델은 이를 상황이 불확실하다는 신호로 올바르게 해석하여 안전 마진을 넓혔습니다. 이는 예측의 확률적 정확성을 향상시켜, 리스크를 이해하는 데 더 나은 도구로 만들었습니다.
그러나 연구진이 이 개선된 예측이 더 나은 투자 결정으로 이어지는지 테스트했을 때, 이야기는 달라졌습니다. 연구진은 특정하고 절대적인 수익 목표를 요구하는 포트폴리오 전략을 시뮬레이션했습니다. 이 시나리오에서 AI 예측을 추가하는 것은 보정된 인간의 예측만을 사용하는 것보다 감지할 수 있는 이점을 제공하지 못했습니다. 그 이유는 공유된 편향의 성질에 있습니다. AI가 모델이 '가능한 결과의 폭(spread)'을 이해하는 데는 도움을 주었지만, 예측의 '수준(level)'을 수정할 수는 없었기 때문입니다. 인간과 AI 모두 여전히 평균적으로 지나치게 낙관적이었기 때문에, 결합된 예측은 여전히 너무 높았습니다. 특정 숫자를 달는 것에 의존하는 결정의 경우, 이 작은 잔여 오류는 어떠한 개선도 막기에 충분했습니다. 두 출처 사이의 불일치는 실제 결과에 대한 엄격한 보정 작업을 대체할 수 없었습니다.
또한 이 연구는 AI 예측 자체가 중립적이고 편향 없는 예언자가 아니라는 점을 밝혔습니다. 인간 분석가와 마찬가지로 AI 역시 상향 편향되어 있었으며, 실제로 발생한 것보다 높은 수익을 예측했습니다. 이 발견은 매우 중요한데, 왜냐하면 이는 AI가 인간의 오류를 바로잡을 수 있는 자동적인 '진실 전달자'라는 생각을 해체하기 때문입니다. 대신, AI는 자신만의 체계적인 결함을 가진 또 다른 정보원일 뿐이었습니다. 연구진은 AI의 편향이 약 1%포인트이며, 이는 분석가의 편향인 1.45%포인트와 구별된다는 것을 발견했습니다. 이는 단순히 AI를 섞는다고 해서 금융 예측을 괴롭히는 낙관주의가 마법처럼 제거되지 않는다는 것을 의미합니다.
궁극적으로, 이 논문은 두 번째 의견의 가치가 어떤 종류의 의사결정을 내리느냐에 따라 전적으로 달라짐을 보여줍니다. 만약 목표가 기업들을 최선에서 최악까지 순위를 매기는 것이라면, 공유된 편향은 중요하지 않습니다. 왜냐로 인간과 AI 모두 아마도 동일한 순서로 순위를 매길 것이기 때문입니다. 하지만 최소 수익률과 같은 특정 목표치를 달는 것이 목표라면, 그 공유된 편향은 결정적인 장애물이 됩니다. 연구는 두 예측 사이의 차이를 통해 공유된 오류를 고칠 수 없으며, 반드시 과거의 실제 결과로부터 배워야 한다는 것을 보여줍니다. 연구는 AI가 불확실성에 대한 이해와 리스크의 묘사를 개선할 수는 있지만, 역사적 현실에 대한 엄격한 보정의 필요성을 대체할 수는 없다고 결론짓습니다. 결국, 협력적 지능 설계는 학습의 과업과 새로운 정보를 수집하는 과업을 분리해야 하며, 불일치는 편향에 대한 치료제가 아니라 불확실성의 신호임을 인식해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.