Generative AI systems conflate two distinct pregnancy-dating algorithms
이 연구는 생성형 AI 시스템이 두 가지 서로 다른 임신 주수 계산 알고리즘을 빈번하게 혼동하여 상당한 계산 오류와 오기입을 초래한다는 점을 밝히며, 이는 의료용 AI가 자신의 계산 경로를 투명하게 공개해야 할 결정적인 필요성을 강조한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 정확히 280일 동안 부풀어 오르는 케이크를 굽고 있다고 상상해 보세요. 당신에게는 케이크가 언제 완성될지 계산하는 두 가지 서로 다른 레시피가 있고, 오랫동안 모든 사람은 이 레시피들이 똑같이 생긴 쌍둥이라고 생각했습니다.
레시피 A (The "Calendar Shortcut" - 달력 지름길): 이것은 구식 방법으로, '네겔 법칙(Naegele's Rule)'으로 알려져 있습니다. 이것은 머릿속으로 할 수 있는 암산 기술과 같습니다. "달력에서 세 달을 뒤로 가고, 7일을 더한다." 빠르고 쉽며, 200년 넘게 사용되어 왔습니다.
레시피 B (The "Exact Count" - 정확한 계산): 이것은 280일 계산법입니다. 이것은 마치 모래시계의 모래알 하나하나를 세는 것과 같습니다. 지나가는 달에 며칠이 들어 있든 상관없이, 단순히 시작 날짜에 280일을 더하기만 하면 됩니다.
문제: 쌍둥이가 아니라 사촌이었다
이 논문의 저자들은 이 두 레시피가 사실 쌍둥이가 아니라 사촌이라는 사실을 발견했습니다. 우리의 달력은 이상하기 때문에(어떤 달은 30일이고, 어떤 달은 31일이며, 2월은 때때로 29일까지 있습니다), "달력 지름길"은 항상 "정확한 계산"과 같은 날에 도착하지 않습니다.
그들은 1812년부터 2025년까지의 모든 날짜를 대상으로 이를 테스트했습니다. 그 결과, 두 레시피가 서로 다른 예정일을 주는 경우가 **56%**에 달한다는 것을 발견했습니다. 지름길 방식은 보통 정확한 계산보다 1, 2, 또는 심지어 3일 더 늦었습니다. 결코 더 빠른 날짜를 주지는 않았으며, 그저 앞으로 밀려날 뿐이었습니다.
가장 큰 문제는 임신 기간이 **윤달(2월 29일)**을 통과할 때 발생합니다. 이 경우, 두 레시피는 절대 일치하지 않습니다. 정확한 계산은 그 추가된 하루를 포함하지만, 달력 지름길은 그 날을 그냥 건너뛰어 버립니다.
AI의 실수: "혼란에 빠진 요리사"
연구진은 다섯 가지의 인기 있는 AI 시스템(ChatGPT, Claude, Gemini 등)에게 제빵사 역할을 맡겨 이 예정일을 계산하게 했습니다. 그들은 AI가 이 두 레시피의 차이점을 알고 있는지 확인하고 싶었습니다.
결과는 다음과 같았습니다:
- 훌륭한 제빵사들: 두 개의 AI 시스템은 레시피가 다르다는 것을 깨달았습니다. 그들은 올바른 답을 내놓았고, "지름길을 사용하면 X일이 되지만, 정확히 280일을 계산하면 Y일이 됩니다"라고 설명했습니다.
- 혼란에 빠진 제빵사들: 세 개의 AI 시스템은 틀렸습니다. 그들은 마치 "달력 지름길"을 사용하는 것처럼 행동했지만(예: "세 달을 빼고 7일을 더했습니다"라고 말함), 실제로는 몰래 "정확한 계산" 수학을 사용하여 다른 답을 내놓았습니다. 또는, 두 방법이 명백히 다름에도 불구하고 두 방법이 같은 것이라고 주장했습니다.
이것은 마치 요리사가 당신에게 "지름길 레시피를 따르고 있다"라고 말하면서, 정작 재료를 잴 때는 몰래 저울을 사용하여 다른 결과를 내놓는 것과 같습니다. 그들은 자신이 설명한 방법과 실제로 사용한 방법을 **혼동(conflating)**하고 있었습니다.
이것이 왜 중요한가요?
저자들은 단일 임신에 있어서 1~3일의 차이는 의학적으로 큰 재앙이 아니라는 점을 지적합니다. 아기들은 자연적으로 넓은 범위의 날짜에 태어납니다.
하지만 이 연구는 임신 날짜 계산을 테스트 케이스로 사용하여 AI의 더 큰 문제를 보여줍니다. AI는 "생각"하거나 논리를 펼치는 것이 아니라, 자신이 본 패턴을 바탕으로 추측하는 것입니다. 오래된 교과서들이 이 두 레시피를 혼용했기 때문에, AI도 그것을 똑같이 배웠습니다.
논문은 만약 AI 도구가 당신에게 의학적 계산을 제공하려 한다면, 자신이 어떻게 그 답을 얻었는지에 대해 정직해야 한다고 결론짓습니다. 단순히 숫자만 주는 것이 아니라, "나는 정확한 280일 계산법을 사용했습니다" 또는 "나는 달력 지름길을 사용했습니다"라고 말하여 사용자가 무엇을 얻고 있는지 알 수 있게 해야 합니다. 만약 AI가 임신에 관한 이 간단한 수학 규칙조차 구분하지 못한다면, 미래에 더 위험한 계산에서도 유사한 실수를 저지를 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.