← 최신 논문
💬 NLP

LLM assisted writing deserves empirical evaluation

이 논문은 69,000편 이상의 보건 정보학 논문에 대한 분석을 인용하며, 도구 사용이 더 집중된 발표, 더 넓은 인용, 그리고 전 세계적으로 분산된 저자 구성과 연결된다는 점을 들어, LLM 지원 작문은 탐지 문제로 다뤄지기보다 학술적 질과 책임성에 기반하여 평가되어야 한다고 주장한다.

원저자: Xuan Zhong Feng, Yi Lin, Yiye Zhang, Chunhua Weng, Yifan Peng

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xuan Zhong Feng, Yi Lin, Yiye Zhang, Chunhua Weng, Yifan Peng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

과학은 언제나 하나의 대화였으며, 국경과 언어를 넘어 발견을 공유하기 위해 명확한 글쓰기에 의존해 왔습니다. 수십 년 동안 연구자들은 자신의 연구가 전 세계 공동체에 이해될 수 있도록 멘토, 전문 편집자, 그리고 번역 서비스에 의존해 왔습니다. 오늘, 이 대화에 새로운 참여자가 합류했습니다. 바로 거대 언어 모델입니다. 이들은 방대한 양의 텍스트를 학습하여 인간의 언어를 놀라운 유창함으로 읽고, 요약하고, 다시 쓸 수 있는 컴퓨터 프로그램입니다. 이러한 도구들이 실험실과 사무실에서 흔해짐에 따라, 과학계 내에서 이들의 역할에 대한 논쟁이 생겨났습니다. 많은 이들은 이들을 사용하는 것이 아이디어의 진정한 저자를 숨기거나, 오류를 도입하거나, 연구의 질을 떨어뜨릴 수 있다고 우려합니다. 결과적으로, 현재 논의의 상당 부분은 기계가 논문을 쓰는 데 도움을 주었는지 여부를 감지하는 데 집중되어 있으며, 이 문제를 주로 감시와 단속의 문제로 다루고 있습니다. 그러나 이러한 탐지에 대한 집중은 더 중요한 질문을 간과할 수 있습니다. 즉, 이러한 도구의 실제 사용이 과학이 소통되는 방식과 누가 그 과정에 참여할 수 있는지를 어떻게 변화시키고 있는가 하는 점입니다.

이에 답하기 위해, 와일 코넬 의과대학(Weill Cornell Medicine)과 컬럼비아 대학교의 연구진은 이론보다는 증거를 살펴보기로 했습니다. 그들은 의료 및 공중 보건 분야에서 데이터와 기술이 어떻게 사용되는지를 다루는 헬스 인포매틱스(health informatics) 분야의 69,209편이라는 방대한 논문 모음을 조사했습니다. 연구진은 이 논문들이 어떻게 다른지 확인하기 위해 세 그룹으로 나누었습니다. 첫 번째 그룹은 가장 발전된 챗봇이 공개되기 전인 2022년 말 이전에 작성된 논문들로 구성되었습니다. 두 번째 그룹은 그 날짜 이후에 작성되었으나 이러한 도구를 사용한 흔적이 없는 논문들을 포함했습니다. 세 번째 그룹은 동일한 최근 시기에 작성되었으나 연구진이 거대 언어 모델의 도움을 받은 것으로 식별한 논문들로 구성되었습니다. 이러한 지원을 받은 논문들을 찾아내기 위해, 그들은 인간의 글쓰기와 AI가 재작성하거나 생성한 텍스트 사이의 미묘한 차이를 인식하도록 훈련된 특수 컴퓨터 프로그램을 사용했습니다.

분석 결과, 이러한 도구의 도움을 받은 논문들은 비판자들이 흔히 우려하는 것처럼 질이 낮거나 진지함이 결여된 작업이 아니었습니다. 대신, 데이터는 다른 현실을 보여주었습니다. 이 논문들은 발표 방식에 있어 더 집중도가 높은 경향을 보였습니다. 일반적인 과학 논문은 여러 가지 다른 주제를 넘나들며 방황할 수 있는 반면, AI의 도움을 받은 논문들은 하나의 명확한 주제에 더 밀접하게 밀착되어 있었습니다. 논문의 제목과 요약은 연구의 주요 주제와 긴밀하게 일치하였으며, 이는 독자들이 연구가 정확히 무엇에 관한 것이고 광범위한 분야 내에서 어디에 위치하는지 이해하는 것을 더 쉽게 만들었습니다. 이러한 명확함이 아이디어의 독창성이 떨어졌음을 의미하는 것은 아니었습니다. 오히려, 이 도구들이 저자들이 확립된 과학적 대화 속에 자신의 연구를 더 정밀하게 배치하도록 도왔음을 시사했습니다.

또 다른 중요한 변화는 이 논문들이 다른 연구를 인용하는 방식에서 나타났습니다. AI의 도움을 받은 논문들은 도움 없이 작성된 논문들보다 더 많은 출처를 인용했으며, 그 출처들은 더 넓은 범위의 주제를 다루고 있었습니다. 이 발견은 기계가 단순히 글쓰기를 빠르게 만들 뿐 가치를 더하지 못한다는 생각을 반박합니다. 이는 연구자들이 복잡한 텍스트를 요약하거나 새로운 검색어를 생성함으로써, 아마도 이전에는 찾지 못했을 문헌들을 탐색하는 데 이러한 도구들을 사용하고 있음을 시사합니다. 그러나 연구진은 인용 목록이 길다고 해서 그것이 반드시 연구가 더 깊거나 훌ert다는 것을 의미하지는 않는다고 언급했습니다. 참고 문헌 목록은 폭넓지만 얕을 수도 있고, 본문의 핵심 주장과 느슨하게 연결된 인용들만 포함할 수도 있습니다. 도구들은 광범한 정보의 그물을 넓게 펼치는 것을 쉽게 만들지만, 가장 관련성 있고 정확한 출처를 선택하는 책임은 여전히 인간 저자에게 남아 있습니다.

아마도 가장 놀라운 차이는 이 논문들을 누가 쓰고 있는가에서 발견되었을 것입니다. 연구에 따르면 AI의 도움을 받은 논문들은 제1저자가 영어가 모국어가 아닌 국가에 기반을 두고 있을 가능성이 더 높았습니다. 또한, 서로 다른 대륙 간의 연구자 간 협업 수준이 더 높았으며, 저소득 및 중저소득 경제권 출신의 저자들도 더 많이 포함되어 있었습니다. 이러한 패턴은 이 도구들이 과학자들이 국제 학술지에 논문을 발표하는 것을 어렵고 비용이 많이 들게 만드는 언어 장벽을 극복하도록 돕는 가교 역할을 할 수 있음을 시사합니다. 편집과 번역에 대한 온디맨드(on-demand) 지원을 제공함으로써, 이 기술은 경기장을 평평하게 만들어 더 다양한 목소리가 글로벌 과학 대화에 참여할 수 있도록 하고 있을지도 모릅니다.

이러한 초점의 변화, 인용 습관, 그리고 저자 구성의 변화에도 불구하고, 연구의 가시성과 영향력은 안정적으로 유지되었다는 점을 연구는 발견했습니다. 논문을 작성할 때 AI의 도움을 받으면 무시되거나 인용이 적게 될 것이라는 흔한 우려가 있습니다. 데이터는 이를 뒷받-지 않았습니다. 연구진이 논문 발표 후 인용이 얼마나 빨리 이루어지는지를 비교했을 때, AI의 도움을 받은 논문들은 도움 없이 작성된 논문들과 똑같이 성과를 냈습니다. 또한 이들은 다른 그룹들과 마찬가지로 높은 명성을 가진 학술지에 게재되었습니다. 이는 과학계가 이러한 논문들을 거부하고 있는 것이 아니라, 전통적인 작업과 동일한 속도로 읽히고 인정받고 있음을 나타냅니다.

연구진은 인공지능에 대한 과학계의 대화가 바뀌어야 한다고 결론지었습니다. 사람들이 이러한 도구를 사용하는 것을 잡아내거나 "실제" 학술 활동과 "보조를 받은" 작업을 분리하려고 노력하기보다는, 과학계는 연구 자체의 질에 집중해야 합니다. 이 연구는 이러한 도구들이 본질적으로 선하거나 악한 것이 아니라, 마치 맞춤법 검사기나 통계 소프트웨어 패키지처럼 글쓰기 과정의 새로운 일부일 뿐이라는 점을 시사합니다. 도구의 효과는 전적으로 그것이 어떻게 사용되느냐에 달려 있습니다. 만약 이 도구들이 저자들이 더 명확하게 소통하고 더 다양한 관점을 포함하도록 돕는다면, 그것은 선한 영향력을 미치는 강력한 힘이 될 수 있습니다. 만약 편법을 쓰거나 오류를 숨기는 데 사용된다면, 해로울 수 있습니다. 증거는 이 도구들이 이미 과학이 쓰여지는 방식과 누가 글을 쓰는지를 재편하고 있음을 보여주며, 최선의 길은 소프트웨어를 사용하여 초안을 잡았는지 여부가 아니라 그 작업의 정확성과 무결성을 바탕으로 판단하는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →