← 최신 논문
💬 NLP

Policies Permitting LLM Use for Polishing Peer Reviews Are Currently Not Enforceable

이 논문은 현재 존재하는 모든 AI 텍스트 탐지기가 인간이 작성한 리뷰를 다듬기 위해 LLM 을 사용한 경우를 오인식하여 학술 부정행위 오고발의 위험이 있으므로, LLM 사용 허용 정책이 현실적으로 집행 불가능하며 AI 사용 추정치도 신중하게 해석해야 함을 보여줍니다.

원저자: Rounak Saha, Gurusha Juneja, Dayita Chaudhuri, Naveeja Sajeevan, Nihar B Shah, Danish Pruthi

게시일 2026-03-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Rounak Saha, Gurusha Juneja, Dayita Chaudhuri, Naveeja Sajeevan, Nihar B Shah, Danish Pruthi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🕵️‍♂️ 1. 배경: "수정만 하면 돼, 하지만 AI 는 쓰면 안 돼!"

최근 많은 학술 대회와 저널은 이런 규칙을 만들었습니다.

  • 규칙: "논문을 쓸 때 AI 를 써서 **문법이나 표현만 다듬는 것 (Polishing)**은 괜찮지만, 내용을 AI 가 대신 써주는 것은 절대 금지!"

마치 학교 숙제에서 "글쓰기 실력은 내가 해야 하지만, 맞춤법 교정기는 써도 돼"라고 하는 것과 비슷합니다.

🧪 2. 실험: "AI 감지기"가 얼마나 잘 작동할까?

연구팀은 이 규칙을 지킬 수 있는지 확인하기 위해, 5 만 개가 넘는 가짜 심사를 만들어 실험했습니다.

  • 상황 1 (완전 AI): AI 가 처음부터 끝까지 쓴 심사. (규칙 위반)
  • 상황 2 (혼합형): 사람이 쓴 후, AI 가 문법만 다듬어준 심사. (규칙 준수)
  • 상황 3 (인간): 사람이 직접 쓴 순수 심사.

그리고 현재 가장 유명한 **AI 감지기 5 개 (상용 프로그램 2 개, 오픈소스 3 개)**를 이 심사들에 투입해 보았습니다.

🎭 3. 결과: 감지기는 "눈이 멀었다"?

결과는 충격적이었습니다. 감지기는 규칙을 잘 지키는 '혼합형' 심사까지도 "AI 가 썼다!"라고 오인했습니다.

  • 비유: "수업 시간에 친구가 쓴 숙제를 내가 맞춤법만 고쳐서 제출했는데, 선생님이 **"너가 AI 로 다 썼구나! 징계한다!"**라고 소리치는 상황"입니다.
  • 통계: 감지기는 사람이 쓴 후 AI 로 다듬은 심사의 약 **3~9%**를 잘못해서 "AI 가 쓴 것"으로 잡아냈습니다.
  • 문제: 만약 이 감지기를 그대로 쓰면, 규칙을 잘 지키는 성실한 심사위원들이 부당한 누명을 쓰고 징계를 받을 위험이 매우 큽니다.

🛠️ 4. 더 좋은 방법을 찾아봤는데? (논문, 컨텍스트 활용)

연구팀은 "아니면 심사 대상 논문 (Paper) 을 같이 보여주면 감지가 잘 될까?"라고 생각했습니다.

  • 시도: "이 논문을 읽고 쓴 리뷰니까, 논문 내용과 비교해 봐!"
  • 결과: 조금은 나아졌지만, 여전히 오류가 너무 많아서 신뢰할 수 없었습니다. 마치 "수영장에서 물에 젖은 옷을 입은 사람을 감시하는 것"과 비슷해서, 진짜 범인을 잡으려다 innocent한 사람까지 다 잡는 꼴이었습니다.

🎭 5. "위장"까지 했을 때는? (Humanization)

심지어 AI 가 쓴 글을 사람이 다시 다듬어서 "인간이 쓴 것처럼" 보이게 만드는 도구 (Humanizer) 를 썼을 때는?

  • 결과: 감지기는 완전히 당황해서 **"모두 인간이 쓴 거야!"**라고 말해버렸습니다.
  • 비유: 가짜 지폐를 진짜처럼 가공해서 감지기에 넣으니, 감지기가 "이건 진짜 돈이야!"라고 착각한 셈입니다.

💡 6. 결론: "규칙은 있지만, 감시할 수 없다"

이 논문의 핵심 결론은 다음과 같습니다.

  1. 현재 기술로는 'AI 수정 허용' 정책을 지킬 수 없다: 감지기가 "AI 가 썼다"라고 할 때, 그게 진짜 AI 가 쓴 건지, 아니면 사람이 쓴 걸 AI 가 다듬은 건지 구별할 수 없습니다.
  2. 잘못된 통계: 최근 "ICLR 2026 컨퍼런스 리뷰의 21% 가 AI 가 썼다"라는 뉴스가 있었습니다. 하지만 이 연구에 따르면, 그중 상당수는 사람이 쓴 걸 AI 가 다듬은 것일 가능성이 높습니다. 감지기가 과장해서 보고한 것입니다.
  3. 현실적인 조언: 만약 여러분이 심사위원이라면, AI 를 써서 문장을 다듬고 싶다면 매우 조심해야 합니다. 논문 원본을 AI 에게 주거나, "내용은 절대 바꾸지 마"라고 명확히 지시하지 않으면, AI 가 내용을 임의로 추가해서 감지에 걸릴 확률이 높아집니다.

🚀 요약

"지금 우리가 가진 AI 감시 카메라는 너무 어두워서, '문법만 고친 사람'과 'AI 가 다 쓴 사람'을 구별하지 못합니다. 그래서 지금 당장은 'AI 수정 허용'이라는 규칙을 감시하는 것은 불가능에 가깝습니다."

이 연구는 기술이 아직 이 복잡한 문제를 해결할 준비가 되지 않았음을, 그리고 우리가 AI 사용에 대한 통계를 너무 쉽게 믿으면 안 된다는 것을 경고합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →