← 최신 논문
🤖 machine learning

mcdok at SemEval-2026 Task 13: Finetuning LLMs for Detection of Machine-Generated Code

이 논문은 SemEval-2026 태스크 13 에 참여하여 기계 생성 코드 탐지 및 출처 추적 문제를 해결하기 위해 기존 mdok 접근법을 코드 이해에 적합한 모델로 확장한 결과, 세 가지 하위 태스크 모두에서 경쟁력 있는 성능을 보였으나 최상위 시스템과의 격차를 줄이기 위해 추가 개선이 필요함을 제시합니다.

원저자: Adam Skurla, Dominik Macko, Jakub Simko

게시일 2026-04-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Adam Skurla, Dominik Macko, Jakub Simko

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🤖 "코딩하는 AI vs 인간 코더": mcdok 팀의 탐정 이야기

이 논문은 2026 년 SemEval(자연어 처리 경연대회) 의 13 번 과제에 참여한 'mcdok' 팀의 활동 기록입니다. 쉽게 말해, **"이 코드가 사람이 썼을까, 아니면 AI 가 썼을까?"**를 구별하는 기술을 개발한 이야기입니다.

마치 범인을 찾아내는 형사들이나, 위조 지폐를 감별하는 은행원 같은 역할을 했다고 생각하면 됩니다.


1. 왜 이 일이 중요할까요? (배경)

요즘 AI(거대 언어 모델) 가 코딩을 너무 잘해서, 사람이 쓴 코드와 AI 가 쓴 코드를 눈으로 구분하기가 점점 어려워졌습니다. 마치 고급 위조 화폐가 진짜 돈과 구별하기 힘들어진 것과 비슷하죠.

이번 경연대회에서는 세 가지 미션을 주었습니다:

  1. 미션 A (진위 여부 판별): "이 코드는 AI 가 썼을까, 사람이 썼을까?" (O/X 문제)
  2. 미션 B (범인 특정): "AI 가 썼다면, 어떤 AI 가족 (모델) 이 썼을까?" (10 가지 AI 종류 중 하나 찾기)
  3. 미션 C (혼합 감지): "이 코드는 100% 인간, 100% AI, 아니면 **혼합 (인간이 다듬고 AI 가 썼거나, AI 가 인간 흉내를 냄)**일까?" (4 가지 중 하나 찾기)

2. mcdok 팀은 어떻게 해결했나요? (해법)

이 팀은 이미 **텍스트 (글)**가 AI 가 쓴 것인지 감별하던 'mdok'이라는 기존 시스템을 가지고 있었습니다. 하지만 코드는 글과 달라서, 코드를 더 잘 이해하는 '전문가' 모델로 교체해야 했습니다.

그들은 마치 수사관들이 사건 유형에 따라 다른 전문 감식 장비를 꺼내 쓰는 것처럼, 각 미션마다 가장 적합한 AI 모델을 골라 훈련시켰습니다.

  • 미션 A (진위 판별): 범용적인 지능이 뛰어난 Gemma-3-27B 모델을 사용. (코드를 전반적으로 잘 이해하는 '만능 수사관')
  • 미션 B (범인 특정): 코드 생성에 특화된 CodeGemma-7B 모델을 사용. (특정 범인 (AI 모델) 의 지문을 잘 기억하는 '지문 감식관')
  • 미션 C (혼합 감지): 코딩에 아주 능통한 Qwen2.5-Coder-14B 모델을 사용. (미묘한 뉘앙스 (혼합) 를 포착하는 '세밀한 분석가')

핵심 기술: 이 모델들을 처음부터 다시 만드는 게 아니라, **기존에 잘 훈련된 모델을 '미세 조정 (Fine-tuning)'**했습니다. 마치 유능한 신입 사원을 뽑아 회사 업무에 맞춰 3 개월간 집중 교육을 시키는 것과 같습니다.

3. 결과는 어땠나요? (성과)

팀의 시스템은 세 가지 미션 모두에서 기존의 기본 모델 (CodeBERT) 보다 훨씬 잘 수행했습니다.

  • 성공 요인: 코드를 이해하는 데 특화된 모델을 골라낸 것이 큰 승리였습니다. 특히, AI 가 100% 확신할 때만 "AI 가 썼다"고 판단하도록 설정을 조정하자 성능이 크게 향상되었습니다. (마치 "100% 확실할 때만 범인 지목하기"로 규칙을 바꾼 것)
  • 한계점: 하지만 최상위권 팀들과는 여전히 차이가 있었습니다. 특히 AI 가 인간을 흉내 내는 '적대적 (Adversarial)' 코드를 구별하거나, 인간과 AI 가 섞인 '혼합' 코드를 찾아내는 것은 여전히 어렵습니다.

4. 비유로 정리하기 🧩

이 연구는 다음과 같이 비유할 수 있습니다.

상황: 어떤 미술관에서 진짜 그림AI 가 그린 위조 그림이 섞여 있습니다.

  • 기존 방식: 모든 그림을 똑같은 안경으로 보면 위조 그림을 잘 못 찾습니다.
  • mcdok 팀의 방식:
    • 미션 A: "진짜일까 가짜일까?"를 볼 때는 **고해상도 현미경 (Gemma)**을 썼습니다.
    • 미션 B: "누가 그렸을까?"를 볼 때는 **특정 화가들의 필적 분석서 (CodeGemma)**를 참조했습니다.
    • 미션 C: "혼합 그림을 찾아라!"를 볼 때는 **색채와 질감에 민감한 전문가 (Qwen)**를 투입했습니다.

결과: 그들은 위조 그림을 찾아내는 데 성공했지만, **완벽한 위조범 (최고급 AI)**을 100% 잡지는 못했습니다. 하지만 앞으로 더 훈련하면 훨씬 더 뛰어난 형사가 될 수 있다는 희망을 주었습니다.

5. 결론

이 논문은 **"AI 가 코딩을 잘할수록, AI 가 쓴 코드를 찾아내는 기술도 발전해야 한다"**는 메시지를 전달합니다. mcdok 팀은 기존 기술을 코딩 분야에 적용하여 좋은 성과를 냈지만, AI 와 인간의 경계가 더 흐려지는 미래에는 더 정교한 감식 기술이 필요하다고 말합니다.

이 연구는 AI 시대에 **진짜와 가짜를 구별하는 '디지털 보안'**의 중요성을 다시 한번 일깨워줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →