← Últimos artículos
🤖 machine learning

mcdok at SemEval-2026 Task 13: Finetuning LLMs for Detection of Machine-Generated Code

El sistema mcdok de SemEval-2026 Task 13 adapta el enfoque mdok para la detección de código generado por IA mediante el ajuste fino de modelos base especializados en código, logrando resultados competitivos en las tres subtasas aunque con margen de mejora frente a los sistemas líderes.

Autores originales: Adam Skurla, Dominik Macko, Jakub Simko

Publicado 2026-04-24
📖 4 min de lectura☕ Lectura para el café

Autores originales: Adam Skurla, Dominik Macko, Jakub Simko

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Hola! Imagina que acabamos de participar en una gran competición de detectives llamada "SemEval-2026". Nuestro equipo, llamado mcdok, se enfrentó a un misterio muy moderno: ¿Quién escribió este código de computadora? ¿Fue un humano o una Inteligencia Artificial (IA)?

Hoy en día, las IAs son tan buenas escribiendo programas que es casi imposible distinguirlas de los programadores humanos. Nuestro trabajo fue crear un "super-detective" capaz de atrapar a estas IAs.

Aquí te explico cómo lo hicimos, usando analogías sencillas:

1. El Problema: La "Falsificación" Perfecta

Imagina que alguien empieza a falsificar cuadros de famosos. Al principio, se nota que son falsos, pero con el tiempo, los falsificadores se vuelven tan buenos que incluso los expertos se confunden.
En el mundo de la programación, las IAs (como ChatGPT o sus hermanas) están "falsificando" código. A veces lo hacen solas, a veces lo hacen ayudadas por humanos (un híbrido), y a veces incluso intentan engañarnos modificando el código para parecer humano (esto se llama "adversarial").

2. Nuestra Estrategia: Entrenar a Nuevos Detectives

No inventamos la rueda. Ya teníamos un detective experto en detectar textos falsos (llamado mdok). Pero, como el código es diferente al texto normal (es más técnico y estructurado), decidimos entrenar a nuevos detectives especializados en este lenguaje.

En lugar de usar un solo detective para todo, creamos tres equipos diferentes, cada uno con un "cerebro" (modelo de IA) distinto, especializado en un tipo de caso:

  • Caso A (El Detective Básico):

    • La misión: Solo decir "Humano" o "Máquina".
    • El detective elegido: Un modelo llamado Gemma-3. Es como un detective generalista muy inteligente que, aunque no es un experto en código, aprendió rápido a ver las "huellas dactilares" de la IA.
    • Resultado: ¡Funcionó muy bien! Incluso mejor que los expertos en código.
  • Caso B (El Detective de Identidad):

    • La misión: No solo decir si es IA, sino decir qué IA lo hizo. ¿Fue "OpenAI"? ¿"Google"? ¿"Meta"? Hay 10 familias de IAs diferentes.
    • El detective elegido: Un modelo llamado CodeGemma. Es como un detective forense que conoce las "firmas" específicas de cada fábrica de IAs.
    • Resultado: Fue difícil (como encontrar a un criminal entre 11 sospechosos), pero nuestro detective fue mejor que los que ya existían.
  • Caso C (El Detective de Matices):

    • La misión: Distinguir entre 4 tipos: Humano puro, IA pura, Híbrido (humano + IA) y Adversarial (IA disfrazada de humano).
    • El detective elegido: Un modelo llamado Qwen2.5-Coder. Es un detective muy técnico, especializado en entender la lógica compleja de mezclas.
    • Resultado: Fue el más difícil, pero logramos detectar estas mezclas mejor que la mayoría de los otros equipos.

3. ¿Cómo los entrenamos? (La "Dieta" de los Detectives)

Para que estos detectores fueran buenos, no les dimos todo el código del mundo de golpe (sería demasiado pesado). Les dimos una dieta equilibrada:

  • Les mostramos ejemplos de código humano y de IA.
  • Les enseñamos a ignorar el "ruido" (código que no importa) y a centrarse en los patrones reales.
  • Usamos una técnica llamada QLoRA, que es como darle al detective "gafas de aumento" para aprender rápido sin necesitar una computadora gigante (ahorrando energía y tiempo).

4. Los Resultados: ¿Ganamos la medalla de oro?

No ganamos el primer lugar, pero nos fuimos con un podio muy honorable:

  • En el Caso A, fuimos el 10º de 81 equipos.
  • En el Caso B, fuimos el 13º de 34.
  • En el Caso C, fuimos el 5º de 32 (¡Top 5!).

Esto significa que nuestros detectores son muy competitivos y funcionan bien, aunque todavía hay margen para mejorar. A veces, el código es tan confuso que incluso nuestros mejores detectives se equivocan, especialmente cuando la IA intenta disfrazarse muy bien.

En Resumen

Nuestro trabajo demuestra que podemos adaptar detectores de texto para que se conviertan en detectives de código. Usamos diferentes "cerebros" para diferentes tipos de problemas y logramos resultados excelentes.

¿Por qué importa esto?
Porque en el futuro, necesitaremos saber si un código de seguridad bancaria, un sistema médico o un software crítico fue escrito por un humano responsable o generado automáticamente por una máquina. ¡Nuestros detectores son los primeros pasos para mantener el orden en este nuevo mundo digital!

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →