← Últimos artículos
💬 NLP

ZeroR@CHiPSAL 2026: Two-Stage Vision-Language Adaptation with Contrastive Learning for Nepali Meme Classification

El equipo ZeroR@CHiPSAL 2026 logró clasificaciones de alto nivel en la clasificación de memes nepalíes mediante el empleo de un proceso de adaptación de visión-lenguaje de dos etapas utilizando Qwen3-VL-8B-Instruct con aprendizaje contrastivo y ajuste fino LoRA para eliminar las dependencias de OCR y gestionar eficazmente la detección de discurso de odio y sentimiento multimodal de bajos recursos.

Autores originales: Nitiz Khanal

Publicado 2026-08-03
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Nitiz Khanal

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina el internet como una plaza de pueblo digital, gigante y caótica, donde todos gritan, susurran y dibujan cuadros en las paredes. En este pueblo, los "memes" son la forma más popular de comunicarse. Son como bromas locales que mezclan una imagen divertida con un pie de foto ingenioso. Pero a veces, estas bromas se convierten en armas, escondiendo discursos de odio o acoso dentro de una risa. Lo complicado es que una imagen puede parecer inocente, pero el texto le da un significado terrible, o viceversa. Para detener esto, las computadoras necesitan aprender a "leer" tanto la imagen como las palabras al mismo tiempo, comprendiendo la historia completa, no solo las partes. Este es un desafío enorme para las computadoras, especialmente cuando las bromas se cuentan en idiomas que no conocen bien, como el nepalí, donde el sistema de escritura (llamado Devanagari) se dibuja directamente sobre las imágenes.

Los científicos han estado tratando de construir mejores "detectives digitales" para detectar memes dañinos. Usualmente, intentan construir una línea de ensamblaje larga: primero, una máquina lee el texto de la imagen (como un escáner), luego otra máquina lo traduce, y finalmente, una tercera máquina decide si es malo. Pero esto es como intentar resolver un rompecabezas desarmándolo pieza por pieza; podrías perder la imagen del todo. Este artículo presenta un nuevo equipo de detectives que no necesita la línea de ensamblaje. En su lugar, utilizan un cerebro superinteligente y todo en uno que puede mirar la imagen y leer el texto simultáneamente, tal como lo hace un humano. Los investigadores probaron este cerebro con memes en nepalí para ver si podía detectar el discurso de odio y determinar si el estado de ánimo era feliz, triste o neutral.

La historia del artículo: Un entrenamiento de detective en dos etapas

Los investigadores, Nitiz Khanal y su equipo, entraron en una competencia llamada CHiPSAL 2026, donde el objetivo era construir el mejor sistema para detectar el odio y analizar los sentimientos en memes en nepalí. No solo lanzaron una computadora al problema; diseñaron un ingenioso campamento de entrenamiento de dos etapas para su modelo de IA.

La estrella del equipo: Qwen3-VL
En el corazón de su sistema se encuentra una IA masiva y preentrenada llamada Qwen3-VL-8B-Instruct. Piensa en este modelo como un estudiante genio que ya ha leído millones de libros y visto millones de imágenes de todo el mundo. Crucialmente, este estudiante ya sabe cómo leer el alfabeto Devanagari usado en Nepal, por lo que los investigadores no necesitaron enseñarle a leer desde cero ni usar una herramienta separada para escanear el texto. Podía mirar un meme y "ver" las palabras escritas en la imagen inmediatamente.

Etapa 1: El escritor creativo
En la primera etapa de entrenamiento, el equipo enseñó a la IA a actuar como un escritor creativo. Le mostraron miles de memes y le pidieron que escribiera la respuesta: "¿Odio?" o "Seguro", o "Negativo", "Neutral" o "Positivo". Para hacer esto sin romper la computadora, utilizaron una técnica llamada LoRA (Adaptación de Bajo Rango). Imagina que la IA es una biblioteca gigante con millones de libros. En lugar de reescribir cada uno de los libros para enseñarle sobre memes en nepalí, los investigadores simplemente añadieron algunas notas adhesivas (capas pequeñas y entrenables) a los estantes. Esto permitió que la IA aprendiera la nueva tarea de manera rápida y eficiente.

Sin embargo, los datos que tenían eran desordenados. Había muchos más memes "Seguros" que de "Odio", y muchos más memes "Neutrales" que "Positivos" o "Negativos". Es como intentar aprender a identificar animales raros cuando solo tienes una foto de un tigre pero mil fotos de gatos. Para solucionar esto, el equipo utilizó sobremuestreo (creando copias extra de los memes raros) y aumento de imagen (volteando, rotando y aclarando las imágenes) para que la IA no solo memorizara las imágenes, sino que realmente aprendiera los patrones. Para la tarea de sentimiento de tres clases, también usaron un truco matemático especial llamado Focal Loss, que le decía a la IA que prestara especial atención a los ejemplos difíciles en los que fallaba constantemente.

Etapa 2: El entrenador estricto
La primera etapa fue buena, pero los investigadores querían que la IA fuera aún más aguda. En la segunda etapa, añadieron un entrenador de "aprendizaje contrastivo". Esto es como un juego de "encuentra las diferencias". El entrenador le mostraba a la IA dos memes que eran ambos de "Odio" y decía: "¡Estos dos pertenecen juntos!". Luego, mostraba un meme de "Odio" y uno "Seguro" y decía: "¡Estos dos son totalmente diferentes! ¡Sepáralos!". Esto ayudó a la IA a aprender a agrupar ideas similares estrechamente y a empujar las ideas diferentes lejos entre sí en su mente. Esta etapa no solo pedía una respuesta; obligaba a la IA a entender la forma de los datos, haciendo que sus decisiones fueran más robustas.

El veredicto final: Mezclando las puntuaciones
Cuando llegó el momento del examen final, el equipo no solo eligió la respuesta de la Etapa 1 o la Etapa 2. Crearon un reunión de equipo. Tomaron la puntuación de probabilidad del "Escritor Creativo" (Etapa 1) y la puntuación del "Entrenador Estricto" (Etapa 2) y las mezclaron con un peso especial. Probaron diferentes ratios de mezcla en un conjunto de práctica para encontrar el equilibrio perfecto que diera la puntuación más alta.

Lo que encontraron

Los resultados fueron impresionantes. El sistema del equipo obtuvo el 2do lugar en la tabla de clasificación oficial para la tarea de detección de discurso de odio, con una puntuación (llamada Macro F1) de 0.797. Esto significa que el sistema fue muy bueno detectando contenido dañino, incluso con el complicado desequilibrio de clases. Para la tarea de análisis de sentimiento (figurar si un meme era positivo, negativo o neutral), ocuparon el 4to lugar en la tabla con una puntuación de 0.518.

Los investigadores descubrieron que el enfoque de dos etapas era la salsa secreta. Si solo hubieran usado la primera etapa (solo escribir la respuesta), su puntuación habría sido más baja. Añadir la segunda etapa (el aprendizaje contrastivo) impulsó significativamente su rendimiento. También descubrieron que las dos tareas necesitaban estilos de entrenamiento diferentes. La tarea de discurso de odio era un poco más directa, pero la tarea de sentimiento era mucho más difícil de aprender porque las líneas entre "neutral" y "positivo" o "negativo" son a menudo borrosas, especialmente con el humor. El modelo de sentimiento necesitaba reglas mucho más estrictas (regularización) para evitar que se confundiera.

Por qué esto importa (y qué es lo que no)

Este artículo sugiere que para idiomas de bajos recursos como el nepalí, usar un modelo potente de visión y lenguaje todo en uno que entienda nativamente la escritura es un cambio de juego. Demuestra que no necesitas una cadena complicada de herramientas (como escáneres de texto y traductores separados) para entender los memes; un solo modelo inteligente puede hacerlo de extremo a extremo.

Sin embargo, el autor señala cuidadosamente que su sistema no es perfecto. Admiten que la IA a veces pierde el contexto cultural profundo. Por ejemplo, un meme puede presentar una figura histórica o un chiste cultural específico que parece inofensivo para la IA, pero que es ofensivo para un nepalí. La IA es inteligente, pero aún no tiene la experiencia vivida de la cultura. También señalan que debido a que el conjunto de datos era relativamente pequeño (alrededor de 1,000 memes por tarea), existe el riesgo de que el modelo haya memorizado los datos de entrenamiento en lugar de aprender verdaderamente, y que los resultados podrían variar si comenzaran de nuevo con una semilla aleatoria diferente.

Al final, este trabajo muestra un camino prometedor: enseñar a los modelos de IA grandes e inteligentes a entender el mundo desordenado, divertido y a veces peligroso de los memes en idiomas que han sido dejados atrás por la tecnología. Es un paso hacia hacer que la plaza del pueblo digital sea más segura e inclusiva para todos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →