← Últimos artículos
💬 NLP

Creation of the Estonian Subjectivity Dataset: Assessing the Degree of Subjectivity on a Scale

Este artículo presenta un nuevo conjunto de datos en estonio para la subjetividad a nivel de documento que contiene 1.000 textos calificados en una escala continua por anotadores humanos, al tiempo que evalúa la viabilidad y las limitaciones del uso de GPT-5 para la puntuación automatizada de la subjetividad en comparación con el juicio humano.

Autores originales: Karl Gustav Gailit, Kadri Muischnek, Kairit Sirts

Publicado 2026-06-08
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Karl Gustav Gailit, Kadri Muischnek, Kairit Sirts

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando medir cuánto "sabor" hay en un cuenco de sopa. Algunos cuencos son solo agua pura (hechos completamente objetivos), mientras que otros están cargados de especias, hierbas y la opinión personal del chef (completamente subjetivos). Durante mucho tiempo, los investigadores en el mundo de la computación y el lenguaje (Procesamiento de Lenguaje Natural) solo han podido preguntar: "¿Es esta sopa picante o no?" (Sí/No).

Este artículo trata sobre la construcción de una nueva y mucho más precisa taza medidora para el idioma estonio. En lugar de un simple "sí o no", los investigadores crearon un conjunto de datos donde calificaron 1.000 textos estonios diferentes en una escala deslizante de 0 a 100. Una puntuación de 0 es un hecho puro y sin adulterar (como un informe meteorológico), y 100 es pura opinión personal (como un desahogo sobre una mala película).

Aquí está la historia de cómo construyeron esto y lo que descubrieron, explicada de forma sencilla:

1. La Receta: Construyendo el Conjunto de Datos

El equipo quería ver si los humanos podían ponerse de acuerdo en estos "puntajes de sabor".

  • Los Ingredientes: Reunieron 1.000 textos. 300 eran noticias y artículos de opinión de internet, y 700 eran textos web aleatorios (como blogs, foros, recetas y anuncios).
  • Los Catadores: Contrataron a "catadores" humanos (anotadores) para que leyeran estos textos y les dieran una puntuación entre 0 y 100.
  • La Prueba Piloto: Antes de abordar los 1.000 textos, probaron el método con solo 60 textos. ¡Funcionó bien! Los catadores entendían la escala y podían distinguir entre un informe de noticias seco y una pieza de opinión picante.

2. La Prueba de Sabor: Los Humanos no siempre están de acuerdo

Cuando el equipo pidió a tres personas diferentes que calificaran los mismos 1.000 textos, los resultados fueron un poco desordenados.

  • El Problema de la "Subjetividad": Al igual que las personas tienen diferentes tolerancias al picante, las personas tienen diferentes ideas de lo que cuenta como subjetivo. Una persona puede pensar que una noticia con una cita es neutral, mientras que otra piensa que la cita la hace sesgada.
  • La Correlación: El acuerdo entre los humanos fue "moderado". No era terrible, pero tampoco era perfecto. A veces, una persona le daba a un texto una puntuación de 10 (muy factual) y otra le daba un 90 (muy opinada).
  • El Re-saboreo: Para solucionar esto, seleccionaron los 250 textos en los que los humanos estuvieron más en desacuerdo y pidieron a dos de los catadores que los calificaran de nuevo. Esta vez, el acuerdo mejoró mucho. Resultó que el orden en el que leían los textos importaba. Si leían un montón de desahogos enfadados, se volvían hiper-sensibles a la objetividad en el siguiente texto. Es como si comes un limón súper agrio, la siguiente pieza de fruta te sabe más dulce de lo que realmente es.

3. El Catador Robot: Entra GPT-5

Los investigadores luego hicieron una pregunta: "¿Puede un computador súper inteligente (una IA llamada GPT-5) hacer este trabajo tan bien como los humanos?"

  • El Experimento: Dejaron que la IA calificara todos los 1.000 textos.
  • El Resultado: La IA fue sorprendentemente consistente. Si le pedías que calificara el mismo lote de textos tres veces, daba casi las mismas respuestas cada vez (a diferencia de los humanos, cuyos estados de ánimo y contexto cambiaban sus puntuaciones).
  • La Diferencia: Sin embargo, la IA y los humanos no siempre veían las cosas de la misma manera.
    • Citas: Cuando un artículo de noticias citaba a alguien más, los humanos entendían que el autor solo estaba reportando hechos. La IA, sin embargo, veía la cita y pensaba: "¡Oye, esta persona está expresando una opinión!", por lo que le daba al texto una puntuación de subjetividad más alta.
    • Jerga: Los humanos amaban dar puntuaciones altas a los textos escritos en jerga o lenguaje de foros porque se sentían personales y emocionales. La IA estaba más enfocada en los hechos dentro de la jerga y le daba una puntuación más "objetiva".

4. El Veredicto Final

El artículo concluye que:

  1. El Conjunto de Datos es Real: Lograron crear el primer conjunto de datos estonio que mide la subjetividad en una escala de grano fino (0–100) en lugar de solo "sí/no".
  2. Los Humanos son Defectuosos pero Humanos: Los humanos pueden usar la escala, pero sus puntuaciones están influenciadas por lo que leyeron justo antes y su propia perspectiva personal.
  3. La IA es una Ayuda, no un Reemplazo: La IA (GPT-5) es excelente siendo consistente y rápida, pero "saborea" el texto de forma diferente a los humanos. Se pierde el matiz del tono y el contexto que los humanos sí captan.

En resumen: Puedes usar la IA para obtener rápidamente una idea general de qué tan subjetivo es un texto, pero si necesitas entender el sentimiento humano detrás de las palabras, todavía necesitas a un humano para hacer la cata. La IA y el humano son como dos chefs diferentes usando los mismos ingredientes pero siguiendo recetas ligeramente distintas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →