← Últimos artículos
💻 computer science

Effective Performance Measurement: Challenges and Opportunities in KPI Extraction from Earnings Calls

Este artículo aborda los desafíos de extraer Indicadores Clave de Rendimiento (KPI) de transcripciones no estructuradas de conferencias de resultados mediante la introducción de nuevas métricas de referencia, la demostración de las limitaciones de los modelos entrenados en documentos estructurados de la SEC y la propuesta de un sistema basado en modelos de lenguaje grande verificado por humanos que logra una precisión del 79,7% en la extracción de información abierta.

Autores originales: Rasmus T. Aavang, Rasmus Tjalk-Bøggild, Alexandre Iolov, Giovanni Rizzi, Mike Zhang, Johannes Bjerva

Publicado 2026-05-06
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Rasmus T. Aavang, Rasmus Tjalk-Bøggild, Alexandre Iolov, Giovanni Rizzi, Mike Zhang, Johannes Bjerva

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Imagen: El "Informe Formal" frente a la "Llamada Telefónica Amigable"

Imagina que estás tratando de entender cómo le va a una empresa. Tienes dos fuentes principales de información:

  1. El Documento de la SEC (El Informe Formal): Esto es como un formulario de impuestos rellenado. Es estricto, sigue una plantilla rígida, utiliza casillas específicas y no deja espacio para la creatividad. Si le pides a una computadora que lea esto, es como leer una hoja de cálculo; es fácil encontrar los números porque siempre están en el mismo lugar.
  2. La Llamada de Resultados (La Llamada Telefónica Amigable): Esto es como una entrevista en vivo en la radio con el CEO y el CFO de la empresa. Están hablando con los inversores, respondiendo preguntas, contando historias y, a veces, corrigiendo errores sobre la marcha. No hay casillas, no hay plantillas y el lenguaje es conversacional. Un minuto están hablando de "ingresos" y al siguiente están bromeando sobre un "crecimiento récord" o aclarando un error matemático.

El Problema:
Los investigadores descubrieron que, aunque las computadoras son excelentes leyendo los "Informes Formales" (documentos de la SEC), son terribles entendiendo las "Llamadas Telefónicas Amigables" (llamadas de resultados). Las computadoras se confunden con la jerga, el diálogo constante y la falta de estructura.

La Misión: Construir un Mejor Traductor

El equipo quería ver si podían construir un sistema que pudiera escuchar estas llamadas telefónicas desordenadas y extraer los números importantes (Indicadores Clave de Desempeño, o KPI) tan bien como un experto humano.

Organizaron una "carrera" entre dos tipos de IA:

  1. La IA de la "Antigua Escuela" (Codificadores): Estos son como bibliotecarios que han memorizado las reglas estrictas de los "Informes Formales". Intentaron aplicar esas mismas reglas estrictas a las "Llamadas Telefónicas Amigables".
  2. La IA de la "Nueva Escuela" (Modelos de Lenguaje Grande o LLM): Estos son como becarios superinteligentes que han leído casi todo en internet. En lugar de seguir un manual de reglas rígido, utilizan el "contexto" (el flujo de la conversación) para adivinar cuáles son los números importantes.

El Experimento: Los Tres Conjuntos de Datos

Para probar sus ideas, crearon tres nuevos "campos de entrenamiento" (conjuntos de datos):

  • SECB: Una prueba utilizando los antiguos y estrictos "Informes Formales" para ver qué tan bien maneja la IA las reglas.
  • ECB: Una colección masiva de "Llamadas Telefónicas Amigables" (sin etiquetar).
  • ECB-A: Una pequeña muestra de alta calidad de llamadas telefónicas que un experto humano etiquetó cuidadosamente. Piensa en esto como la "Hoja de Respuestas" del examen.

Los Resultados: ¿Quién Ganó la Carrera?

1. Los "Bibliotecarios" de la "Antigua Escuela" Fallaron:
Cuando los investigadores intentaron usar la IA entrenada en los estrictos "Informes Formales" para leer las "Llamadas Telefónicas Amigables", falló miserablemente.

  • Analogía: Es como intentar usar un detector de metales para encontrar un tipo específico de pez en el océano. El detector de metales es excelente para encontrar metales en la playa (los informes formales), pero solo zumba inútilmente cuando lo llevas bajo el agua (las llamadas telefónicas). La IA no pudo manejar el cambio del texto rígido a la conversación desordenada.

2. Los "Becarios" de la "Nueva Escuela" Mostraron Promesa:
Los investigadores luego utilizaron los LLM superinteligentes (como Llama, Qwen y Gemini) con un "prompt" especial (un conjunto de instrucciones) para actuar como el extractor.

  • La Buena Noticia: Estos modelos fueron mucho mejores entendiendo el contexto. Podían darse cuenta de que los "ingresos de iPhone" en marzo son el mismo concepto que las "ventas de iPhone" en junio, incluso si las palabras eran ligeramente diferentes.
  • La Mala Noticia: No eran perfectos. Aunque entendían muy bien el significado (comprensión semántica), a veces luchaban con la redacción exacta (coincidencia exacta).
    • Analogía: Imagina a un estudiante tomando un examen. La IA de la "Antigua Escuela" obtuvo un 0% porque no sabía que las preguntas eran diferentes. La IA de la "Nueva Escuela" obtuvo una puntuación alta en la parte del ensayo (entendió el concepto) pero perdió puntos en la sección de opción múltiple porque escribió la respuesta con una ortografía ligeramente diferente a la que esperaba el profesor.

El Sistema de "Humano en el Bucle"

Dado que la IA no era perfecta, los investigadores construyeron un sistema que combina la IA con la lógica humana:

  1. Extracción: La IA escucha la llamada y extrae números y etiquetas.
  2. Agrupación: El sistema agrupa respuestas similares. (Por ejemplo, si una IA dice "Ventas de iPhone" y otra dice "Ingresos de iPhone", el sistema se da cuenta de que son lo mismo y las agrupa).
  3. Verificación Humana: Hicieron que humanos revisaran los resultados finales.
    • Resultado: El sistema fue 79.7% preciso. Esto significa que de cada 100 números que el sistema extrajo, aproximadamente 80 eran correctos.

Por Qué Esto Importa (Según el Documento)

El documento destaca un momento específico y complicado en una llamada de resultados real (que involucra a una empresa llamada Lyft).

  • El Escenario: La empresa publicó un informe con un número incorrecto. El precio de las acciones subió. Luego, durante la llamada telefónica, el CFO dijo: "Espera, eso fue un error, el número es en realidad más bajo". El precio de las acciones se desplomó inmediatamente.
  • La Lección: La "Llamada Telefónica Amigable" contiene la verdad en tiempo real que el "Informe Formal" pasa por alto. Si un sistema automatizado no puede leer la llamada, los inversores se pierden la información más crítica.

Las Limitaciones (Lo Que el Documento Admite)

  • El "Estándar de Oro" no es perfecto: Debido a que hay muy pocos expertos que puedan anotar estas llamadas, solo tuvieron a un experto etiquetando los datos. Esto significa que la "Hoja de Respuestas" podría haber pasado por alto algunas cosas, haciendo que la IA parezca peor de lo que realmente es.
  • Las Culturas Empresariales Varían: Algunas empresas (como JPMorgan) hablan muy formalmente, mientras que otras son muy informales. El sistema funciona mejor con algunas que con otras.
  • Riesgo: Si este sistema comete un error, podría hacer que los inversores tomen malas decisiones financieras. El documento advierte que la supervisión humana sigue siendo necesaria.

Resumen en Una Frase

El documento muestra que, aunque las computadoras son excelentes leyendo formularios financieros estrictos, luchan con las llamadas de resultados desordenadas, pero los nuevos modelos de IA "superinteligentes" están mejorando mucho en la comprensión de la conversación, ofreciendo una vía prometedora (aunque aún no perfecta) para rastrear el desempeño de las empresas en tiempo real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →