← Últimos artículos
💻 computer science

How Humans, Bots, and Agents Communicate About Vulnerabilities in Pull Requests

Este informe registrado describe un estudio empírico a gran escala que investiga cómo los humanos, los bots y los agentes de codificación se comunican sobre las vulnerabilidades en los pull requests mediante el análisis tanto de identificadores explícitos como del lenguaje de seguridad implícito a través de diversos artefactos de proyectos para comprender su impacto en los resultados de la revisión.

Autores originales: Pien Rooijendijk, Christoph Treude, Mairieli Wessel

Publicado 2026-06-29
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Pien Rooijendijk, Christoph Treude, Mairieli Wessel

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un sitio de construcción masivo y global donde miles de equipos construyen y reparan constantemente rascacielos digitales (software). En este mundo, hay tres tipos de trabajadores: Humanos (los arquitectos originales), Bots (robots automatizados que se encargan de tareas rutinarias como actualizar materiales) y Agentes de Codificación (asistentes de IA inteligentes que pueden escribir nuevos planos por su cuenta).

Este documento es un "informe registrado", lo que significa que es un plan detallado de un estudio que los investigadores están a punto de realizar. Quieren entender cómo estos tres tipos de trabajadores hablan sobre riesgos de seguridad (vulnerabilidades) cuando envían cambios a los planes de construcción (Pull Requests).

Aquí está el desglose de su plan utilizando analogías sencillas:

1. Las dos formas en que los trabajadores hablan del peligro

Cuando un trabajador encuentra una grieta en la pared o una viga débil, necesita señalarlo. Los investigadores notaron que los trabajadores hacen esto de dos maneras muy diferentes:

  • El método de la "Tarjeta de Identificación Oficial" (Referencias Explícitas):
    A veces, un trabajador señala un peligro específico y dice: "Esto es CVE-2024-1234". Es como mostrar un código de barras o un número de serie. Todo el mundo sabe exactamente qué significa ese número específico porque figura en una base de datos gigante y oficial.

    • La observación del documento: Estudios previos se centraron principalmente solo en estas "tarjetas de identificación".
  • El método de la "Advertencia Casual" (Señales Implícitas):
    Otras veces, un trabajador simplemente dice: "Oye, esta puerta podría permitir la entrada de personas no autorizadas", o "Esta tubería parece que podría tener una fuga de datos SQL". Describen el problema en lenguaje sencillo sin usar un número de identificación específico.

    • La observación del documento: Los investigadores sospechan que, al ignorar estas "advertencias casuales", estamos perdiendo una gran parte de las conversaciones de seguridad.

2. La gran pregunta: ¿Quién dice qué?

Los investigadores quieren saber: ¿Hablan los Humanos, los Bots y los Agentes de IA de forma diferente sobre la seguridad?

  • ¿Los Agentes de IA (los nuevos en el barrio) usan más "Tarjetas de Identificación Oficiales" porque están programados para ser precisos?
  • ¿Los Humanos dependen más de las "Advertencias Casuales" porque entienden mejor el contexto?
  • ¿Los Bots se ciñen a las reglas y solo usan las identificaciones?

3. Las tres cosas que planean investigar

El estudio se basa en tres preguntas principales (Preguntas de Investigación):

  • RE1: La Distribución (¿Quién está hablando?)
    Contarán con qué frecuencia cada tipo de trabajador utiliza "IDs Oficiales" frente a "Advertencias Casuales" en diferentes partes de la conversación (el título de la solicitud, la descripción o los comentarios).

    • Analogía: Es como contar cuántas veces el Arquitecto, el Robot y el Asistente de IA usan un código de seguridad formal frente a simplemente gritar "¡Cuidado!" en la sala de descanso.
  • RE2: El Control de Realidad (¿Es real el peligro?)
    Esta es la parte más crítica. El hecho de que alguien diga que hay un peligro, no significa que lo haya.

    • Los investigadores utilizarán un "Escáner de Seguridad" (una herramienta llamada Semgrep) para examinar los cambios reales en el código.
    • Quieren ver: Si una IA dice "He arreglado un agujero de seguridad", ¿realmente arregló un agujero? ¿O simplemente hizo una afirmación que no era cierta?
    • Analogía: Si un trabajador dice "He reforzado el puente", los investigadores inspeccionarán físicamente el puente para ver si realmente es más fuerte, o si el trabajador solo pintó encima de una grieta.
  • RE3: La Reacción (¿Cómo responde la gente?)
    ¿Cómo afecta la forma en que se describe el peligro a la reacción del equipo?

    • Si un trabajador utiliza un "ID Oficial" formal, ¿los revisores confían en él más rápido y fusionan el cambio con mayor rapidez?
    • Si un trabajador utiliza una "Advertencia Casual", ¿esto provoca un debate más largo, más preguntas o es rechazado porque es más difícil de verificar?
    • Analogía: ¿El capataz de la construcción escucha de inmediato cuando muestras un código de barras, o te hace esperar mientras discuten si tu descripción de la fuga es precisa?

4. Cómo lo harán (Su caja de herramientas)

  • El Conjunto de Datos: Utilizarán una colección masiva de más de 33,000 pull requests de proyectos de código abierto populares. Esto incluye el trabajo de agentes de IA famosos como GitHub Copilot, Devin y Cursor.
  • La Detección:
    • Para los "IDs Oficiales", utilizarán una lupa digital (Expresiones Regulares) para encontrar patrones como "CVE-..." o "GHSA-...".
    • Para las "Advertencias Casuales", utilizarán una lista de palabras clave de seguridad (como "inseguro", "hack", "bypass") para encontrar discusiones en lenguaje natural.
  • La Verificación: Dado que las computadoras pueden cometer errores, utilizarán una IA inteligente (Gemini) y expertos humanos para verificar una muestra de los hallazgos y asegurar que las "señales de peligro" sean reales.

5. Los Límites (Lo que este estudio NO te dirá)

Los investigadores son muy honestos sobre los límites de su estudio:

  • Solo están mirando proyectos populares (aquellos con muchas "estrellas" o seguidores). Los proyectos pequeños y silenciosos podrían tener reglas diferentes.
  • Solo están mirando GitHub. No están revisando correos electrónicos privados, salas de chat u otros sitios web donde se puedan discutir problemas de seguridad.
  • Están analizando la conversación y el código, pero no pueden garantizar que su "Escáner de Seguridad" detectará cada posible falla en el mundo.

Resumen

En resumen, este documento es un plano para un estudio que pregunta: En el sitio de construcción digital del futuro, ¿cómo hablan los humanos, los robots y la IA sobre la seguridad? ¿Utilizan códigos formales o lenguaje sencillo? Y, ¿cambia la forma en que hablan el hecho de que sus afirmaciones de seguridad sean creídas o ejecutadas? El objetivo es asegurarnos de que no estamos ignorando las "advertencias casuales" solo porque no tienen un código de barras adjunto.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →