← Últimos artículos
💻 computer science

Domain Agnostic Text Redaction from Natural Language Rules using Instruction Tuning

Este artículo presenta un marco de redacción de texto explicable y agnóstico al dominio que aprovecha modelos de lenguaje ajustados por instrucciones para identificar y redactar información sensible basándose en reglas de lenguaje natural definidas por el usuario, proporcionando justificaciones transparentes para cada acción para asegurar la auditabilidad y una alta precisión en aplicaciones críticas como la documentación legal y médica.

Autores originales: Aravindhan Arunagiri, Ayaan Khan, Udayaadithya Avadhanam, SaiBarath Sundar

Publicado 2026-08-18
📖 4 min de lectura☕ Lectura para el café

Autores originales: Aravindhan Arunagiri, Ayaan Khan, Udayaadithya Avadhanam, SaiBarath Sundar

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo moderno, vastas cantidades de información personal y corporativa existen como simple texto, desde registros médicos y contratos legales hasta informes financieros. A medida que estos datos se digitalizan cada vez más, surge un desafío crítico: cómo compartir o analizar estos documentos sin exponer secretos sensibles. Leyes como el Reglamento General de Protección de Datos y la Ley de Portabilidad y Responsabilidad del Seguro de Salud exigen que detalles específicos, como nombres, direcciones o condiciones médicas privadas, sean ocultados antes de que un documento abandone un entorno seguro. Tradicionalmente, esta tarea de "sanitización" ha dependido de programas informáticos rígidos que buscan patrones predecibles, como un número de teléfono o un número de seguro social. Aunque efectivos para estos formatos estándar, estas herramientas suelen fallar cuando la información sensible aparece en oraciones complejas y no estructuradas, como una cláusula específica en un contrato o un diagnóstico médico matizado. Además, cuando estas herramientas automatizadas toman la decisión de ocultar un texto, rara vez explican por qué, dejando que los auditores humanos adivinen la lógica detrás de la redacción.

Para resolver esto, un equipo de investigadores de Mphasis Limited ha desarrollado un nuevo enfoque que trata la redacción de texto no como una simple tarea de búsqueda y reemplazo, sino como un problema de razonamiento. En lugar de codificar reglas para cada tipo posible de datos sensibles, crearon un sistema donde un humano puede describir lo que necesita ocultarse en lenguaje sencillo. Por ejemplo, un usuario podría simplemente declarar: "Oculta cualquier mención de tarifas específicas de clientes en este informe financiero", o "Elimina todos los detalles referentes a la ubicación del terreno en este acuerdo legal". El sistema utiliza entonces un modelo de lenguaje de gran tamaño para traducir estas instrucciones de lenguaje natural en un conjunto de reglas lógicas. Estas reglas se utilizan para entrenar un modelo de lenguaje más pequeño y eficiente que puede leer un documento, comprender el contexto y decidir exactamente qué palabras o frases coinciden con la definición de sensible del usuario. Crucialmente, este sistema no solo tacha el texto; genera una explicación escrita por cada pieza de información que elimina, citando la regla específica que activó la acción.

Los investigadores probaron este método en una variedad de tipos de documentos, incluyendo divulgaciones financieras, detalles de compromiso con clientes y registros médicos. Encontraron que el sistema podía identificar y redactar con precisión contenido sensible que las herramientas tradicionales omitirían, como términos legales complejos o estrategias comerciales específicas, mientras dejaba intacta la información no sensible. Para asegurar que el sistema fuera verdaderamente seguro, lo sometieron a una prueba rigurosa donde una poderosa inteligencia artificial intentó adivinar la información oculta basándose en el texto circundante. El sistema demostró ser altamente resiliente; la IA fue incapaz de reconstruir los detalles redactados, lo que indica que la información sensible fue eliminada efectivamente y no solo oscurecida. En sus pruebas, el modelo identificó y redactó con éxito más del 95 por ciento de las instancias sensibles que se le pidió encontrar.

Una innovación clave en este trabajo es el uso de datos sintéticos para entrenar el sistema. En lugar de alimentar al modelo con documentos reales y privados, los investigadores utilizaron un modelo de lenguaje de gran tamaño para generar miles de documentos falsos que imitaban escenarios del mundo real. Estos documentos sintéticos contenían contenido tanto sensible como no sensible, junto con las redacciones y explicaciones correctas. Esto permitió que el modelo más pequeño aprendiera cómo razonar sobre las reglas de privacidad sin haber visto nunca los datos privados de una persona real durante su entrenamiento. El resultado es una herramienta que es tanto flexible como transparente. Puede adaptarse a nuevos tipos de documentos y nuevas definiciones de sensibilidad sobre la marcha, simplemente escuchando las instrucciones de un humano. Al proporcionar una justificación clara en lenguaje natural para cada redacción, el sistema cierra la brecha entre la eficiencia automatizada y la responsabilidad humana, ofreciendo una forma de proteger la privacidad que es tan comprensible como efectiva.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →