Aviso: Sí, este artículo fue creado con ayuda de la IA — ¿por qué no?

Cada mensaje que un usuario envía a tu sistema de IA lleva consigo un pequeño riesgo de privacidad. Nombres, teléfonos, correos electrónicos — viajan junto con la solicitud real y a menudo acaban en registros, bases de datos y servicios externos donde nunca debían llegar. Construí un pequeño servicio para resolver esto en el origen: eliminar los datos personales del texto antes de que se mueva a ningún otro sitio.

El problema no es la conciencia — es el momento Link to heading

La mayoría de los equipos saben que deberían proteger los datos personales. El reto es hacerlo de forma automática, en el momento adecuado, sin ralentizar todo el proceso. Normativas como el RGPD y la CCPA lo convierten en un requisito legal, pero el argumento práctico es más contundente: los datos que nunca se almacenan de forma identificable no pueden filtrarse ni ser mal utilizados después.

El punto de inserción natural es la puerta de entrada: antes de que el texto llegue a un modelo de lenguaje, a un recolector de registros o a un pipeline de analítica.

Lo que hace la herramienta Link to heading

app-presidio envuelve el motor de código abierto Presidio de Microsoft — un sistema basado en IA que detecta información personal en docenas de tipos de entidades y múltiples idiomas — en una API REST ligera y una interfaz de línea de comandos. La interacción es sencilla:

Entrada: "Hola, soy Juan García y mi correo es juan@ejemplo.com"
Salida:  "Hola, soy <PERSON> y mi correo es <EMAIL_ADDRESS>"

Sin expresiones regulares que escribir, sin listas de búsqueda que mantener al día. El modelo de IA subyacente se encarga del reconocimiento; el anonimizador reemplaza cada elemento detectado con una etiqueta neutra. También puedes inspeccionar lo que se ha detectado antes de reemplazarlo y establecer un umbral de confianza para filtrar coincidencias de baja certeza.

Por qué importa ejecutarlo tú mismo Link to heading

Enviar datos sensibles a una API de anonimización de terceros es contradictorio. El objetivo es precisamente mantener la información personal fuera de sistemas externos — y una herramienta SaaS alojada es, en sí misma, un sistema externo.

Este servicio corre completamente dentro de tu propia infraestructura. Arráncalo con docker compose up y el texto en bruto nunca cruzará el perímetro de tu red. La versión limpia continúa por el pipeline; todo lo que identifica a personas se queda dentro.

Dónde encaja en un flujo de trabajo real Link to heading

Algunos lugares donde un paso de anonimización produce resultados inmediatos:

  • Antes de una llamada a un modelo de IA — elimina nombres y datos de contacto de los mensajes de usuario antes de que lleguen a cualquier proveedor externo.
  • Analítica y registros — elimina los datos personales de los registros de eventos y tickets de soporte antes de que lleguen a un almacén de datos o a una herramienta de monitorización.
  • Búsqueda interna — permite a los equipos buscar en el historial de conversaciones sin exponer datos personales en bruto en los resultados.

Diseñado para producción desde el principio Link to heading

El proyecto incluye un chart de Helm para Kubernetes, un pipeline de GitLab CI que prueba cada confirmación y publica una imagen de contenedor actualizada, y un endpoint de salud público que los orquestadores pueden consultar sin credenciales. Escalar horizontalmente es un cambio de una sola línea en el número de réplicas. El mecanismo de clave API mantiene protegido el endpoint de anonimización mientras deja el health check abierto para las sondas.

La privacidad funciona mejor como un paso por defecto, no como una reflexión tardía. Integrarlo desde el principio significa que el resto del pipeline nunca tiene que preocuparse por ello.

El proyecto completo es abierto: gitlab.com/carlessanagustin/app-presidio