Anonimización, seudonimización y enmascaramiento de datos para IA generativa: diferencias y cuál necesita su empresa
Qué diferencia a la anonimización, la seudonimización y el enmascaramiento, qué dicen los marcos de referencia y cuál conviene para usar IA generativa.
Anonimizar, seudonimizar y enmascarar son tres formas de proteger datos personales que se confunden con frecuencia. La anonimización elimina de forma irreversible la posibilidad de identificar a una persona. La seudonimización sustituye los identificadores por códigos que solo pueden revertirse con una información que se guarda aparte. El enmascaramiento oculta total o parcialmente un dato, normalmente al mostrarlo. Para usar inteligencia artificial generativa en la empresa, la más útil es una sustitución reversible aplicada antes de enviar el texto al modelo. Este artículo explica por qué.
Tres técnicas, tres grados de protección
Técnica | Qué hace | ¿Se puede revertir? | ¿Sigue siendo un dato personal? |
|---|---|---|---|
Anonimización | Elimina o transforma los datos de modo que la persona ya no pueda identificarse, ni siquiera combinándolos con otra información razonablemente disponible | No | No, si se hizo bien |
Seudonimización | Sustituye los identificadores por códigos; la correspondencia entre código y dato se guarda por separado y protegida | Sí, para quien tiene la correspondencia | Sí |
Enmascaramiento | Oculta total o parcialmente un dato, como en «•••• 1234» | Para quien lo ve, no | Puede serlo, si lo visible basta para identificar |
Cada técnica tiene su uso típico: la anonimización, para estadísticas, datos abiertos e investigación; la seudonimización, para análisis internos y para compartir datos con terceros que no necesitan saber quién es quién; el enmascaramiento, para pantallas, comprobantes y entornos de prueba.
La diferencia de fondo es qué pasa con la posibilidad de volver al dato original. En la anonimización desaparece. En la seudonimización existe, pero está en manos de quien guarda la correspondencia. En el enmascaramiento depende de cómo se aplique: un número de tarjeta que muestra sus últimos cuatro dígitos protege la pantalla, no la base de datos.
Qué dicen los marcos de referencia
Colombia no tiene definiciones legales propias para estas técnicas: la Ley 1581 de 2012 define qué es un dato personal y qué es un tratamiento, pero no qué es anonimizar o seudonimizar. La Circular Externa 002 de 2024 de la Superintendencia de Industria y Comercio menciona técnicas de protección, como la privacidad diferencial, para resguardar la identidad de los titulares en sistemas de inteligencia artificial. Por eso, en la práctica, la terminología de referencia viene de otros marcos:
El Reglamento General de Protección de Datos europeo (RGPD) define la seudonimización como un tratamiento que impide atribuir los datos a una persona sin información adicional, siempre que esa información se guarde por separado y bajo medidas técnicas y organizativas. Su considerando 26 establece que los datos seudonimizados deben considerarse información sobre una persona identificable, y que los datos anónimos quedan fuera de su alcance.
El Comité Europeo de Protección de Datos publicó en enero de 2025 sus directrices 01/2025 sobre seudonimización, en versión para consulta pública. Insisten en que la información que permite revertir los códigos debe mantenerse separada y protegida, y en que la seudonimización reduce riesgos sin convertir los datos en anónimos.
El NIST de Estados Unidos, en su informe IR 8053 de 2015, trata la desidentificación como un conjunto de técnicas, no como una sola. Describe la seudonimización como el reemplazo de los identificadores directos por seudónimos, y reserva el término anonimización para cuando se ha eliminado la correspondencia.
Qué técnica exige cada tratamiento en Colombia es una pregunta jurídica que cada organización debe resolver con su asesor. Lo que sí es claro es la dirección: cuanto menos identificable sea la información que sale de la empresa, menor es el riesgo.
Por qué la anonimización pura no sirve para trabajar con IA
La anonimización es la técnica más fuerte, y por eso parece la indicada. En el trabajo diario con IA generativa, sin embargo, resta la utilidad que se busca.
Suponga que un colaborador escribe: «Redacte un correo para Ana Pérez confirmando la renovación del contrato CT-482». Si los datos se eliminan de forma irreversible, el modelo recibe «Redacte un correo para [eliminado] confirmando la renovación del contrato [eliminado]», y la respuesta vuelve igual de vacía: nadie puede reconstruir a quién iba dirigida ni de qué contrato se trataba.
Hay un segundo problema, menos evidente. Cuando todos los datos se reemplazan por la misma etiqueta genérica, el modelo pierde el sentido del texto: no sabe si lo eliminado era una persona, una empresa o una cifra, ni si dos menciones se refieren a lo mismo. La calidad de la respuesta cae.
La sustitución reversible: cómo funciona en una conversación
Lo que funciona para la IA generativa es sustituir cada dato por un marcador antes de enviar el texto y restituirlo cuando llega la respuesta. Para que el resultado sea bueno, los marcadores deben cumplir tres condiciones:
Ser tipados. «⟦Persona#7F3A2C⟧» le dice al modelo que se trata de una persona; «⟦Contrato#4E91D0⟧», que es un contrato. El modelo razona sobre el tipo sin conocer el valor.
Ser coherentes. La misma persona recibe el mismo marcador en toda la conversación, de modo que el modelo entiende que dos menciones son la misma.
Ser reversibles solo del lado de la empresa. La correspondencia entre marcador y dato permanece en la plataforma que hace la sustitución; el proveedor del modelo nunca la recibe.
El recorrido completo es este: el colaborador escribe con naturalidad; la plataforma detecta los datos sensibles y los sustituye; el modelo recibe «Redacte un correo para ⟦Persona#7F3A2C⟧ confirmando la renovación del contrato ⟦Contrato#4E91D0⟧»; responde con los mismos marcadores; y la plataforma los reemplaza por los datos originales antes de mostrar la respuesta. El colaborador recibe un correo dirigido a Ana Pérez sobre el contrato CT-482, y el proveedor del modelo nunca supo ninguna de las dos cosas.
En la terminología del RGPD, esta técnica es una seudonimización. Lo relevante es dónde queda la información que permite revertirla: dentro de la plataforma de la empresa, no en el proveedor del modelo.
Qué exigir a una solución de sustitución automática
Si su organización evalúa una herramienta de este tipo, estas preguntas permiten compararlas:
¿Los marcadores indican el tipo de dato y son coherentes en toda la conversación?
¿La correspondencia entre marcadores y datos queda fuera del alcance del proveedor del modelo?
¿La protección está activa por defecto, o depende de que cada colaborador la encienda?
¿Cubre también los documentos, los archivos adjuntos y la información que traen los conectores, no solo lo que se escribe?
¿Permite que la empresa defina sus propios términos sensibles, como códigos de proyecto o nombres de clientes, que ningún detector genérico reconoce?
¿Hay revisión humana de los términos detectados automáticamente?
¿Los registros de la plataforma evitan guardar los datos en claro?
Conviene también conocer los límites de cualquier solución. Ningún detector reconoce la totalidad de los datos sensibles: por eso importan el diccionario propio de la empresa y la revisión humana. Y el contexto puede identificar a una persona sin nombrarla: «el gerente general de nuestro mayor cliente» no contiene ningún dato con formato, pero en ciertas organizaciones basta para saber de quién se habla. La sustitución reduce la exposición; no reemplaza el criterio.
El caso de NiuCore
NiuCore llama anonimización activa a este mecanismo. En términos técnicos, y con la terminología del RGPD, es una seudonimización: NiuCore conserva la correspondencia entre marcadores y datos para restituir las respuestas, y el proveedor del modelo solo recibe los marcadores. Opera con tres capas: una reconoce los datos con formato, como correos, teléfonos, documentos de identidad y números de tarjeta; otra aplica el diccionario que administra la empresa; y la tercera detecta términos propios del negocio para que un responsable los confirme. La página de Confianza describe qué información se conserva y dónde.
Preguntas frecuentes
¿Los datos seudonimizados siguen siendo datos personales?
Según el RGPD europeo, sí: mientras exista la posibilidad de revertir los códigos, son datos personales. En Colombia, la Ley 1581 de 2012 no regula expresamente la seudonimización; la calificación de cada caso corresponde al asesor jurídico de la organización.
¿El enmascaramiento sirve para usar IA?
Sirve para mostrar información en pantalla, no para enviarla a un modelo. Un dato parcialmente oculto puede seguir identificando a una persona, y el modelo recibe un texto con menos sentido.
¿Puede el modelo deducir quién es la persona detrás de un marcador?
No a partir del marcador, que no contiene información sobre el dato. Sí podría inferirlo del contexto si el texto describe a la persona de forma inequívoca. Por eso conviene no añadir detalles identificables innecesarios.
¿Qué pasa con los documentos que se cargan en una biblioteca?
Deben recibir el mismo tratamiento que los mensajes. Si un documento se indexa con los datos originales, cada consulta que lo use los enviará al modelo. En NiuCore, los documentos de las bibliotecas se indexan con los datos ya sustituidos.
Cierre
La pregunta útil no es qué técnica suena más protectora, sino cuál permite trabajar sin exponer los datos. Para la IA generativa, la respuesta es la sustitución reversible con marcadores tipados y coherentes, aplicada antes de que el texto salga de la empresa y con la correspondencia bajo su control. El artículo Cómo usar ChatGPT y otras IA en la empresa sin exponer datos confidenciales complementa esta explicación con las medidas que suelen recomendarse y su límite.
¿Le resultó útil este artículo?
Fuentes del artículo (consultadas el 23 de septiembre de 2026)
Definición de seudonimización (artículo 4.5) y datos seudonimizados y anónimos (considerando 26)
Reglamento (UE) 2016/679, Reglamento General de Protección de Datos, EUR-Lex
Directrices 01/2025 sobre seudonimización, versión para consulta pública, enero de 2025
Desidentificación, seudonimización y anonimización
NIST, IR 8053, De-Identification of Personal Information, 2015
Circular Externa 002 de 2024 y técnicas de protección en sistemas de IA
Ley 1581 de 2012, definiciones
Siga leyendo
ChatGPT Enterprise, Copilot y Gemini: qué protegen y qué no protegen de los datos de su empresa
Ninguno entrena con los datos de su empresa. La diferencia está en quién recibe el texto completo, dónde se procesa y cuánto se conserva.
Daniel VillanuevaCómo usar ChatGPT y otras IA en la empresa sin exponer datos confidenciales: guía para Colombia y Latinoamérica
Qué ocurre con lo que su equipo escribe en ChatGPT, Claude o Gemini, qué medidas manuales funcionan, dónde fallan y cómo automatizar la protección.
Luis VillanuevaCopilot no es gobernanza de la IA: por qué pagar licencias no equivale a gobernar su uso
Copilot y Purview traen controles útiles, pero una licencia no decide qué datos ve el modelo, qué reglas se cumplen ni cuánto consume cada área.
Luis Villanueva