Cómo usar ChatGPT y otras IA en la empresa sin exponer datos confidenciales: guía para Colombia y Latinoamérica
Qué ocurre con lo que su equipo escribe en ChatGPT, Claude o Gemini, qué medidas manuales funcionan, dónde fallan y cómo automatizar la protección.
Sus colaboradores ya utilizan inteligencia artificial para redactar, resumir y analizar. La pregunta que corresponde a la dirección no es si debe permitirse, sino con qué información se está haciendo. Esta guía repasa las medidas que se recomiendan habitualmente, explica el límite que todas comparten y describe una alternativa que no depende de la atención de cada persona. Está escrita desde Colombia y para organizaciones de Latinoamérica, porque casi todo lo publicado en español sobre este tema razona desde la normativa europea.
Qué ocurre con lo que su equipo escribe en una IA
Depende del tipo de cuenta, y la diferencia es grande.
Cuentas personales, gratuitas o de pago individual. Es el caso más frecuente cuando la empresa no ha provisto una herramienta. En ChatGPT, el contenido de las cuentas individuales puede usarse para entrenar los modelos salvo que el usuario lo desactive en su configuración (OpenAI, centro de ayuda). En Claude, las cuentas Free, Pro y Max se usan para entrenar cuando el ajuste correspondiente está activo, y en ese caso la conservación se extiende a cinco años (Anthropic, agosto de 2025). En las aplicaciones de Gemini, una parte de las conversaciones la leen revisores humanos, y lo revisado se conserva hasta tres años aunque el usuario borre su actividad (Google, centro de privacidad de Gemini).
Cuentas empresariales y acceso por API. Los planes para empresas y las interfaces de programación excluyen, por lo general, el uso de la información para entrenar modelos. Es una mejora real. Conviene leerla con precisión: que el proveedor no entrene con sus datos no significa que no los reciba. Los recibe, los procesa en sus servidores y suele conservarlos durante un periodo —treinta días es un plazo habitual— para detectar usos abusivos.
El caso más citado sigue siendo el de Samsung. En la primavera de 2023, la compañía descubrió que miembros de su personal habían subido código interno a ChatGPT y prohibió el uso de estas herramientas en sus equipos (Bloomberg, 2 de mayo de 2023). Nadie actuó de mala fe: querían terminar antes su trabajo.
Qué información está en juego
Cuando un colaborador pega un texto en una herramienta de IA, ese texto viaja a la infraestructura de un tercero. En el trabajo diario, ese texto suele contener alguno de estos elementos:
Datos personales de clientes, pacientes, empleados o proveedores: nombres, cédulas, correos, teléfonos, direcciones.
Información contractual y financiera: valores, condiciones, números de cuenta, identificadores de contratos.
Información que solo su organización reconoce como sensible: el nombre en clave de un proyecto, un cliente que aún no es público, una estrategia de precios.
Los dos primeros grupos tienen formato reconocible. El tercero no: ninguna herramienta externa sabe que «Aurora» es un proyecto confidencial de su empresa. Conviene tenerlo presente al evaluar cualquier medida de protección.
El marco en Colombia, en tres referencias
Este artículo no sustituye la asesoría de un abogado. Conviene, sin embargo, saber qué normas entran en juego cuando un mensaje contiene datos de personas:
La Ley 1581 de 2012, régimen general de protección de datos personales.
La Ley 1266 de 2008, sobre información financiera, crediticia y comercial.
La Circular Externa 002 de 2024 de la Superintendencia de Industria y Comercio, del 21 de agosto de 2024, con lineamientos sobre el tratamiento de datos personales en sistemas de inteligencia artificial.
Qué exige cada una a una empresa que contrata herramientas de IA es materia de otro artículo de esta serie, revisado por un abogado: IA y datos personales en Colombia. Para lo que sigue basta una idea: los datos de sus clientes, pacientes o empleados siguen bajo el cuidado de su organización cuando alguien los copia en un chat, y en la mayoría de los casos la empresa no tiene registro de que ocurrió.
Las cinco medidas que se recomiendan habitualmente
Quien busque orientación sobre este tema encontrará, con variaciones, las mismas cinco recomendaciones. Todas son razonables, y conviene entender qué resuelve cada una.
1. Desactivar el uso de las conversaciones para entrenar modelos. Las versiones de consumo de varias herramientas permiten excluir las conversaciones del entrenamiento. Es una medida útil y gratuita. Su alcance es limitado: el proveedor sigue recibiendo y almacenando el texto completo; solo se compromete a no usarlo para un fin determinado. Además, la configuración se hace cuenta por cuenta, y la empresa no puede verificar que cada colaborador la haya aplicado en su cuenta personal.
2. Contratar versiones empresariales. Las licencias corporativas de los principales proveedores excluyen el entrenamiento por contrato y añaden administración centralizada. Es un avance real frente a las cuentas personales. Debe distinguirse, sin embargo, entre «el proveedor no entrena con sus datos» y «el proveedor no recibe sus datos»: con una licencia empresarial, el contrato, la historia clínica o el correo del cliente siguen llegando íntegros al proveedor. La protección es contractual, no técnica.
3. Indicar a los equipos qué no deben pegar. La instrucción de no compartir datos sensibles es el centro de casi todas las políticas internas. Es necesaria y es insuficiente, porque exige que cada persona, en cada tarea y bajo la presión del día, identifique qué es sensible y lo retire antes de enviar.
4. Capacitar y redactar una política de uso. La capacitación mejora el criterio de los equipos y la política establece responsabilidades. Ninguna de las dos impide el descuido: documentan lo que se espera, no lo que ocurre. La guía Política de uso de inteligencia artificial para empresas incluye una plantilla editable.
5. Anonimizar los documentos a mano antes de subirlos. Es la medida técnicamente más sólida de las cinco: si el dato no está en el texto, el proveedor no lo recibe. Su costo explica por qué rara vez se sostiene en el tiempo. Hay que localizar cada dato, sustituirlo de manera consistente, enviar el texto, recibir la respuesta y deshacer las sustituciones para que el resultado sea utilizable. En una tarea de cinco minutos, el procedimiento puede tomar más que la tarea.
El límite que comparten
Las cinco medidas dependen de que cada colaborador recuerde aplicarlas, todas las veces. Una política se cumple en la medida en que cada persona la tiene presente; una configuración protege solo las cuentas en las que alguien la activó; la anonimización manual ocurre cuando hay tiempo. Basta un descuido para que la información salga, y en la mayoría de los casos la organización no llega a saberlo, porque no existe un registro de lo que se compartió.
Los datos respaldan la preocupación. El informe Cost of a Data Breach de 2026, elaborado por el Ponemon Institute con el patrocinio de IBM sobre 602 organizaciones, encontró que el uso de herramientas de IA no aprobadas intervino en el 43 % de los incidentes de seguridad, frente al 20 % del año anterior, y que el 68 % de las organizaciones que sufrieron una brecha no tenía gobernanza de IA para gestionarlo ni para detectarlo (IBM y Ponemon Institute, 29 de julio de 2026). La edición de 2025 había mostrado qué se pierde en esos incidentes: datos personales en el 65 % de los casos y propiedad intelectual en el 40 % (IBM, 30 de julio de 2025).
La conclusión no es que estas medidas sobren. Es que una protección confiable no puede descansar en la memoria ni en el criterio individual.
La alternativa: que la sustitución ocurra de forma automática
La quinta medida —retirar los datos antes de enviar el texto— es la correcta. El problema es hacerla a mano. La alternativa consiste en que una plataforma la ejecute en cada mensaje, sin intervención del colaborador:
Antes de que el texto salga hacia el modelo, los datos sensibles se sustituyen por marcadores. «Redacte una carta para Ana Torres, cédula 52.481.903, sobre el contrato CT-482» pasa a ser «Redacte una carta para
⟦Persona#7F3A2C⟧, cédula⟦Documento#B81E44⟧, sobre el contrato⟦Contrato#4E91D0⟧».El modelo recibe la tarea con los marcadores. Conserva el contexto —quién interviene, qué documento es, cómo se relacionan las partes— y por eso puede razonar sobre ella con normalidad.
Al volver la respuesta, los marcadores se restituyen por los datos reales. El colaborador lee un resultado completo y utilizable; el proveedor del modelo solo conoció los marcadores.
Este enfoque tiene una consecuencia que las medidas contractuales no ofrecen: reduce la dependencia de lo que prometa cada proveedor. Ninguna empresa puede comprobar desde fuera que un tercero cumple sus condiciones de uso; si el proveedor conserva el texto recibido, conserva marcadores, y la correspondencia entre cada marcador y el dato real no salió de la plataforma.
Es lo que en NiuCore se denomina anonimización activa. Opera con tres capas: una reconoce los datos con formato —correos, teléfonos, cédulas, NIT, números de tarjeta y de cuenta—; otra aplica un diccionario que administra la propia empresa, con términos exactos o patrones como «toda referencia que inicie con CT- seguida de números»; la tercera propone términos propios del negocio, que protegen desde su detección y que un responsable confirma o descarta. La protección está activa por defecto y se gobierna a nivel de empresa: el colaborador no tiene un interruptor que pueda olvidar.
Al evaluar esta u otra solución de sustitución automática, conviene tener claros sus límites. Ningún detector reconoce la totalidad de los datos sensibles; por esa razón importan el diccionario propio y la revisión humana. La sustitución es reversible por diseño: permite devolver respuestas útiles, y no equivale a una eliminación irreversible de identidad. Y protege lo que se procesa dentro de la plataforma: no intercepta otras aplicaciones, de modo que su valor depende de que sea la vía de uso preferente de la organización.
Lista de verificación para su organización
Identificar qué herramientas de IA utilizan hoy los equipos, incluidas las cuentas personales.
Clasificar la información: qué puede compartirse con un tercero, qué requiere protección y qué no debe salir en ningún caso.
Definir una vía corporativa de uso y comunicarla; una prohibición sin alternativa traslada el uso a canales que la empresa no ve.
Preferir medidas técnicas a medidas que dependan de la atención individual.
Exigir a cualquier proveedor que responda por escrito las seis preguntas de la sección siguiente.
Conservar evidencia de las medidas adoptadas.
Revisar con su asesor legal las autorizaciones de tratamiento y las condiciones de transferencia internacional.
Seis preguntas para evaluar cualquier herramienta de IA
¿Qué recibe exactamente el proveedor del modelo: el texto original o un texto con los datos sustituidos?
¿La protección está activa por defecto, o depende de que cada usuario la encienda?
¿El proveedor usa la información para entrenar modelos? ¿Lo dicen sus condiciones estándar o hace falta un acuerdo aparte?
¿En qué países se procesa la información y durante cuánto tiempo se conserva?
¿Queda registro de quién usó la herramienta, con qué modelo y sobre qué documentos?
¿La empresa puede limitar qué modelos y qué fuentes de información usa cada área?
Si el proveedor de la herramienta responde las seis por escrito, su organización tiene con qué decidir.
Cierre
Usar IA sin exponer información confidencial no exige renunciar a los mejores modelos ni confiar en que nadie cometa un descuido. Exige que la protección ocurra antes de que el mensaje salga, en todos los mensajes. Si desea conocer cómo lo resuelve NiuCore, la página de anonimización activa describe el mecanismo y sus límites, y la de confianza detalla el recorrido de los datos y las condiciones de cada proveedor de modelos.
Siga leyendo: Shadow AI: qué es, cómo detectarla en su empresa y por qué prohibir no funciona
¿Le resultó útil este artículo?
Fuentes del artículo (consultadas el 14 de septiembre de 2026)
Uso del contenido de las cuentas individuales de ChatGPT para entrenar modelos, con opción de exclusión; sin entrenamiento por defecto en Business, Enterprise y API
Claude Free, Pro y Max: entrenamiento según el ajuste; conservación de cinco años
Anthropic, «Updates to Consumer Terms and Privacy Policy», 28-ago-2025
Gemini: revisión humana y conservación de hasta tres años
Registros de abuso de hasta 30 días en la API
OpenAI y xAI
Caso Samsung
43 % de los incidentes de seguridad por uso de IA no aprobada (20 % en 2025); 68 % de las organizaciones con brecha sin gobernanza de IA; 602 organizaciones
IBM y Ponemon Institute, Cost of a Data Breach Report 2026, pp. 24-25
65 % datos personales, 40 % propiedad intelectual
Ley 1581 de 2012
Circular Externa 002 de 2024: fecha y objeto
Siga leyendo
Anonimización, seudonimización y enmascaramiento de datos para IA generativa: diferencias y cuál necesita su empresa
Qué diferencia a la anonimización, la seudonimización y el enmascaramiento, qué dicen los marcos de referencia y cuál conviene para usar IA generativa.
Daniel VillanuevaChatGPT Enterprise, Copilot y Gemini: qué protegen y qué no protegen de los datos de su empresa
Ninguno entrena con los datos de su empresa. La diferencia está en quién recibe el texto completo, dónde se procesa y cuánto se conserva.
Daniel VillanuevaCopilot no es gobernanza de la IA: por qué pagar licencias no equivale a gobernar su uso
Copilot y Purview traen controles útiles, pero una licencia no decide qué datos ve el modelo, qué reglas se cumplen ni cuánto consume cada área.
Luis Villanueva