Confidencialidad e IA: qué le llega al modelo
Secreto profesional y asistentes de IA: qué información sale realmente de tu estudio, qué dice la Ley 25.326 y cómo funciona la pseudonimización de datos antes del envío.
Cuando subís un contrato a un asistente de IA, por defecto el texto completo —con nombres, DNI, CUIT y montos— viaja al proveedor del modelo. Una cláusula contractual de "no entrenamos con tus datos" reduce un riesgo pero no evita el envío. La protección técnica real es la pseudonimización previa: detectar los identificadores antes de que el texto salga y reemplazarlos por referencias anónimas, de modo que el proveedor procese el documento sin recibir nunca el dato personal.
¿Qué obligación tiene un abogado sobre los datos de su cliente?
El secreto profesional no es una buena práctica: es un deber. Y no se delega por contrato con un proveedor. Si la información de un cliente se expone, la responsabilidad recae sobre quien la puso ahí.
A eso se suma la Ley 25.326 de Protección de Datos Personales, que aplica a cualquier tratamiento de datos de personas físicas. Un expediente laboral o un divorcio contienen además datos sensibles —salud, afiliación sindical, orientación sexual— con un régimen más estricto todavía.
La pregunta operativa, entonces, no es si el proveedor es confiable. Es qué información sale efectivamente del estudio.
¿Qué pasa cuando subís un contrato a un asistente genérico?
En una herramienta de propósito general, el documento se transmite completo al servidor del proveedor para ser procesado. Con nombres, números de documento, CUIT, domicilios, cuentas bancarias y montos.
Los planes empresariales suelen agregar un compromiso de no usar esos datos para entrenar modelos. Es una mejora real, pero conviene entender su alcance: limita el uso posterior, no impide la transmisión. El dato igual viajó, se procesó en infraestructura de terceros y quedó en registros operativos por algún período.
Para muchos usos eso es aceptable. Para un contrato de compraventa de acciones bajo acuerdo de confidencialidad, o para el expediente médico de un juicio por mala praxis, es una decisión que conviene tomar de manera consciente y no por defecto.
¿Qué es la pseudonimización y en qué se diferencia de anonimizar?
Anonimizar es eliminar el dato de forma irreversible: el documento queda sin identificadores y ya no se puede reconstruir. Sirve para publicar estadísticas, pero no para trabajar, porque se pierde de quién se está hablando.
Pseudonimizar es reemplazar cada dato identificable por una referencia estable y reversible únicamente por quien tiene la clave. El documento se puede procesar —el modelo entiende que "PERSONA_1" es la misma persona en todo el texto— y el resultado se puede revertir a los valores reales al mostrárselo al usuario autorizado.
La diferencia práctica es que la pseudonimización conserva la utilidad del análisis sin exponer el dato. Donde el contrato dice "Juan García, CUIL 20-12345678-3", al modelo le llega "PERSONA_1, CUIL_1", y la respuesta vuelve con esas referencias que el sistema reemplaza antes de mostrarla.
¿Cómo funciona en AINI?
El pipeline corre en cada consulta, antes de cualquier envío, y tiene cuatro pasos.
- Detección: reglas construidas para documentos argentinos identifican DNI, CUIT y CUIL, pasaportes, CBU y CVU, domicilios, teléfonos, correos, y categorías sensibles como datos de salud o afiliación sindical, política y religiosa.
- Sustitución: cada dato detectado se reemplaza por una referencia opaca cuyo número es un identificador interno y no revela nada del valor original.
- Cifrado: la tabla que vincula token y valor real se cifra con una clave derivada de la cuenta y queda aislada, de modo que los tokens de un usuario no permiten revertir el texto de otro. Los que dejan de usarse se purgan a los 90 días.
- Reversión: la respuesta vuelve con los tokens y se reemplazan por los valores originales antes de mostrarla al usuario autorizado.
¿Por qué el nivel de detección se ajusta según el caso?
No todos los documentos requieren el mismo umbral. En un expediente de mala praxis hay que detectar diagnósticos y medicación; en una due diligence de M&A importan más los códigos internos y la información comercial reservada; en jurisprudencia pública, en cambio, los nombres de los tribunales y las carátulas no deben anonimizarse porque son parte del dato que se busca.
Por eso la detección funciona por contexto: litigio, laboral, familia, salud, M&A y consulta de material público tienen configuraciones distintas de qué buscar y con qué nivel de sensibilidad.
Un umbral demasiado agresivo sobre jurisprudencia pública destruiría la búsqueda; uno demasiado laxo sobre una historia clínica expondría datos sensibles. La configuración por contexto es lo que evita tener que elegir entre esas dos fallas.
¿Qué preguntarle a un proveedor antes de contratar?
- ¿El texto completo del documento sale hacia el proveedor del modelo, o sale pseudonimizado?
- ¿Quién puede revertir la pseudonimización, y con qué clave?
- ¿Los datos se usan para entrenar modelos? ¿Está por contrato o por arquitectura?
- ¿Queda registro de quién accedió a cada documento, cuándo y desde dónde?
- ¿Puedo exportar toda mi información y pedir la eliminación de la cuenta?
- ¿Cómo se aísla la información entre clientes distintos de la misma plataforma?