DATA·TRENDS
Latam
Buenos Aires, ArgentinaNewsletter
DGL Talent - El talento en datos. Lo conocemos.
Legal AIExplicativo

Benchmarking de privacidad en IA: qué medir cuando los modelos ya deciden

LR
La Redacción
5 de oct de 2026 · 4 min de lectura
Benchmarking de privacidad en IA: qué medir cuando los modelos ya deciden

Los sistemas de inteligencia artificial de frontera procesan volúmenes crecientes de datos personales, pero no existe aún un estándar consolidado para medir cuán bien —o cuán mal— los gestionan. El Future of Privacy Forum (FPF) publicó un análisis que plantea la ausencia de benchmarks de privacidad como un problema estructural del desarrollo de IA, no como una deuda técnica menor.

Un benchmark, en el contexto de los modelos de IA, es un conjunto estandarizado de pruebas que permite comparar el desempeño de distintos sistemas bajo condiciones equivalentes. Existen benchmarks consolidados para capacidades como razonamiento matemático, comprensión lectora o generación de código. Para privacidad, en cambio, la práctica es fragmentaria: cada laboratorio evalúa lo que considera relevante, con criterios propios, lo que impide comparaciones significativas entre modelos o versiones.

Por qué la falta de benchmarks de privacidad no es un detalle técnico

Un modelo de lenguaje de gran escala puede memorizar fragmentos de sus datos de entrenamiento y reproducirlos ante consultas específicas. Puede inferir atributos sensibles —condición de salud, orientación sexual, situación financiera— a partir de información aparentemente inocua. Puede ser utilizado como vector para extraer datos personales de terceros que interactúan con el sistema. Ninguno de estos riesgos es hipotético: son comportamientos documentados en la literatura académica. El problema, según el FPF, es que sin métricas estandarizadas no hay forma de saber si un modelo mejora, empeora o simplemente desplaza esos riesgos de una capa a otra entre versión y versión.

La ausencia de benchmarks también debilita la rendición de cuentas regulatoria. Cuando una autoridad de control pregunta si un sistema de IA cumple con el principio de minimización de datos o con la obligación de no retener información personal más allá de lo necesario, la respuesta hoy es mayormente narrativa, no cuantificable. Eso convierte la evaluación de conformidad en un ejercicio retórico.

Qué debería medir un benchmark de privacidad en IA: tres dimensiones críticas

El análisis del FPF sugiere que cualquier framework de evaluación creíble debería operar al menos en tres planos distintos:

  • Riesgo de memorización y extracción: capacidad del modelo para reproducir datos personales presentes en el corpus de entrenamiento ante prompts diseñados para elicitarlos.
  • Inferencia de atributos sensibles: hasta qué punto el sistema puede derivar información protegida —categorías especiales de datos, en términos del RGPD o de legislaciones latinoamericanas equivalentes— a partir de inputs no sensibles.
  • Comportamiento en despliegue: cómo el modelo gestiona datos personales en tiempo real durante interacciones con usuarios, incluyendo si retiene, reutiliza o transmite esa información a capas del sistema no declaradas.

Estas dimensiones no son independientes: un modelo puede rendir bien en memorización y mal en inferencia, o viceversa. Por eso el FPF argumenta que los benchmarks deben ser multidimensionales y no colapsar la privacidad en un único puntaje.

Cuándo aplica este enfoque y cuándo no

El argumento del FPF aplica con mayor fuerza a los llamados modelos de frontera: sistemas de gran escala, de uso general, entrenados con datos masivos y desplegados en contextos donde procesan información de millones de personas. Para modelos más acotados —entrenados con datos propios, sin acceso a internet, en entornos cerrados— el riesgo de memorización y extracción es estructuralmente menor, aunque no desaparece. El marco tampoco resuelve por sí solo el problema de la privacidad diferencial en entrenamiento, que requiere decisiones de diseño previas al benchmark, no evaluables a posteriori.

El vacío regulatorio en América Latina se amplifica sin métricas

Brasil, Argentina, México, Colombia y Chile cuentan con legislaciones de protección de datos personales que imponen obligaciones sobre el tratamiento automatizado de información. La Lei Geral de Proteção de Dados brasileña (LGPD) reconoce el derecho a revisión de decisiones automatizadas y exige transparencia sobre la lógica aplicada. La Ley 25.326 argentina —cuya reforma lleva años pendiente en el Congreso— y la Ley Federal de Protección de Datos Personales en Posesión de los Particulares (LFPDPPP) de México también establecen principios de finalidad y proporcionalidad que aplican al tratamiento por sistemas de IA. El problema es que ninguna de estas normas define cómo demostrar el cumplimiento cuando el agente que trata los datos es un modelo de lenguaje. Sin benchmarks reconocidos, las empresas que despliegan IA en la región pueden afirmar conformidad sin posibilidad real de verificación independiente.

La Autoridad Nacional de Protección de Datos de Brasil (ANPD) y la Agencia de Acceso a la Información Pública de Argentina (AAIP) han iniciado consultas sobre IA, pero ninguna ha emitido aún guías técnicas sobre evaluación de privacidad en modelos de lenguaje. En ese vacío, la iniciativa de estandarización que propone el FPF podría funcionar como referencia para reguladores que necesitan criterios operativos antes de que los primeros casos lleguen a sus despachos.

Lo que hace medible la gobernanza también la hace exigible

El título del documento del FPF —”lo que se mide se gobierna”— no es un slogan vacío. En la historia de la regulación tecnológica, los estándares técnicos han precedido o acompañado a las normas jurídicas con mayor frecuencia que lo contrario. Los requisitos de auditoría del AI Act europeo, por ejemplo, asumen implícitamente la existencia de metodologías de evaluación comparables. Sin esa infraestructura de medición, la regulación opera sobre declaraciones de intención, no sobre evidencia.

El documento completo del Future of Privacy Forum está disponible en fpf.org y constituye una referencia de trabajo para equipos legales, de producto y de gobernanza que ya están evaluando —o deberían estar evaluando— el comportamiento de los modelos que despliegan.

El briefing semanal de datos, privacidad e IA en LATAM

Análisis, regulación y noticias curadas. Sin ruido, directo al punto.