Los modelos de inteligencia artificial no fallan solo por arquitecturas deficientes: fallan porque los datos que los alimentan son inconsistentes, incompletos o simplemente incorrectos. La calidad del dato ha dejado de ser un problema de backoffice para convertirse en un requisito de ingeniería de IA tan crítico como la capacidad de cómputo.
Durante años, la calidad de datos fue un ítem postergado en la agenda corporativa: algo que “había que mejorar” pero que rara vez bloqueaba proyectos. La irrupción de sistemas de IA en producción cambió esa dinámica de forma abrupta. Un modelo de lenguaje entrenado con registros duplicados, un sistema de recomendación alimentado con atributos mal clasificados, o un motor de detección de fraude que consume datos sin linaje verificable producen resultados que no solo son incorrectos, sino que pueden ser jurídicamente problemáticos en contextos regulados.
Qué significa “calidad de datos” en un pipeline de IA
En el marco del DAMA-DMBOK, la calidad de datos se descompone en al menos seis dimensiones: completitud, consistencia, exactitud, oportunidad, unicidad y validez. Para un pipeline de IA, cada una de esas dimensiones tiene consecuencias directas sobre el comportamiento del modelo. Un dataset con baja completitud introduce sesgos sistemáticos hacia los segmentos mejor representados. La falta de consistencia entre fuentes provoca que el modelo aprenda contradicciones como si fueran patrones reales. La ausencia de unicidad —registros duplicados— infla artificialmente la frecuencia de ciertos eventos y distorsiona las distribuciones de entrenamiento. El EDM Council, en su marco CDMC (Cloud Data Management Capabilities), clasifica la gestión de calidad como una capability de nivel 2, es decir, prerequisito para cualquier uso avanzado de datos, incluida la IA.
Data lineage: sin trazabilidad, no hay auditabilidad del modelo
El data lineage —la capacidad de rastrear el origen, las transformaciones y el destino de cada dato a lo largo de su ciclo de vida— es el componente de gobernanza que más directamente habilita la auditabilidad de sistemas de IA. Sin lineaje documentado, es imposible responder preguntas regulatorias básicas: ¿con qué datos fue entrenado este modelo?, ¿esos datos eran representativos de la población objetivo?, ¿existía algún sesgo de selección en la fuente? En jurisdicciones donde los sistemas de IA de alto riesgo deben poder explicar sus decisiones —como establece el AI Act de la Unión Europea en su artículo 13— el lineaje deja de ser una buena práctica y se convierte en evidencia jurídica.
En América Latina, el vínculo entre lineaje y cumplimiento normativo es menos explícito en los textos legales, pero ya está siendo requerido de forma implícita. El Banco Central de Brasil, por ejemplo, exige a las instituciones financieras supervisadas que demuestren la idoneidad de los modelos de riesgo crediticio que usan en sus decisiones automatizadas, lo que en la práctica demanda tener el linaje de los datos de entrenamiento disponible para inspección. En Argentina, la Comunicación A 8073 del BCRA sobre gestión de riesgo operacional establece controles sobre los modelos utilizados en procesos críticos, con implicancias directas sobre la documentación de los datos que los alimentan.
Cuándo aplica gobernanza de datos para IA — y cuándo no
La gobernanza de datos orientada a IA aplica con urgencia cuando una organización está entrenando o ajustando (fine-tuning) modelos propios, cuando consume APIs de modelos externos con datos internos sensibles, o cuando los outputs de IA alimentan decisiones automatizadas sobre personas (crédito, salud, contratación, seguridad). No aplica —o aplica con menor criticidad— cuando el uso de IA es puramente exploratorio, sin datos de producción, y sin impacto en procesos de negocio ni en derechos de terceros. El error frecuente es tratar ambos escenarios con el mismo nivel de exigencia, lo que genera fatiga de compliance sin reducir riesgo real.
El rol del data steward en proyectos de IA
Bob Seiner, referente en Non-Invasive Data Governance, sostiene que el data steward —el responsable de un dominio de datos dentro de la organización— es la figura que debe certificar la aptitud de un dataset para un caso de uso específico antes de que ese dataset ingrese a un pipeline de entrenamiento. Este rol, que en muchas organizaciones latinoamericanas todavía se ejerce de forma informal o no existe formalmente, se vuelve crítico cuando los modelos de IA empiezan a escalar. Sin un steward que valide la calidad, la relevancia y los permisos de uso de los datos, el equipo de datos o de ingeniería termina tomando decisiones de gobernanza para las que no tiene mandato ni contexto de negocio.
La adopción de este rol en la región es desigual. Empresas de servicios financieros en México, Colombia y Brasil con exposición a reguladores internacionales (BIS, FSB) ya tienen estructuras de stewardship activas. En sectores como retail, salud privada y gobierno, el rol existe en el organigrama pero raramente tiene atribuciones formales sobre los datasets que alimentan sistemas de IA.
Tres controles mínimos antes de poner datos en un modelo
Las organizaciones que empiezan a formalizar su gobernanza de datos para IA no necesitan implementar un framework completo desde el día uno. Tres controles concretos reducen el riesgo de forma inmediata:
- Perfil de calidad documentado: completitud, duplicados y distribución de valores nulos por campo, generado antes de cada ciclo de entrenamiento o actualización del modelo.
- Registro de origen: para cada dataset en producción, un registro legible por humanos que indique fuente primaria, fecha de extracción, transformaciones aplicadas y responsable de aprobación.
- Control de acceso por sensibilidad: clasificación del dataset según si contiene datos personales, datos financieros regulados o datos de categoría especial, con acceso restringido al equipo de IA según esa clasificación.
Estos tres controles se alinean con las capabilities de nivel básico del CDMC del EDM Council y son auditables por cualquier regulador que solicite evidencia de diligencia debida en el uso de datos para IA.
Para profundizar en los estándares aplicables, el DAMA-DMBOK (segunda edición) y el marco CDMC del EDM Council son los documentos de referencia más completos disponibles para equipos de gobernanza que trabajan en contextos de IA. Ambos están disponibles en sus respectivos sitios oficiales.





