Bots de OpenAI accedieron a bases de datos públicas del Censo de Estados Unidos y de la Comisión de Bolsa y Valores (SEC) en el marco de una expansión de sus capacidades de rastreo e indexación de datos. El movimiento confirma que los sistemas de inteligencia artificial de la compañía ya operan sobre repositorios gubernamentales de alta sensibilidad estadística y financiera, según se informó el 26 de septiembre de 2026.
El acceso, encuadrado como parte de una estrategia de expansión, implica que los crawlers de OpenAI están procesando información del U.S. Census Bureau —que incluye datos demográficos, económicos y de vivienda a escala nacional— y del Edgar, el sistema de divulgación de la SEC que contiene reportes corporativos, estados financieros y declaraciones de directivos. Ambas fuentes son técnicamente públicas, pero su ingesta masiva por parte de sistemas de IA plantea preguntas no resueltas sobre uso secundario, atribución y control de output.
Datos públicos, usos no necesariamente autorizados
El hecho de que la información sea de acceso abierto no neutraliza las implicancias regulatorias. En el marco del AI Act de la Unión Europea —vigente en fases desde 2024— el entrenamiento o la alimentación de sistemas de IA de propósito general con datos masivos exige transparencia sobre las fuentes y, en ciertos casos, análisis de riesgo sobre el uso de esa información. Aunque OpenAI opera desde jurisdicción estadounidense, sus modelos se despliegan globalmente, lo que arrastra obligaciones en múltiples marcos normativos. En América Latina, la discusión es directamente relevante: Brasil avanza en su Marco Legal de IA —en debate en el Congreso durante 2025 y 2026— que contempla requisitos de transparencia para sistemas que utilizan datos de fuentes públicas. Colombia, por su parte, incorporó lineamientos sobre IA en su política de Gobierno Digital, con énfasis en el uso ético de datos estadísticos del Estado.
Qué se sabe y qué falta confirmar
Lo confirmado hasta ahora es el acceso de los bots de OpenAI a ambas fuentes gubernamentales en el contexto de una expansión deliberada. Lo que no está confirmado es el propósito específico de ese acceso: si se trata de entrenamiento de modelos fundacionales, alimentación de herramientas de búsqueda o producto como SearchGPT, o construcción de datasets estructurados para clientes enterprise. Tampoco se informó si OpenAI notificó a las agencias gubernamentales involucradas ni si existe algún acuerdo de uso de datos con el Census Bureau o la SEC. La distinción importa: ingerir datos públicos para entrenar un modelo que luego genera output privado comercializable no es equivalente a mostrar los datos en crudo, y esa diferencia está en el centro del debate regulatorio global sobre IA y derechos de autor.
El próximo hito a seguir es si el Congreso de Brasil incorpora explícitamente el uso de datos estadísticos públicos por sistemas de IA en la versión final de su Marco Legal, cuya votación se aguarda antes de que cierre el año legislativo 2026.





