Los conjuntos de datos regulatorios publicados por las agencias estadounidenses en la actualidad varían ampliamente en la forma en que se proporcionan. Muchos se proporcionan como informes en documentos en papel como PDF o Word, algunos se publican en archivos CSV para su descarga, otros en formato XBRL estructurado. Es posible que una aplicación de IA necesite consumir varios conjuntos de datos proporcionados por varias agencias. Idealmente, todas las agencias federales de EE. UU. proporcionarían sus datos siguiendo el mismo estándar de datos estructurados. Este enfoque proporcionaría a los algoritmos de IA datos interoperables, «comprensibles por las máquinas», accesibles y automatizables.
Los datos que se preparan utilizando el estándar de datos XBRL en la actualidad, como los datos de empresas públicas, servicios públicos, empresas de gestión de inversiones, agencias de calificación crediticia y bancos (cada uno de los cuales informa a su respectiva agencia reguladora), cumplen estos requisitos y pueden alojarse fácilmente en la misma base de datos y extraerse y utilizarse de la misma manera. En XBRL US, mantenemos una base de datos que contiene datos de presentaciones de FERC, presentaciones de SEC, presentaciones de Formato Electrónico Único Europeo (ESEF) e incluso datos de estados financieros de entidades gubernamentales estatales y locales. Todos estos datos se pueden extraer de forma muy granular utilizando las mismas aplicaciones de extracción o analíticas porque los datos, aunque bastante diferentes, están estructurados de la misma manera utilizando un modelo u ontología estandarizada. La estandarización permite economías de escala y hace que sea menos costoso informar, recopilar y extraer datos porque hay una gran cantidad de herramientas disponibles en el mercado comercial.
El estándar XBRL no es un «formato», sino un modelo de datos semántico que se puede utilizar para generar datos en múltiples formatos, incluidos XHTML, JSON, CSV y XML. Diferentes programas de recopilación de datos pueden ser más adecuados para un formato que para otro; por lo tanto, el Departamento de Comercio debe estar preparado para adoptar formatos que sean los adecuados para los datos recopilados. El estándar XBRL es un modelo de datos semántico, en lugar de un formato como XML. Tiene la flexibilidad para facilitar un enfoque que permite más de un formato.
La documentación es importante para garantizar que todas las partes interesadas tengan una comprensión compartida de los datos. El estándar XBRL requiere la creación de una taxonomía (u ontología) que contenga toda la documentación necesaria para todas las partes interesadas, incluidos los conceptos que se pueden informar junto con sus propiedades, etiquetas y referencias; y las relaciones entre esos conceptos, como el matemático y las relaciones padre/hijo. Una taxonomía es un diccionario digital de términos que contiene toda la información necesaria para cualquier persona involucrada en la presentación de informes, la recopilación o el uso de los datos expresados por la taxonomía. Cuando todas las partes interesadas pueden referirse a una sola fuente, como una taxonomía (ontología), tienen una comprensión compartida de lo que se informa, se recopila y, en última instancia, se utiliza.