DataQubeDataQube
Blog

Procedencia por construcción: análisis de IA que sus auditores pueden reproducir

Un rastro de auditoría de IA solo funciona si está integrado en cómo se producen las respuestas, no documentado después. Cómo DataQube construye la procedencia - consultas, citas, ejecuciones de flujos, denegaciones - para que un revisor reproduzca cualquier cifra sin acceso al sistema.

E
Engineering
DataQube · 30 de marzo de 2026 · 8 min de lectura
Seguridad

En todo piloto de IA de una institución financiera llega el momento en que alguien hace la pregunta que decide el destino del proyecto: "¿Y cuando el supervisor pregunte de dónde salió esa cifra?" La mayoría de los pilotos terminan ahí - no porque las respuestas fueran incorrectas, sino porque nadie podía demostrar que eran correctas. "Lo dijo el modelo" no es una respuesta que un responsable de cumplimiento pueda firmar, y todos en la sala lo saben.

La reacción habitual es atornillar una función de explicación: pedir al modelo que describa su razonamiento, guardar la descripción, llamarlo rastro de auditoría. Creemos que ese enfoque falla de una manera que ningún pulido puede arreglar, y este artículo trata de la alternativa que construimos en su lugar: la procedencia como restricción de construcción. En DataQube el agente no puede producir una afirmación sin que exista la cadena de evidencia, porque ensamblar la cadena es la manera en que se producen las afirmaciones. El rastro de auditoría no documenta el análisis. Es el análisis.

Qué tiene que contener un rastro de auditoría de IA

Empiece por lo que necesita un revisor, porque eso define la estructura de datos. Cuando un equipo supervisor, la auditoría interna o la función de riesgo de modelo examina una cifra producida por IA, hace cinco preguntas en un orden predecible: qué podía tocar el agente, qué conocimiento previo aplicó, qué ejecutó realmente, cómo se calculó la cifra a partir de lo que volvió, y qué se comprobó antes de que alguien la repitiera.

Cada una corresponde a una etapa de lo que llamamos la cadena de evidencia, y cada respuesta del agente lleva las cinco:

  • Alcance - el espacio de trabajo, los permisos vigentes y la puerta de gobernanza que pasó la sesión antes de la primera llamada.
  • Conocimiento recuperado - qué definiciones y convenciones validadas se aplicaron, y cuándo se confirmó cada una por última vez.
  • Llamadas auditadas - cada consulta, lectura de archivo y ejecución, cada una con su referencia de evento de auditoría.
  • Trazabilidad del cálculo - cómo las filas recuperadas se convirtieron en la cifra en pantalla.
  • Comprobaciones - qué se concilió contra una fuente independiente antes de publicar la respuesta.

Nada de esto es prosa. Cada etapa son datos estructurados, emitidos en el momento en que ocurre el trabajo, con identificadores que se resuelven en el registro de auditoría. Esa distinción - eventos estructurados en tiempo de ejecución, no narrativa a posteriori - es lo que hace posible el resto de este artículo.

Anatomía de una respuesta auditable

Aquí hay un ejemplo de la forma, de nuestro escenario de demostración estándar: el equipo de Riesgo de Grupo de un banco pregunta por la concentración en inmuebles comerciales antes de una respuesta supervisora. Un hallazgo - "El CRE de oficinas está al 92% de su sublímite interno" - ensamblado desde cuatro sistemas distintos, cada llamada con su referencia de auditoría:

DataQube

A partir de conversaciones reales con clientes — todos los datos son ficticios.

Recorra la cadena detrás de ese hallazgo y no encontrará narración, solo registros. El lado de exposición vino de una consulta de solo lectura al almacén - 18.204 filas, 213 milisegundos, evento de auditoría evt-4c19d2. El límite agregado del 12,5% no se recordó ni se asumió: se leyó del §3.2 del documento de política aprobado por el consejo, y la cita apunta a la sección y el pasaje citado, no solo a un nombre de archivo. Las cifras mensuales no se derivaron de nuevo: el agente invocó el flujo estándar cre-monthly-exposure, ejecución n.º 38, parámetros fijados - por eso el número de esta conversación puntual es idéntico al del paquete mensual distribuido. Y antes de enunciar el hallazgo, las exposiciones por segmento se conciliaron con el libro mayor en ±0,1%.

Cuatro sistemas, cuatro referencias de auditoría, un identificador de correlación que une toda la ejecución. Un revisor no tiene que fiarse de la frase; puede abrir cualquiera de sus enlaces.

Las afirmaciones llevan recibos, no notas al pie

La decisión de diseño que soporta el peso está un nivel por debajo de la interfaz: una afirmación en DataQube es una estructura de datos cuyos campos son su evidencia. Aquí está el mismo hallazgo de oficinas, desplegado - este es el panel que se abre cuando alguien pulsa "¿Cómo se derivó esto?" sobre el hallazgo de arriba, exactamente como aparece en el producto:

Cadena de evidencia

El CRE de oficinas está al 92% de su sublímite interno

Datos a Cierre de mes, 30 sep 2026 · traza run-3126-evd

Alcance y permisos

Espacio de trabajo: Riesgo de Grupo

permisos de solo lectura sobre el almacén de riesgo, el repositorio de documentos y el flujo - puerta de gobernanza superada

Conocimiento recuperado

Definición del segmento CRE

taxonomía interna v4 - validada, confirmada por última vez el 14 de ago

Plantilla de agregación de exposición

plantilla validada, 23 ejecuciones previas

Convención de fecha de reporte

exposición dispuesta a cierre de mes - compromisos excluidos según la base supervisora

Llamadas a herramientas auditadas

risk-dwh · query_sqlevt-4c19d2

exposiciones CRE, 18.204 filas

doc-store · read_fileevt-4c19d6

CRE-limits-2026.pdf · §3.2 citado

workflow · runevt-4c19d7

cre-monthly-exposure, ejecución n.º 38

kernel · concentrationevt-4c19d5

cuotas, margen, utilización

Trazabilidad del cálculo

Agregación de exposición

CRE 4.200 M€ = 11,8% de la cartera de 35.600 M€

Utilización de límites

Oficinas 5,5% vs sublímite 6,0% → 92% de utilización

Anclaje en la política

límite agregado del 12,5% citado del documento del consejo, no asumido

Comprobaciones de consistencia

Conciliación contable

las exposiciones por segmento cuadran con el libro mayor en ±0,1%

Vigencia de la definición

la taxonomía v4 es la versión validada vigente

Paridad con el flujo mensual

las cifras coinciden con la ejecución mensual estándar dentro del redondeo

Cada cifra, trazada
4.200 M€ / 11,8%Almacén de riesgo · agregación por segmento
92% utilización de OficinasKernel · utilización de límites
12,5% límite internoCRE-limits-2026.pdf · §3.2
Paridad con el paquete mensualFlujo · cre-monthly-exposure ejecución n.º 38
Limitaciones señaladas por el agente
  • Solo exposición dispuesta; los compromisos no dispuestos se reportan aparte según la base supervisora.
  • Foto a cierre de mes; los picos intramensuales no quedan reflejados.
Todos los pasos exportables a su SIEM como eventos de auditoría

A partir de conversaciones reales con clientes — todos los datos son ficticios.

El orden de las operaciones es lo que importa. El agente no escribe la afirmación y luego adjunta material de apoyo - no puede. El objeto de la afirmación se ensambla desde los recibos: el resultado de la consulta aporta la exposición, la lectura del documento aporta el límite, la ejecución del flujo aporta la paridad con el paquete estándar, la comprobación aporta la conciliación. Quite cualquier recibo y no queda afirmación que enunciar. Lo llamamos procedencia por construcción, en contraste deliberado con la procedencia como decoración: el mismo contenido generado después, preguntando a un modelo en qué se apoyó probablemente.

La consecuencia práctica aparece en los casos de fallo. Cuando una fuente no está disponible - el documento de política se movió, el almacén dio timeout -, un sistema decorativo produce una respuesta segura con una explicación más delgada. Un sistema constructivo no produce ninguna cifra, y dice por qué. Para un equipo regulado, el segundo comportamiento es exactamente el objetivo.

La denegación forma parte del registro

Un rastro de auditoría que solo registra éxitos es un documento de marketing. Las revisiones reales pasan la mayor parte del tiempo en el espacio negativo: quién intentó acceder a qué y fue rechazado, qué límites se activaron, qué se negó a hacer el sistema.

Cada decisión de autorización en DataQube aterriza en el mismo registro inmutable que el acceso a datos que gobierna - incluidas, especialmente, las denegaciones. Si la sesión de una analista intenta alcanzar una fuente fuera de su permiso, la denegación se registra con la regla que se activó. Si una acción sensible requirió la aprobación de una persona, el registro muestra a quién se preguntó, qué se aprobó exactamente y cuándo. La solicitud de permiso y la respuesta humana son eventos con el mismo rango que una consulta.

Por eso "la denegación explícita siempre gana" es una afirmación de arquitectura y no una preferencia de política: una denegación que un agente puede sortear argumentando no es evidencia de control, y la evidencia de control es lo que un auditor viene realmente a recoger.

Qué puede reproducir un revisor sin acceso al sistema

La cadena serviría de poco si examinarla exigiera una cuenta de DataQube y un administrador amable. Se exporta.

La traza exportada de un hilo contiene las cinco etapas de cada afirmación, la lista completa de eventos de auditoría con marcas de tiempo y recuentos de filas, las citas documentales con sus pasajes y las referencias de flujos con sus parámetros fijados. Un revisor que trabaje solo con la exportación puede hacer tres cosas que importan: verificar que cada cifra tiene una cadena completa sin huecos; volver a ejecutar las consultas citadas contra los sistemas fuente con su propio acceso y comparar recuentos y resultados; y confirmar que las cifras de política se remontan a los documentos que gobiernan, no a la memoria del modelo. Las líneas de registro nunca contienen credenciales, datos personales ni conjuntos de resultados en bruto - el rastro es evidencia, no una segunda copia de sus datos -, así que la exportación puede recorrer un proceso de revisión como cualquier otro artefacto de auditoría.

Dicho de otro modo: quien firma la revisión no necesita confiar en nuestro software. Necesita confiar en su propio almacén, su propio repositorio de documentos y la aritmética.

Por qué la explicabilidad a posteriori suspende la auditoría

Merece la pena precisar la alternativa rechazada, porque es el estándar del sector. "IA explicable" significa en la mayoría de los productos actuales pedir al modelo, después de responder, que produzca un relato de su razonamiento. El relato es fluido, plausible y estructuralmente inverificable - es un segundo output del modelo sobre el primero, con el mismo estatus epistémico y sin comprobación independiente. Cuando la explicación y el cálculo real divergen, nada detecta la divergencia. Un auditor no puede distinguir una explicación fiel de una confabulada, lo que significa, a efectos de auditoría, que la explicación no aporta información alguna.

El enfoque constructivo renuncia a algo real a cambio: el agente responde más despacio que un sistema que se salta la contabilidad, y se niega en situaciones donde un producto de chat improvisaría. Consideramos ambos costes el producto funcionando según lo previsto. Una respuesta producida sin su cadena no es una respuesta rebajada - en un entorno regulado es un pasivo con buena gramática.

La pregunta para cualquier proveedor

Si está evaluando herramientas de análisis con IA para un entorno regulado, hay una prueba de una sola pregunta que separa las dos arquitecturas: elija cualquier número del resultado y pida ver la consulta que lo produjo, el documento detrás de cualquier cifra de política y el registro de lo que el sistema se negó a hacer por el camino. Un sistema de procedencia por construcción responde con enlaces. Un sistema decorativo responde con prosa.

Nuestra respuesta a esa prueba está en la página de seguridad, incluida la cadena de evidencia renderizada al completo - y si quiere ejecutar la prueba contra sus propios datos, reserve una demo y traiga su número más difícil.

Se despliega en su clúster; nada sale fuera

Vea sus datos responder preguntas sin salir de su infraestructura

Treinta minutos con un ingeniero: producto en vivo, opciones de despliegue y respuestas claras para su equipo de seguridad.