Procedencia de datos
La procedencia de datos es el linaje registrado de un resultado: las fuentes, consultas, transformaciones y decisiones que lo produjeron, con detalle suficiente para que un tercero verifique la cifra de forma independiente.
La procedencia responde a la pregunta que todo revisor acaba haciendo: ¿de dónde salió esta cifra? Una respuesta completa nombra el sistema de origen, la consulta o el fichero que produjo el valor, cualquier transformación aplicada y el momento de lectura. Sin eso, una cifra es una afirmación y no un hallazgo.
Conviene distinguir procedencia de registro. Un log deja constancia de que algo ocurrió. La procedencia conserva lo suficiente para reproducirlo. Una entrada que dice que un informe se generó a las 14:02 no permite volver a derivarlo; un registro de procedencia con la consulta, los parámetros y la versión del conjunto de datos, sí.
La procedencia resulta más creíble cuando es un subproducto de cómo se trabaja y no documentación reunida a posteriori. El linaje reconstruido depende de la memoria y la buena voluntad; el capturado, no.
Qué lo distingue
- Nombra la fuente, la consulta y el momento concretos detrás de cada cifra
- Conserva detalle suficiente para que un tercero reproduzca el resultado
- Se captura mientras ocurre el trabajo, no se reconstruye después
- Sobrevive a la rotación de personal, porque no depende del recuerdo de nadie
En DataQube
DataQube adjunta la evidencia mientras se producen las respuestas. Una cifra en un hilo lleva consigo la consulta que la generó, la fuente sobre la que se ejecutó y la decisión de permisos que autorizó el acceso, de modo que un revisor puede repetir la derivación sin necesitar acceso a la sesión original.
Preguntas frecuentes
¿En qué se diferencia de un registro de auditoría?
Un registro de auditoría deja constancia de que ocurrió un evento, normalmente para revisión de seguridad. La procedencia registra cómo se derivó un resultado, con detalle suficiente para reproducirlo. El primero responde quién hizo qué; la segunda, de dónde salió esta cifra.
¿Por qué importa en análisis generado con IA?
Porque un modelo de lenguaje puede producir una cifra segura y bien formateada sin ningún cálculo subyacente. La procedencia distingue un resultado recuperado y calculado de uno generado, que es justo la distinción que necesitan un revisor o un supervisor.
¿Qué debe incluir una procedencia completa?
Como mínimo: el sistema de origen, la consulta o fichero exactos, cualquier transformación aplicada, el momento del acceso y el permiso bajo el que se produjo. Menos que eso deja un hueco que el revisor tiene que rellenar con confianza.
Términos relacionados
Agente de datos con IA
Un agente de datos con IA es software que responde preguntas analíticas planificando y ejecutando sus propios pasos — consultar bases de datos aprobadas, ejecutar código y citar lo que usó — en lugar de solo generar texto.
Flujo de trabajo determinista
Un flujo de trabajo determinista es una secuencia ordenada y parametrizada de pasos que produce el mismo resultado al ejecutarse de nuevo con las mismas entradas, lo que lo hace apto para reporting recurrente y procesos de revisión.
IA en air gap
La IA en air gap es un sistema de IA que opera enteramente dentro de una red sin conectividad externa: la inferencia del modelo, el acceso a datos y la validación de licencia funcionan sin que ninguna llamada salga del perímetro.