Hablemos de su proyecto
Datos e IA

Preparar sus datos para la IA generativa: inventario, calidad, derechos y trazabilidad

La mayoría de las dificultades de un proyecto de IA aparecen antes del modelo: fuentes introuvables, documentos caducados, derechos implícitos y ausencia de propietario.

Preparar sus datos para la IA generativa: inventario, calidad, derechos y trazabilidad

Un modelo puede resumir, extraer o responder solo a partir de la información que recibe. En las empresas, esta información está distribuida entre carpetas compartidas, aplicaciones de negocio, bases de datos, correos electrónicos, intranets y documentos PDF. Poseen diferentes versiones, derechos y propietarios. El proyecto de IA revela entonces problemas de datos que ya existían.

La preparación no consiste en limpiar toda la empresa antes de comenzar. Consiste en construir, para un caso de uso definido, una cadena de datos conocida, autorizada, medible y mantenible.

Partir del caso de uso

Un asistente documental, un extractor de facturas y un agente que modifica pedidos no tienen las mismas necesidades. Es necesario precisar:

  • tarea;
  • usuarios;
  • fuentes necesarias;
  • frescura;
  • calidad mínima;
  • datos prohibidos;
  • decisión o acción;
  • prueba esperada.

Esta precisión limita el inventario y evita una plataforma de datos abstracta sin resultados.

Construir un inventario utilizable

Para cada fuente, recopilar:

  • nombre y sistema;
  • propietario del negocio;
  • responsable técnico;
  • tipo y volumen;
  • formato;
  • frecuencia de actualización;
  • nivel de sensibilidad;
  • población autorizada;
  • calidad conocida;
  • modo de acceso;
  • regla de conservación;
  • estado de referencia.

El inventario debe mantenerse. Una hoja fija al inicio del proyecto no garantiza que la fuente utilizada seis meses después siga siendo válida.

Las diez dimensiones de la preparación

1. Inventario

Las fuentes necesarias están identificadas y su alcance comprendido.

2. Propiedad

Una persona o función puede validar el sentido, la calidad, el acceso y la duración de vida.

3. Acceso

La extracción está autenticada, documentada y sostenible. No se basa en una copia manual ni en una cuenta personal.

4. Calidad

Los campos esenciales están completos, coherentes y representativos. Los defectos se miden en relación con la tarea.

5. Estructura

Títulos, secciones, tablas, relaciones e identificadores pueden ser preservados o reconstruidos.

6. Metadatos

Idioma, fecha, versión, estado, tipo, autor, entidad y derechos acompañan el contenido.

7. Versión y frescura

El sistema sabe qué versión está en vigor, cuándo cambió y cuándo la IA debe ser actualizada.

8. Derechos y privacidad

Los permisos pueden ser reproducidos en la cadena de IA y revocados.

9. Trazabilidad

Una salida puede estar relacionada con la fuente, su transformación y la versión de los componentes.

10. Ciclo de vida

La corrección, el archivado y la eliminación se propagan hasta los índices, cachés y registros.

Trazabilidad de un dato desde su fuente hasta su uso por la IA y su eliminación propagada.

Calidad relativa a la tarea

Un dato no es «bueno» en absoluto. Para encontrar un procedimiento, el título, la fecha y el estado son esenciales. Para extraer un monto, la calidad del escaneo, la moneda y la estructura de la tabla dominan.

Las dimensiones pueden incluir integridad, exactitud, coherencia, unicidad, frescura y representatividad. Cada defecto está relacionado con su impacto en el caso de uso.

Una muestra anotada permite medir antes de procesar todo el corpus.

Distinguir referencia, copia y borrador

Varias versiones de un documento pueden circular. El flujo de trabajo debe saber cuál es la válida, qué copias están archivadas y si se puede usar un borrador. La fecha por sí sola no es suficiente: un documento reciente puede no estar aprobado.

Las reglas de prioridad están codificadas y son verificables. En caso de conflicto, el sistema avisa en lugar de elegir silenciosamente.

Preservar la estructura

Convertir un PDF en texto plano puede mezclar columnas, notas y encabezados. Las tablas pierden sus relaciones y los títulos su jerarquía. La extracción debe producir un formato estructurado con una calidad medida.

Para los documentos complejos, conservar:

  • página y datos de contacto;
  • títulos y niveles;
  • celdas y encabezados;
  • listas;
  • leyendas;
  • enlaces;
  • identificador del archivo.

Esta estructura mejora la investigación, las citas y el control humano.

Metadatos y contexto

Los metadatos permiten filtrar y explicar: entidad, producto, país, idioma, fecha, versión, estado, categoría y derechos. Deben provenir de una fuente fiable o de una extracción cuyo nivel de confianza se mantenga.

Una clasificación generada por modelo no tiene el mismo estatus que un campo validado por el negocio. Se registra el origen del enriquecimiento.

Reproducir los derechos

Copiar documentos en un índice único sin permisos crea una posible filtración. Se debe comprender el modelo de autorización: usuario, grupo, empresa, carpeta, sitio, rol o atributo.

Los derechos pueden hacerse efectivos en los metadatos de índice, particiones o en una verificación bajo consulta. Los cambios y eliminaciones se propagan dentro de un plazo definido.

Las cuentas técnicas tienen el mínimo de acceso y las extracciones están registradas.

Minimizar los datos

Un proyecto no debe ingerir toda una carpeta « por si acaso ». Seleccionar los campos y documentos necesarios reduce el riesgo, el costo y el ruido. Los datos personales o secretos pueden ser enmascarados, seudonimizados o excluidos.

La minimización también se refiere a los prompts, registros, comentarios y juegos de evaluación. Los entornos de desarrollo utilizan datos sintéticos o protegidos.

Trazabilidad de extremo a extremo

Cada fragmento o registro debe poder estar vinculado a:

  • fuente y versión;
  • fecha de extracción;
  • transformación;
  • herramienta y versión;
  • reglas de enriquecimiento;
  • índice;
  • salidas que lo han citado cuando sea necesario.

Esta cadena permite investigar un error y reconstruir después de una actualización.

Gestionar las eliminaciones

Eliminar en la fuente no basta. Hay que eliminar o invalidar las copias, índices vectoriales, cachés, archivos temporales y respaldos según la política. Las salidas históricas y los registros siguen una regla distinta definida con los responsables.

El pipeline de supresión se prueba como el de ingestión. Un identificador estable facilita la propagación.

Medir la frescura

La necesidad varía: una política puede tolerar un día, un stock unos minutos. La frescura se sigue por fuente y es visible para el usuario cuando esto influye en la respuesta.

Los eventos o extracciones periódicas deben manejar los fallos. Una alerta señala un retraso en lugar de continuar en silencio con datos antiguos.

Preparar un juego de referencia

Antes de la IA, seleccionar ejemplos representativos y documentar el resultado esperado. Para la extracción: campos y valores. Para el RAG: preguntas y fuentes. Para el agente: estados y acciones autorizadas.

Este juego sirve para comparar pipelines, modelos y correcciones. Incluye casos difíciles, incompletos y prohibidos.

Industrializar la ingestión

El pipeline es:

  • idempotente;
  • versionado;
  • observable;
  • retomable;
  • probado;
  • seguro;
  • capaz de manejar errores de forma aislada.

Los cambios de formato o de fuente desencadenan una alerta. Un panel muestra volumen, errores, retrasos, duplicados y cobertura.

Gobernanza ligera pero real

Una gobernanza útil no requiere un comité para cada archivo. Define propietarios, clases, controles y un procedimiento de excepción. Las decisiones importantes son trazables.

El catálogo de datos puede comenzar con el alcance del proyecto y ampliarse con los usos. Debe mantenerse conectado a los sistemas, no convertirse en una documentación paralela obsoleta.

Construir un backlog de preparación

Las acciones se dividen a menudo en tres horizontes:

30 días

Inventario, acceso, muestra, clasificación y primeras pruebas.

90 días

Canalización reproducible, metadatos, derechos, calidad medida y eliminación.

Fundaciones

Referenciales, gobernanza, automatización, observabilidad y compartición entre casos de uso.

El piloto puede comenzar cuando los riesgos están controlados en un corpus limitado, sin esperar la perfección global.

Los datos como producto de confianza

Una IA confiable depende de datos cuyo significado, propietario, derechos y versión sean conocidos. Esta preparación también beneficia a la investigación, a la analítica y a las integraciones clásicas.

Partitech puede auditar las fuentes, diseñar los pipelines, estructurar los metadatos e integrar los derechos hasta el RAG o el agente. El objetivo es una cadena trazable y mantenible, no una copia masiva de documentos en un nuevo índice.

Hablemos de su proyecto

Evalúe la preparación de sus datos para un proyecto de IA con Partitech. Contacte a Partitech.

Compartir este artículo