El OCR tradicional transforma una imagen en caracteres. Para automatizar un proceso o alimentar un RAG, se necesita más: entender el orden de lectura, reconstruir las tablas, identificar los bloques, localizar una firma, conservar las coordenadas e indicar las zonas inciertas.
En 2026, modelos especializados como Mistral OCR 4 y el servicio OCR 4.1 anunciado en la documentación oficial ilustran esta evolución hacia una Inteligencia Documental multimodal. La producción todavía exige una cadena de seguridad, evaluación y validación específica del corpus.
Las características, idiomas, modos de implementación y tarifas deben ser verificados nuevamente en la documentación del proveedor.
Por qué falla el texto sin formato
Un PDF puede contener dos columnas, una tabla, notas, una imagen y una firma. Una extracción lineal puede mezclar las líneas o asociar un monto con el encabezado incorrecto.
Para un RAG, un pasaje sin título ni página produce una cita débil. Para una extracción, un valor sin coordenadas es difícil de verificar. Para una conformidad, la versión y la integridad del archivo son esenciales.
La salida debe, por lo tanto, representar el documento, no solo sus caracteres.
Las capas de comprensión
Imagen y preprocesamiento
Rotación, ruido, contraste, resolución y páginas faltantes son detectados. El preprocesamiento no debe borrar elementos útiles.
Segmentación
El motor localiza párrafos, títulos, tablas, figuras, ecuaciones, encabezados, pies de página, firmas y campos.
Reconocimiento
El texto y los símbolos se extraen con idioma y confianza.
Estructura
El orden de lectura, los niveles de título, las celdas, las listas y las relaciones se reconstruyen.
Semántica
El sistema identifica el tipo de documento, campos y entidades según el caso de uso.
Procedencia
Cada resultado corresponde a una página y una zona del documento original.
Formatos de salida
Un Markdown enriquecido puede preservar títulos, listas y tablas. El JSON conserva bloques, coordenadas, tipos, confianza y relaciones. Las imágenes o figuras pueden ser referenciadas por separado.
El formato interno debe estar versionado e independiente de un proveedor. Las salidas en bruto del motor se conservan temporalmente para diagnóstico según la política.
Las coordenadas utilizan una convención clara y permiten un resaltado en el visor.
Construir un juego de evaluación por bloques
Evaluar únicamente el texto global oculta errores importantes. El juego debe calificar:
- texto ;
- orden ;
- títulos ;
- cuadros;
- campos ;
- coordenadas;
- firmas ;
- ecuaciones ;
- lengua ;
- documento completo.
Los documentos están estratificados por calidad, idioma, formato y complejidad. Los casos difíciles y raros están sobrerrepresentados si su impacto es alto.
Pipeline documental desde el depósito seguro hasta la extracción, la validación, el almacenamiento estructurado y el RAG.
Métricas adaptadas
La distancia de caracteres o palabras mide la transcripción, pero no la estructura. Para los campos, utilizar exactitud y tolerancias de negocio. Para los bloques, comparar tipo y posición. Para una tabla, verificar celdas, encabezados y relaciones.
El resultado más útil suele ser la tasa de documentos sin error crítico, ya que un solo valor incorrecto puede invalidar el proceso.
Las puntuaciones del proveedor se completan con las pruebas internas.
Confianza y calibración
Un puntaje de confianza solo es útil si corresponde al riesgo real sobre el corpus. Hay que medir, por tramo de confianza, la tasa de error. Dos motores pueden usar escalas diferentes.
Las reglas de validación pueden ser:
- confianza por debajo del umbral;
- campo crítico;
- incoherencia de cálculo;
- formato nuevo;
- documento incompleto;
- valores fuera de rango;
- divergencia entre motores.
El umbral se ajusta para equilibrar la calidad y la carga humana.
Validación humana
La interfaz muestra el documento y el valor uno al lado del otro, con resaltado de la zona. El validador corrige rápidamente, señala un tipo desconocido y ve las reglas.
Las correcciones son trazables y pueden alimentar la evaluación. No se utilizan automáticamente para entrenar sin control.
La carga de revisión está dimensionada con los picos. Una fila prioriza los documentos críticos y cercanos a un plazo.
Cuadros
Las tablas requieren la estructura: fusión de celdas, encabezados múltiples, unidades, totales y notas. Una representación HTML o JSON debe conservar las relaciones.
Los controles pueden recalcular sumas, impuestos y coherencia. Un modelo no debe inventar una celda faltante sin señalar la incertidumbre.
Para el RAG, la tabla puede ser indexada en bloque y acompañada de una descripción, manteniendo el vínculo con las celdas de origen.
Documentos manuscritos y de baja calidad
El manuscrito, los sellos, las fotocopias y la compresión reducen la calidad. El sistema detecta estas categorías y puede elegir otro motor, solicitar un nuevo escaneo o imponer una revisión.
Un pretratamiento agresivo puede suprimir un rasgo o una firma. Las transformaciones están versionadas y el original se conserva según las reglas.
Multilingüe
La detección de idioma funciona por página o bloque. Los nombres propios, códigos y unidades no se traducen. Los modelos deben probarse en los idiomas reales y los alfabetos correspondientes.
El pipeline conserva el idioma original. Una traducción eventual es un artefacto distinto con procedencia.
Seguridad del depósito
Los archivos entrantes no son fiables. Pasan por tamaño máximo, tipo verificado, análisis antimalware y tratamiento aislado. Las macros, scripts y contenidos activos no se ejecutan.
Los enlaces e imágenes externas no se recuperan libremente. Los archivos temporales se eliminan y los accesos se registran.
Datos personales y secretos
El pipeline aplica clasificación, cifrado, acceso, residencia y retención. Los registros no guardan el texto completo por defecto. Los juegos de prueba están anonimizados o autorizados.
La redacción puede usar las coordenadas, pero debe ser verificada: ocultarlas visualmente sin eliminar la capa de texto no es suficiente.
Integración en el RAG
Los títulos, páginas, bloques, tablas y coordenadas acompañan cada fragmento. La respuesta cita el pasaje y permite abrir la zona correspondiente.
Los documentos reemplazados o eliminados se retiran del índice. Los errores de extracción son visibles y pueden excluir un archivo en lugar de introducir ruido.
Extracción estructurada
Un siguiente paso mapea los bloques hacia un esquema de negocio. El modelo recibe únicamente el contenido necesario y devuelve un formato validado. Las reglas controlan fechas, montos, identificadores y relaciones.
La fuente, la confianza y la corrección humana se conservan para cada campo.
Elegir API, servicio gestionado o autoalojamiento
Una API acelera el piloto y absorbe los picos. Un despliegue privado puede responder a restricciones de datos y volumen. Un servicio Document AI añade interfaz y flujo de trabajo.
Comparar calidad, idiomas, estructura, coordenadas, costo, caudal, residencia, soporte, exportación y reversibilidad sobre la misma muestra.
Observabilidad
Seguir :
- páginas tratadas ;
- errores;
- duración;
- costo;
- tipos de bloques;
- confianza;
- tasa de revisión ;
- correcciones ;
- formatos desconocidos ;
- retraso ;
- supresiones.
Un cambio de fuente o de modelo desencadena una campaña de regresión.
Desplegar por familia de documentos
Comenzar con una familia estable y de alto valor. Construir el juego, las reglas y la interfaz de validación. Luego añadir variantes midiendo la cobertura.
Un motor universal no elimina la modelización de negocios. Cada familia tiene sus campos, excepciones y controles.
Del documento a un dato comprobable
La Document Intelligence se vuelve útil cuando transforma un archivo en una estructura rastreable, no cuando simplemente produce mucho texto. Las coordenadas, la confianza y la validación hacen que los datos sean explotables.
Partitech puede construir el pipeline, comparar los motores, integrar Mistral OCR o un despliegue privado, desarrollar el visor y alimentar RAG y aplicaciones empresariales. El objetivo es una extracción medible y verificable, adaptada a los documentos reales.
Hablemos de su proyecto
Prototipar una cadena de Document Intelligence sobre sus documentos con Partitech. Contacte a Partitech.