Extraer datos de documentos con IA: esquema, validación y revisión
La extracción con IA necesita definir campos, validar tipos y reglas, conservar evidencia y derivar los casos ambiguos antes de cargar datos en otro sistema.
Facturas, formularios, solicitudes y expedientes contienen información útil, pero no siempre comparten una plantilla. Un modelo puede ayudar a interpretar esa variación. El resultado todavía debe pasar por un esquema, reglas de negocio y revisión antes de convertirse en un dato operativo.
El objetivo no es “leer PDFs”, sino producir campos definidos con evidencia y un estado conocido: aceptado, rechazado o pendiente de revisión. Esa diferencia permite integrar la extracción con un ERP, una base de datos o un flujo administrativo.
Definir el esquema antes de procesar
Cada campo necesita nombre, tipo, obligatoriedad y significado. Fecha de emisión no es fecha de vencimiento; total no es base imponible. Enumeraciones, monedas y unidades deben quedar delimitadas. Si el destino exige un identificador interno, también se define cómo se relacionará.
Separar lectura, interpretación y normalización
Un documento puede requerir extracción de texto u OCR antes de interpretar. Después, la salida se normaliza a fechas, decimales o códigos compatibles con el destino. Mezclar todas las etapas dificulta saber si el fallo está en la imagen, el modelo o una regla de transformación.
Validar fuera del modelo
Un esquema comprueba que la respuesta tenga los campos y tipos previstos. Las reglas de negocio verifican relaciones: suma de conceptos, rango de fechas, proveedor conocido o identificador no duplicado. Una salida estructurada reduce ambigüedad, pero no demuestra por sí sola que el contenido sea correcto.
Conservar evidencia útil
Para revisar un campo conviene relacionarlo con página, fragmento o zona de origen cuando sea posible. La persona no debería releer todo el expediente para confirmar una cifra. La evidencia también ayuda a distinguir un documento ilegible de una interpretación incorrecta.
Diseñar una bandeja de revisión
Los casos incompletos, contradictorios o de alto impacto se muestran con el documento y los campos propuestos. La corrección humana puede alimentar el conjunto de evaluación, pero no debe reutilizarse automáticamente como entrenamiento sin una decisión explícita sobre datos y finalidad.
Medir por campo y por documento
Una precisión global puede ocultar que el campo más importante falla. Se evalúa cada dato, el porcentaje de documentos que pasan sin revisión, los rechazos correctos y el coste de corregir. También se incluyen formatos nuevos y archivos de mala calidad.
Cuándo usar plantillas u OCR convencional
Si todos los documentos tienen una estructura estable, una plantilla o extracción determinista puede ser más barata y predecible. La IA aporta más cuando existe variación semántica real, siempre que el volumen y el valor del dato justifiquen evaluación y mantenimiento.