Un proveedor te manda su contrato marco (MSA) en PDF. Lo subes a tu herramienta de comparación y te responde que «no se ha podido extraer texto de este documento». Abres el archivo y se ve perfectamente: el texto está ahí, delante de tus ojos. ¿Qué está pasando?
Los dos tipos de PDF que casi nadie en compras distingue
Todo PDF que recibas pertenece a una de estas dos familias:
- PDF de texto nativo. Se generan de forma digital: Word con «Guardar como PDF», exportaciones de Google Docs, Pages, LaTeX. El texto se puede seleccionar, buscar y procesar de forma automática. Son entre un 60 % y un 70 % de las ofertas de proveedores que te llegan.
- PDF de imagen (escaneados). Salen de imprimir un documento y pasarlo por el escáner, o de exportaciones en imagen de algunas herramientas de Word a PDF. A simple vista son idénticos a los nativos, pero el texto son píxeles, no caracteres. Cuando crees que seleccionas texto, en realidad copias una imagen. Son entre un 30 % y un 40 % de las ofertas.
La prueba de siempre: abre el PDF, haz clic en mitad de un párrafo e intenta seleccionar una frase. Si la selección respeta las palabras y los signos de puntuación, es texto nativo. Si lo que se dibuja es un rectángulo sobre la imagen, es un escaneado.
¿Por qué los PDF escaneados rompen la mayoría de herramientas con IA?
Las librerías habituales de extracción de texto (pdfjs, pdfminer, PyPDF2) leen la capa de texto del PDF. Si no hay capa de texto — porque el PDF es una imagen — devuelven una cadena vacía. La mayoría de comparadores con IA se toman esa cadena vacía al pie de la letra, se la pasan al modelo y producen un análisis inservible: «El documento 2 no contiene contenido extraíble». Y ahí se queda el usuario, sin nada que comparar.
La solución es el reconocimiento óptico de caracteres (OCR): pasar cada página por un modelo de visión que lee los píxeles y devuelve el texto que hay en ellos. El OCR es una tecnología con sesenta años de historia y los motores de código abierto actuales (Tesseract, EasyOCR, PaddleOCR) superan el 95 % de acierto en documentos de empresa escaneados con calidad decente en inglés.
Cómo lo resuelve POCsheet
Cuando subes un PDF, POCsheet sigue este orden:
- Intentar primero la extracción de texto nativo, que es instantánea y no consume recursos.
- Tratar el PDF como escaneado si el texto extraído no llega a unos 30 caracteres por página de media y ninguna página supera los 80 caracteres.
- Recurrir a Tesseract.js, que ejecuta el OCR sobre todas las páginas en tu navegador. Los PDF no salen de tu equipo.
- Mostrar el progreso en directo: «Escaneando
SLA_v2.pdfcon OCR — página 6 de 14…». - Pasar el texto reconocido al mismo circuito de IA de siempre. El informe funciona igual que cualquier otra comparación, incluidas las citas de origen.
El OCR es más lento que la extracción nativa: entre 3 y 6 segundos por página con el escalado de 1,5× que usamos. Un contrato marco escaneado de 12 páginas tarda unos 45 segundos. La interfaz lo cuenta mientras ocurre, con el progreso a la vista, para que la espera sea honesta. Con los PDF de texto nativo, que son la mayoría, no cambia nada: la extracción sigue siendo inmediata.
Qué suele significar que te manden un PDF escaneado
Conviene decirlo: un proveedor que en 2026 te envía una propuesta escaneada está haciendo una de estas tres cosas:
- Su plantilla vive en un gestor documental que exporta en imagen (flujos antiguos de Conga o DocuSign).
- Su departamento jurídico imprime, firma y vuelve a escanear para crear una versión «final» con firma manuscrita.
- Está aplanando el documento para que no se pueda editar ni comentar.
Ninguna de las tres es una señal de alerta por sí sola. La tercera sí merece una comprobación rápida: ¿te están poniendo difícil el marcado de cambios (redlining)? En cualquier caso, con OCR y comparación con IA ya no tienes que volver a teclear el contrato en un Word para poder negociarlo.
Límites que conviene reconocer
- La precisión del OCR cae en picado con escaneados de mala calidad: torcidos, con poca resolución o desvaídos. Ahí puede compensar rehacer el OCR con una herramienta de escritorio.
- Un documento que no esté en inglés procesado con modelos entrenados solo en inglés devuelve un galimatías. POCsheet usa el inglés por defecto y el OCR multiidioma está en la hoja de ruta.
- Las tablas de un PDF escaneado vuelven como texto plano, no como filas estructuradas. El modelo suele reconstruir la estructura, aunque no siempre con exactitud.