Plataforma integral que transforma documentos escaneados y PDFs en HTML limpio y editable, preservando fielmente la estructura visual original. El sistema utiliza un pipeline híbrido de IA que combina visión por computador local (DocLayout-YOLOv10) para la segmentación del documento y LLMs en la nube (Gemini) para el OCR semántico, asegurando que ningún componente crítico como firmas, sellos o tablas se pierda durante la reconstrucción.
Sube apuntes escaneados o PDFs al instante. Compatible con imágenes y documentos de varias páginas con un solo gesto de arrastrar y soltar.
DocLayout-YOLOv10 analiza la estructura visual en tiempo real, detectando títulos, párrafos, listas, tablas, logos, firmas y sellos.
La API de Gemini transcribe y estructura el documento en HTML5 limpio y accesible, preservando fielmente la jerarquía y el orden de lectura original.
Los elementos no textuales como firmas y sellos se extraen con OpenCV y se reinsertan como Data URLs, asegurando que no se pierda nada.
Definí el problema central — convertir apuntes manuscritos o escaneados en documentos digitales estructurados y editables. Exploré modelos de vanguardia para detección de layouts (DocLayout-YOLO) y OCR (TrOCR, Gemini).
Probé múltiples combinaciones de modelos en un notebook de Colab. Comparé variantes de YOLO, evalué TrOCR frente a Gemini en precisión de extracción de texto y refiné el pipeline de detección.
Una vez que el pipeline fue estable, lo integré en un microservicio FastAPI. Añadí rasterización de PDFs (pdf2image), normalización de imágenes (Pillow/OpenCV) y prompting estructural con Gemini.
Construí una interfaz con React/Next.js que incluye carga por arrastrar y soltar, previsualización de bloques detectados en tiempo real y un panel de HTML editable. Desplegué la aplicación en Google Cloud Run.
Presenté el proyecto completo ante el jurado del Máster, cubriendo la arquitectura, las decisiones del pipeline y una demo en vivo de la aplicación funcionando.
Construir un pipeline genérico de visión por computador es más difícil de lo que parece — los casos extremos se multiplican rápido: calidad de imagen variable, texto manuscrito frente a impreso, layouts complejos con múltiples columnas, millones de formatos de documento posibles. El modelo funciona bien dentro de su alcance, pero necesitaría muchos más datos de entrenamiento para generalizar. Tras presentar el proyecto, hablé con otros estudiantes que confirmaron lo útil que sería una herramienta así — algo cercano a NotebookLM pero con la digitalización consciente del layout como funcionalidad principal. Un siguiente paso evidente (que me faltó tiempo para probar) es mejorar el reconocimiento de texto manuscrito en el pipeline.

Defensa del TFM ante el tribunal académico. MIOTI, 2026.

Prototipo de la aplicación

Prototipo de la aplicación