Volver a proyectos
TFM2026

Document Structure AI TFM

Plataforma integral que transforma documentos escaneados y PDFs en HTML limpio y editable, preservando fielmente la estructura visual original. El sistema utiliza un pipeline híbrido de IA que combina visión por computador local (DocLayout-YOLOv10) para la segmentación del documento y LLMs en la nube (Gemini) para el OCR semántico, asegurando que ningún componente crítico como firmas, sellos o tablas se pierda durante la reconstrucción.

Características principales

01

Carga por arrastrar y soltar

Sube apuntes escaneados o PDFs al instante. Compatible con imágenes y documentos de varias páginas con un solo gesto de arrastrar y soltar.

02

Detección de estructura con IA

DocLayout-YOLOv10 analiza la estructura visual en tiempo real, detectando títulos, párrafos, listas, tablas, logos, firmas y sellos.

03

Reconstrucción semántica a HTML

La API de Gemini transcribe y estructura el documento en HTML5 limpio y accesible, preservando fielmente la jerarquía y el orden de lectura original.

04

Reconstrucción híbrida

Los elementos no textuales como firmas y sellos se extraen con OpenCV y se reinsertan como Data URLs, asegurando que no se pierda nada.

Proceso de desarrollo

01

Ideación e investigación

Definí el problema central — convertir apuntes manuscritos o escaneados en documentos digitales estructurados y editables. Exploré modelos de vanguardia para detección de layouts (DocLayout-YOLO) y OCR (TrOCR, Gemini).

02

Prototipado del modelo

Probé múltiples combinaciones de modelos en un notebook de Colab. Comparé variantes de YOLO, evalué TrOCR frente a Gemini en precisión de extracción de texto y refiné el pipeline de detección.

03

Integración en API

Una vez que el pipeline fue estable, lo integré en un microservicio FastAPI. Añadí rasterización de PDFs (pdf2image), normalización de imágenes (Pillow/OpenCV) y prompting estructural con Gemini.

04

Desarrollo del frontend

Construí una interfaz con React/Next.js que incluye carga por arrastrar y soltar, previsualización de bloques detectados en tiempo real y un panel de HTML editable. Desplegué la aplicación en Google Cloud Run.

05

Defensa del TFM

Presenté el proyecto completo ante el jurado del Máster, cubriendo la arquitectura, las decisiones del pipeline y una demo en vivo de la aplicación funcionando.

Reflexiones y aprendizajes

Construir un pipeline genérico de visión por computador es más difícil de lo que parece — los casos extremos se multiplican rápido: calidad de imagen variable, texto manuscrito frente a impreso, layouts complejos con múltiples columnas, millones de formatos de documento posibles. El modelo funciona bien dentro de su alcance, pero necesitaría muchos más datos de entrenamiento para generalizar. Tras presentar el proyecto, hablé con otros estudiantes que confirmaron lo útil que sería una herramienta así — algo cercano a NotebookLM pero con la digitalización consciente del layout como funcionalidad principal. Un siguiente paso evidente (que me faltó tiempo para probar) es mejorar el reconocimiento de texto manuscrito en el pipeline.

Galería

Defensa del TFM ante el tribunal académico. MIOTI, 2026.

Defensa del TFM ante el tribunal académico. MIOTI, 2026.

Prototipo de la aplicación

Prototipo de la aplicación

Prototipo de la aplicación

Prototipo de la aplicación

Stack tecnológico

Python
FastAPI
YOLOv10
TrOCR
Gemini API
React
Next.js
Tailwind CSS
OpenCV
Docker
Google Cloud Run