Francisco Javier Luengo Gutiérrez

Francisco Javier Luengo Gutiérrez es arqueólogo y Machine Learning Engineer con experiencia en visión por computador y reconstrucción digital.

Su trabajo integra fotogrametría, modelado tridimensional y análisis lumínicos en el desarrollo de pipelines de Machine Learning basados en Python.

Su enfoque se centra en la combinación de datos sintéticos, información geométrica y modelos multimodales para resolver problemas arqueológicos complejos con limitaciones de datos, dentro de su iniciativa ArqueoBytes. Es además director de la revista de divulgación histórica ArqueoTimes desde donde comparte el impacto de las nuevas tecnologías en las Humanidades Digitales.


Sesión

07/11
10:50
40minutos
¿De quién es este hueso? Clasificación zooarqueológica con Python, Machine Learning y datos sintéticos
Francisco Javier Luengo Gutiérrez

En muchos proyectos de Machine Learning, el principal obstáculo no es el modelo, sino la ausencia de datos adecuados. ¿Cómo diseñar un sistema cuando los datos son escasos, inconsistentes o difíciles de obtener?

En esta charla se presenta el diseño de un pipeline de Machine Learning implementado en Python que aborda este problema combinando generación de datos sintéticos, extracción de features y clasificación jerárquica. A través de un caso de uso en zooarqueología (la identificación de restos óseos a partir de imágenes) se construye un sistema capaz de operar en condiciones de datos limitados combinando visión y datos tabulares.

El pipeline integra distintas etapas: preprocesado de imágenes con OpenCV, generación de datos sintéticos a partir de modelos 3D utilizando Blender y su API en Python, extracción de features geométricas, y entrenamiento de modelos de Machine Learning con PyTorch. En lugar de depender de un único modelo, el sistema se estructura en varios niveles de decisión que permiten reducir progresivamente el espacio de búsqueda antes de la clasificación final.

Se mostrará cómo Python permite orquestar todo el flujo, desde la generación del dataset hasta el entrenamiento y evaluación, apoyándose en herramientas como DVC y MLflow para la reproducibilidad y seguimiento de experimentos.

Además, se discutirán retos habituales en este tipo de sistemas, como la brecha entre datos sintéticos y reales, la estimación de escala a partir de imágenes y la gestión de la incertidumbre en pipelines jerárquicos.

Machine learning e inteligencia artificial
Track 05