Almudena Zhou Ramírez López
I design and ship Generative AI systems at scale, turning messy real-world problems into software that actually works in production. I take a software-first approach and own the full lifecycle, taking AI products from early prototype to reliable, cost-efficient systems people can rely on.
Sesión
Cuando integras un LLM en una aplicación, una parte de tu lógica de negocio pasa a ser probabilística. El problema se complica en escenarios de tiempo real: la latencia es estricta y no te puedes permitir una segunda llamada al modelo para corregir la primera. Si el LLM se equivoca, hay que detectarlo y gestionarlo en el mismo turno.
En esta charla veremos los tipos de fallo más comunes en un sistema conversacional con LLM: extracción incorrecta, salidas casi válidas, instrucciones ignoradas, fallos en el cliente,... y las estrategias que aplicamos en producción para gestionarlos con restricciones de latencia. Como hilo conductor, un agente conversacional con llamadas reales.
Veremos qué patrones funcionan, cuáles parecen buena idea y no lo son, y cuándo lo correcto es devolver el control a un humano. Cerraremos con una demo en vivo de algunas de las soluciones aplicadas.