Skip to content

Details

Desplegar aplicaciones basadas en Modelos de Lenguaje (LLMs) en entornos empresariales exige el mismo rigor de ingeniería de software, observabilidad y control de costos que cualquier sistema de misión crítica. Pasar de un prototipo a producción no puede depender de validaciones manuales ni de estimaciones a ciegas.

Esta sesión técnica y práctica aborda los desafíos arquitectónicos de operar agentes y pipelines de IA generativa con control total sobre telemetría, calidad y presupuesto. Los participantes aprenderán a diseñar e implementar una infraestructura local y reproducible basada en contenedores para instrumentar, monitorear y evaluar continuamente el comportamiento de sus modelos antes y durante su despliegue a producción.
Objetivo del Workshop:
Guiar a los desarrolladores y arquitectos en la implementación de una arquitectura local de evaluación y observabilidad continua para aplicaciones basadas en LLMs. El objetivo central es eliminar la incertidumbre en producción aprendiendo a medir latencia, tokenómica/costos, precisión semántica de respuestas y detección de regresiones mediante la orquestación de Langfuse en Docker Compose y la instrumentación estructurada con Pydantic AI.
Puntos Clave del Workshop:

  • Arquitectura de Observabilidad Local: Despliegue y configuración de Langfuse stack (PostgreSQL, ClickHouse/Redis, UI y API) utilizando Docker Compose para garantizar reproducibilidad e independencia de la nube durante el desarrollo.
  • Desarrollo de Agentes Type-Safe con Pydantic AI: Construcción de flujos e interacciones con LLMs tipadas, estructuradas y listas para producción, asegurando validación de esquemas y manejo determinista de respuestas.
  • Instrumentación y Trazabilidad Extremo a Extremo: Captura granular de spans, llamadas a herramientas (function calling), trazas de ejecución completas y cálculo automático de consumo de tokens y costos asociados (FinOps para IA).
  • Framework de LLM Evals: Implementación de pipelines de evaluación automatizada (métricas basadas en reglas, heurísticas y evaluadores LLM-as-a-judge) para medir relevancia, alucinaciones y apego a instrucciones.
  • Estrategias contra Regresiones: Configuración de suites de prueba reproducibles para validar cambios en prompts, ajuste de hiperparámetros o migraciones de modelos sin degradar la experiencia de usuario ni disparar costos.

Audiencia Objetivo:

Arquitectos de Software, Ingenieros de Datos/MLOps, Desarrolladores Backend y Líderes Técnicos que buscan estandarizar las prácticas de ingeniería y observabilidad en sus cargas de trabajo de IA generativa.

Related topics

Sponsors

Docker Inc.

Docker Inc.

Docker goodies!

Microsoft

Microsoft

Ofrece las instalaciones para los eventos!

You may also like