Conversacion iniciada con Monitor de Produccion IA.
El endpoint vLLM lleva 45 minutos caido. Que esta pasando?
02:13
Diagnostico: el proceso vLLM en GEX44 consumio toda la VRAM (24GB) durante un batch de embedding grande. OOM killer lo termino. Auto-recovery fallo porque el puerto sigue ocupado.
02:18 · 🔍 Observabilidad
Mata el proceso manualmente y reinicia con batch size reducido.
02:23
Proceso terminado. Reiniciando vLLM con max_batch_size=8 (era 16). Estimado: servicio disponible en 90 segundos.
02:28 · 🔍 Observabilidad
Confirma cuando este operativo.
02:33
Endpoint vLLM operativo. Health check OK. Latencia: 1.8s (nominal). VRAM: 19.2GB/24GB. Batch size ajustado permanentemente.
02:38 · 🔍 Observabilidad