En un sistema multi-agente, el peor UX no es la latencia: es perder el trabajo. En Laravel endurecimos la cola: cortes de infraestructura reencolan; restarts de API no se guardan como cancelación humana; queries rotas en PostgreSQL se detectan con guard de clase.
Fixes de producciónReencolado en corte de infra, no-marcar-cancelado-en-restart, dos queries que PostgreSQL rechazaba siempre, guard de clase para silent failures, y warmup de hilos de email sin respuesta pre-escrita.
Por qué es noticia de producto
Los 8 agentes ADRI dependen de OllamaTasker + Node balancer + FastAPI. Si un worker reinicia a las 3AM, el comercial no debería ver “cancelaste la tarea”. Debería ver reintento o reencolado — y el silent-failure-hunter no debería mentir sobre el corte.
- Tareas largas (OSINT, code, vision) sobreviven a blips
- Billing y tools_used solo se cierran en fin real de turno
- Operadores ven el motivo honesto del corte
