Alta disponibilidad
La plataforma está diseñada para seguir funcionando ante fallos cotidianos sin
intervención manual.
Autorreparación
Gracias a la orquestación sobre Kubernetes, cada componente está supervisado de
forma continua. Si uno deja de responder o falla:
- La plataforma lo reinicia o reemplaza automáticamente.
- El tráfico se redirige a las instancias sanas mientras tanto.
No hace falta que un operador esté pendiente para recuperarse de un fallo puntual de
un componente.
Redundancia: sobre qué se apoya la autorreparación
Reemplazar un componente solo sirve si hay dónde llevarlo y quién siga atendiendo
mientras tanto. De ahí las cuatro capas de redundancia del servicio:
- Varios servidores. El clúster que ejecuta los entornos está formado por
varias máquinas. La caída de una no se lleva por delante el servicio: sus
componentes se reprograman en las demás.
- Varias instancias de tu aplicación. Un entorno puede ejecutarse con más de
una copia de la aplicación atendiendo en paralelo, de modo que la pérdida de
una no interrumpe el servicio.
- Base de datos con réplica. La base de datos puede desplegarse con una copia
secundaria sincronizada y conmutación por error automática: si el ejemplar
principal falla, la réplica toma el relevo sin intervención manual y sin
restaurar una copia de seguridad.
- Puerta de entrada redundante. El tráfico entra por una pasarela que corre
siempre con varias instancias y ajusta su número según el tráfico.
Qué es estándar y qué se activa
La redundancia del clúster y de la puerta de entrada es de la plataforma:
la tienes por el hecho de estar en ella. Las instancias adicionales de tu
aplicación y la réplica de base de datos son capacidades disponibles que
activamos a petición tuya, o por recomendación nuestra cuando lo que medimos lo
aconseja. Detalle en Escalado y capacidad.
Rendimiento bajo carga
Seguir en pie ante un fallo y seguir respondiendo ante un pico son dos problemas
distintos. El segundo —modelos de despliegue, dimensionamiento, niveles de
capacidad y qué pasa en un cierre de mes o una integración masiva— tiene página
propia: Escalado y capacidad.
Despliegues sin interrupción
Los cambios y actualizaciones se aplican mediante reemplazo progresivo: las
nuevas versiones entran de forma gradual mientras las anteriores siguen
sirviendo, de modo que no haya un corte perceptible. Consulta
Despliegues y cambios.
Hasta dónde llega, y dónde empieza otra cosa
La alta disponibilidad descrita aquí opera dentro del emplazamiento en el que
se ejecuta tu entorno. Una contingencia que afecte al emplazamiento completo se
responde por la vía de la recuperación ante desastres, a partir de copias
separadas y reconstrucción reproducible.
Pendiente de validación
Los compromisos de disponibilidad (porcentaje de uptime) aplicables a tu
servicio se recogen en tu contrato de servicio.