Servicio afectado: servidores cloud alojados en el nodo Nova
Inicio: domingo 30/08/2026, 06:10 h
Servicio restablecido: jueves 03/09/2026, madrugada
Estado: resuelto — sin pérdida de información
El domingo 30 de agosto a las 06:10 h, la falla de un componente del sistema de almacenamiento del nodo Nova desencadenó un efecto en cadena que dejó a los servidores virtuales de esa plataforma sin acceso a sus discos.
El equipo de guardia detectó el problema en el momento en que se produjo y comenzó a trabajar de inmediato. A las 06:40 h publicamos el aviso en status.donweb.com, que mantuvimos actualizado hasta el cierre del incidente.
Queremos ser claros sobre lo que siguió, porque explica por qué la interrupción duró lo que duró.
Nova es el nodo más antiguo de nuestra plataforma de Cloud & IaaS: está en servicio de forma ininterrumpida desde 2012, y aloja bastantes menos servidores que nuestros otros nodos. Desde 2023 el crecimiento de la plataforma se concentra en nodos de generación más reciente.
Como toda nuestra infraestructura, está preparada para operar con contingencias. Cuenta con márgenes dimensionados para absorber fallas que exceden la operatoria diaria, y en condiciones normales ese margen resuelve este tipo de eventos sin que el cliente llegue a percibirlos.
Lo del 30 de agosto excedió ese margen. Por el volumen de información que la plataforma llegó a alojar, la recuperación en sí misma —no la falla inicial— exigió de la infraestructura mucho más de lo que demanda una contingencia prevista. Eso es lo que condicionó el tiempo que tomó restablecer el servicio, y es el punto sobre el que estamos trabajando.
Cuando quedó claro que el restablecimiento no iba a ser inmediato, tomamos una decisión deliberada: apagar de forma preventiva los aproximadamente 7.000 servidores virtuales de la plataforma, sabiendo que eso extendía la interrupción.
El motivo es concreto. Un servidor que sigue encendido sobre un almacenamiento degradado no deja de trabajar: sigue intentando escribir en disco y completa esas escrituras a medias. El resultado son sistemas de archivos corruptos, bases de datos dañadas y servidores que después no vuelven a arrancar. Ese daño es permanente — no se repara solo cuando la plataforma se recupera.
Apagar los servidores congela su estado. Alarga la indisponibilidad, pero protege el dato.
La misma lógica gobernó toda la recuperación. En lugar de encender la plataforma de una vez, la restablecimos componente por componente, verificando el estado de cada uno antes de avanzar al siguiente, de forma ininterrumpida entre el domingo y el jueves. Es un método lento y mayormente manual, y es la razón por la que el incidente se extendió cuatro días. Es también la razón por la que terminó sin pérdida de información.
Fue una decisión consciente y la volveríamos a tomar. No minimizamos lo que significaron esos días para quienes tenían sus servicios detenidos, y entendemos el perjuicio. Pero entre restablecer más rápido con riesgo de devolver datos corruptos, y tardar más para devolver la información intacta, elegimos lo segundo. Un servicio caído se recupera; la información perdida, no.
| Fecha y hora | Hecho |
|---|---|
| Dom 30/08, 06:10 | Se detecta la falla. El equipo de guardia comienza a trabajar en la recuperación del nodo. |
| Dom 30/08, 06:40 | Se publica el aviso en status.donweb.com y se continúa trabajando en la recuperación. |
| Dom 30/08, tarde | Se decide el apagado preventivo de los servidores de la plataforma para proteger la integridad de la información durante la recuperación. |
| Lun 31/08 – mié 02/09 | Se continúa con la recuperación progresiva y verificada, componente por componente, sin interrupción. |
| Mié 02/09, ~20:00 | La plataforma comienza a estabilizarse. |
| Jue 03/09, madrugada | Recuperación completa. Durante la mañana se completa el encendido de los servidores. |
El incidente dejó aprendizajes que ya estamos aplicando:
Si después del restablecimiento notás algo que no funciona como antes, o por cualquier consulta que tengas, escribinos por los canales de soporte habituales y lo revisamos con vos.
Lamentamos el impacto que este incidente tuvo sobre tu operación y te agradecemos la paciencia durante esos días.
Equipo de DonWeb