Fallas en servicios de Cloud Servers en nodo Nova.

Incident Report for Status DonWeb

Postmortem

Informe del incidente del 30 de agosto de 2026

Servicio afectado: servidores cloud alojados en el nodo Nova
Inicio: domingo 30/08/2026, 06:10 h
Servicio restablecido: jueves 03/09/2026, madrugada
Estado: resuelto — sin pérdida de información

Qué ocurrió

El domingo 30 de agosto a las 06:10 h, la falla de un componente del sistema de almacenamiento del nodo Nova desencadenó un efecto en cadena que dejó a los servidores virtuales de esa plataforma sin acceso a sus discos.

El equipo de guardia detectó el problema en el momento en que se produjo y comenzó a trabajar de inmediato. A las 06:40 h publicamos el aviso en status.donweb.com, que mantuvimos actualizado hasta el cierre del incidente.

Queremos ser claros sobre lo que siguió, porque explica por qué la interrupción duró lo que duró.

Sobre la plataforma afectada

Nova es el nodo más antiguo de nuestra plataforma de Cloud & IaaS: está en servicio de forma ininterrumpida desde 2012, y aloja bastantes menos servidores que nuestros otros nodos. Desde 2023 el crecimiento de la plataforma se concentra en nodos de generación más reciente.

Como toda nuestra infraestructura, está preparada para operar con contingencias. Cuenta con márgenes dimensionados para absorber fallas que exceden la operatoria diaria, y en condiciones normales ese margen resuelve este tipo de eventos sin que el cliente llegue a percibirlos.

Lo del 30 de agosto excedió ese margen. Por el volumen de información que la plataforma llegó a alojar, la recuperación en sí misma —no la falla inicial— exigió de la infraestructura mucho más de lo que demanda una contingencia prevista. Eso es lo que condicionó el tiempo que tomó restablecer el servicio, y es el punto sobre el que estamos trabajando.

La decisión: primero la información, después el tiempo

Cuando quedó claro que el restablecimiento no iba a ser inmediato, tomamos una decisión deliberada: apagar de forma preventiva los aproximadamente 7.000 servidores virtuales de la plataforma, sabiendo que eso extendía la interrupción.

El motivo es concreto. Un servidor que sigue encendido sobre un almacenamiento degradado no deja de trabajar: sigue intentando escribir en disco y completa esas escrituras a medias. El resultado son sistemas de archivos corruptos, bases de datos dañadas y servidores que después no vuelven a arrancar. Ese daño es permanente — no se repara solo cuando la plataforma se recupera.

Apagar los servidores congela su estado. Alarga la indisponibilidad, pero protege el dato.

La misma lógica gobernó toda la recuperación. En lugar de encender la plataforma de una vez, la restablecimos componente por componente, verificando el estado de cada uno antes de avanzar al siguiente, de forma ininterrumpida entre el domingo y el jueves. Es un método lento y mayormente manual, y es la razón por la que el incidente se extendió cuatro días. Es también la razón por la que terminó sin pérdida de información.

Fue una decisión consciente y la volveríamos a tomar. No minimizamos lo que significaron esos días para quienes tenían sus servicios detenidos, y entendemos el perjuicio. Pero entre restablecer más rápido con riesgo de devolver datos corruptos, y tardar más para devolver la información intacta, elegimos lo segundo. Un servicio caído se recupera; la información perdida, no.

Resultado

  • No hubo pérdida de información. No se registró corrupción de bases de datos ni de servicios web.
  • Menos de 50 servidores presentaron algún inconveniente posterior al encendido. Cada uno fue atendido de forma individual.
  • Las copias de seguridad no se vieron afectadas en ningún momento del incidente.

Cronología

Fecha y hora Hecho
Dom 30/08, 06:10 Se detecta la falla. El equipo de guardia comienza a trabajar en la recuperación del nodo.
Dom 30/08, 06:40 Se publica el aviso en status.donweb.com y se continúa trabajando en la recuperación.
Dom 30/08, tarde Se decide el apagado preventivo de los servidores de la plataforma para proteger la integridad de la información durante la recuperación.
Lun 31/08 – mié 02/09 Se continúa con la recuperación progresiva y verificada, componente por componente, sin interrupción.
Mié 02/09, ~20:00 La plataforma comienza a estabilizarse.
Jue 03/09, madrugada Recuperación completa. Durante la mañana se completa el encendido de los servidores.

Qué estamos haciendo

El incidente dejó aprendizajes que ya estamos aplicando:

  1. Ampliación de la capacidad de la infraestructura que soporta esta plataforma. Es la acción de fondo y está priorizada.
  2. Mejoras en la detección temprana. Estamos ampliando el monitoreo y afinando nuestras alertas para identificar antes este tipo de eventos.
  3. Formalización del apagado preventivo como paso del procedimiento ante una indisponibilidad total de almacenamiento. Funcionó, y queda escrito.
  4. Revisión de los protocolos de intervención sobre componentes de almacenamiento, incorporando verificaciones previas y escalamiento temprano.

Si tu servicio se vio afectado

Si después del restablecimiento notás algo que no funciona como antes, o por cualquier consulta que tengas, escribinos por los canales de soporte habituales y lo revisamos con vos.

Lamentamos el impacto que este incidente tuvo sobre tu operación y te agradecemos la paciencia durante esos días.

Equipo de DonWeb

Posted Sep 08, 2026 - 11:41 GMT-03:00

Resolved

This incident has been resolved.
Posted Sep 05, 2026 - 19:50 GMT-03:00

Monitoring

Actualmente el 100% del nodo NOVA se encuentra operativo.

Traas la recuperacion no se reporta pérdidas de datos.

Continuamos monitoreando y comunicando novedades a través de este medio.
Posted Sep 03, 2026 - 08:17 GMT-03:00

Update

Estado actual — Fase 2: Encendido de los Cloud Servers

Ya nos encontramos en la Fase 2 del proceso de recuperación.

Luego de los avances alcanzados en la estabilización y recuperación del almacenamiento, comenzamos con el encendido progresivo de los Cloud Servers afectados.

Durante el transcurso del día, nuestro equipo irá habilitando los Cloud Servers de manera gradual y controlada, priorizando la estabilidad de la infraestructura.

Por este motivo, es posible que algunos Cloud Servers se habiliten antes que otros. El proceso continuará de forma progresiva durante el día hasta completar el restablecimiento de los servicios afectados.

Importante: no es necesario abrir un ticket para solicitar el encendido. Nuestro equipo está realizando esta tarea de manera progresiva y no requiere ninguna gestión adicional de tu parte.

Mientras dure el proceso

- La gestión de los Clouds Servers de NOVA continúa limitada mientras avanzamos con el proceso de recuperación.
- El encendido se realizará de forma progresiva para preservar la estabilidad del nodo.
- No es necesario abrir un ticket para solicitar el encendido de tu Cloud Server. Nuestro equipo se encargará de realizarlo automáticamente.
- Una vez que tu Cloud Server sea encendido, podrás volver a acceder al servicio.

Continuidad de la información

Publicaremos nuevas actualizaciones en https://status.donweb.com a medida que avance el proceso.

Comprendemos el impacto que esta interrupción ha generado y sabemos que la espera ha sido extensa. El paso a la Fase 2 representa un avance concreto en la recuperación, y nuestro foco durante esta etapa es completar el encendido de los Cloud Servers de forma segura y progresiva.

Una vez finalizado el proceso de recuperación, comunicaremos las acciones que tomaremos respecto del período afectado, junto con el informe correspondiente y las medidas que estamos adoptando para evitar incidentes similares a futuro.

Agradecemos tu paciencia y comprensión mientras completamos esta etapa de recuperación.
Posted Sep 03, 2026 - 06:00 GMT-03:00

Update

Qué ocurrió

El incidente se originó en una falla lógica dentro de la infraestructura de almacenamiento del nodo NOVA. No fue una falla física ni una pérdida de equipamiento: fue un error en el estado interno del sistema que, en un lapso muy breve, derivó en una cadena de inconsistencias que se propagó de forma acelerada.

Nuestra plataforma mantiene tres copias de cada dato en equipos independientes, precisamente para que este tipo de eventos no derive en pérdida de información. Ese diseño cumplió su función, y es la razón por la que hoy hablamos de un tiempo de restauración extenso y no de una pérdida de datos. La contrapartida es que el sistema debe verificar y reconstruir la coherencia de todas las réplicas antes de habilitar nuevamente el servicio, en un volumen muy superior al de una falla ordinaria. Es un procedimiento que prioriza la integridad de los datos por sobre la velocidad: acelerarlo pondría en riesgo aquello que estamos protegiendo.

La identificación del disparador exacto está bajo investigación y formará parte del informe que publicaremos una vez restablecido el servicio.

Sobre tu información

Los datos alojados en tus Cloud Servers y tus backups no se encuentran comprometidos. Los backups, además, se almacenan en una infraestructura separada de los clusters de almacenamiento.

Nuestros backups son imágenes completas de tu Cloud Server, no copias de archivos individuales, por lo que su restauración se realiza sobre la instancia y requiere que el servidor esté encendido. Mientras permanezca apagado no es posible acceder a tus datos ni restaurar una copia de resguardo, aun estando la información íntegra.

Sabemos que la consulta natural es si podemos entregarte esa imagen para levantarla en otro entorno. Hoy no es viable: el repositorio de backups depende del plano de control del nodo, que es justamente lo que está en proceso de estabilización; la exportación de imágenes completas saturaría la misma red que utilizamos para la recuperación; y el formato no es directamente portable a un entorno externo.


En qué instancia nos encontramos

Fase 1 — Estabilización del almacenamiento (en curso). Reconstrucción y verificación de las copias de datos. Nuestra estimación al hoy es de aproximadamente 3 días adicionales, sujeta a ajuste conforme avance el proceso.

Fase 2 — Encendido de los Cloud Servers. Una vez estabilizado el almacenamiento, se encenderán los servidores en forma controlada, ya que un arranque masivo volvería a sobrecargar el nodo. Es en esta fase cuando recuperarás el acceso a tus datos y a tus copias de resguardo.


Mientras dure el incidente

- La gestión de los Cloud Servers de NOVA permanece deshabilitada hasta la finalización del incidente. Es una medida deliberada: cualquier acción sobre las instancias en este momento demoraría la recuperación.
- No es necesario que abras un ticket para solicitar el encendido de tu servidor. El proceso es automático y lo gestiona nuestro equipo.

Continuidad de la información

Publicaremos actualizaciones cada [12/24 horas] en https://status.donweb.com, haya o no novedades.

Comprendemos que ninguna explicación técnica compensa el impacto de una interrupción de esta duración. Hoy nuestro foco es restablecer el servicio lo antes posible y, una vez restablecido, te comunicaremos las acciones que tomaremos respecto del período afectado, junto con un informe de las medidas que estamos adoptando para evitar incidentes similares a futuro.

Agradecemos tu paciencia y quedamos a disposición.
Posted Sep 02, 2026 - 09:59 GMT-03:00

Update

Nuestros equipos de Infraestructura y Redes continúan trabajando de manera prioritaria y sostenida sobre la recuperación del nodo NOVA. El proceso viene avanzando favorablemente y se están completando de manera progresiva las tareas necesarias para restablecer la infraestructura.

Estado actual:


  • Recuperación del nodo: El proceso de recuperación del nodo NOVA continúa avanzando de manera favorable, bajo un esquema controlado y con las verificaciones correspondientes en cada etapa.

  • Estado de las máquinas virtuales: Durante esta primera fase, las máquinas virtuales alojadas en el nodo permanecerán apagadas hasta finalizar completamente la recuperación y estabilización de la infraestructura.

  • Integridad de la información: La decisión de mantener las máquinas virtuales apagadas responde a una medida preventiva y técnica, orientada a preservar la integridad de la información y minimizar cualquier riesgo durante el proceso de recuperación.

  • Segunda fase: Una vez que el nodo NOVA se encuentre completamente restablecido y estabilizado, se dará inicio a una segunda etapa, en la que comenzaremos con el encendido de los Cloud Servers de manera progresiva, controlada y monitoreada, realizando las validaciones necesarias en cada instancia.

  • Tiempo de resolución: Si bien la recuperación del nodo presenta avances favorables, por el momento no contamos con un tiempo estimado de finalización que podamos confirmar. A medida que el proceso avance y dispongamos de información concreta, comunicaremos las novedades correspondientes.



Entendemos la importancia de contar con sus servicios operativos y el impacto que esta situación puede generar. El trabajo continúa de forma prioritaria, siguiendo un proceso controlado que permita avanzar en la recuperación sin comprometer la integridad de la información.

Agradecemos la paciencia y comprensión durante este proceso.

Continuaremos informando los avances relevantes y actualizando este estado hasta alcanzar la normalización progresiva de los servicios.
Posted Sep 01, 2026 - 21:46 GMT-03:00

Update

Nuestros equipos de Infraestructura y Redes continúan trabajando de manera prioritaria y sostenida sobre la incidencia, avanzando con las tareas necesarias para recuperar y normalizar los servicios afectados.

Estado actual:


  • Alcance: 100% de los servidores del nodo NOVA.

  • Nivel de afectación: Los Cloud Servers alojados en el nodo afectado continúan inaccesibles.

  • Recuperación: El proceso se está llevando adelante de forma progresiva y controlada, realizando las verificaciones necesarias en cada etapa para preservar la integridad de la información.

  • Tiempo de resolución: Por el momento no contamos con un tiempo estimado de resolución que podamos confirmar. A medida que el equipo avance y dispongamos de información concreta, iremos comunicando las novedades y cualquier estimación disponible.

  • Backups y migración: Mientras la incidencia permanezca activa, temporalmente no es posible acceder a los backups ni realizar la migración de los servicios afectados hacia otro nodo. Estas opciones podrán retomarse una vez que la infraestructura se encuentre estabilizada.



Entendemos que la continuidad de esta situación puede generar preocupación y lamentamos sinceramente los inconvenientes ocasionados. El trabajo continúa de forma prioritaria y sostenida, con el objetivo de restablecer los servicios de manera segura.

Agradecemos la paciencia y comprensión. Seguiremos actualizando este estado ante cada avance relevante hasta alcanzar la normalización del servicio.
Posted Sep 01, 2026 - 08:43 GMT-03:00

Update

Nuestros equipos de Infraestructura y Redes continúan trabajando de manera prioritaria y sostenida sobre la incidencia, avanzando con las tareas necesarias para recuperar y normalizar los servicios afectados.

Estado actual:


  • Alcance: 100% de los servidores del nodo NOVA.

  • Nivel de afectación: Los Cloud Servers alojados en el nodo afectado continúan inaccesibles.

  • Recuperación: El proceso se está llevando adelante de forma progresiva y controlada, realizando las verificaciones necesarias en cada etapa para preservar la integridad de la información.

  • Tiempo de resolución: Por el momento no contamos con un tiempo estimado de resolución que podamos confirmar. A medida que el equipo avance y dispongamos de información concreta, iremos comunicando las novedades y cualquier estimación disponible.

  • Backups y migración: Mientras la incidencia permanezca activa, temporalmente no es posible acceder a los backups ni realizar la migración de los servicios afectados hacia otro nodo. Estas opciones podrán retomarse una vez que la infraestructura se encuentre estabilizada.



Entendemos que la continuidad de esta situación puede generar preocupación y lamentamos sinceramente los inconvenientes ocasionados. El trabajo continúa de forma prioritaria y sostenida, con el objetivo de restablecer los servicios de manera segura.

Agradecemos la paciencia y comprensión. Seguiremos actualizando este estado ante cada avance relevante hasta alcanzar la normalización del servicio.
Posted Sep 01, 2026 - 08:21 GMT-03:00

Update

Nuestros equipos de Infraestructura y Redes continúan trabajando de forma prioritaria sobre la incidencia, avanzando con las tareas de recuperación y las verificaciones necesarias para restablecer los servicios afectados.

A continuación, compartimos el estado actualizado:


  • Alcance: 100% de los servidores del nodo NOVA.

  • Nivel de afectación: Los Cloud Servers alojados en el nodo afectado permanecen inaccesibles.

  • Tiempo estimado de resolución: Debido a las características de la falla, la recuperación se está realizando en etapas y bajo un proceso de verificación controlado, con el objetivo de resguardar la integridad de la información. Por este motivo, aún no contamos con un tiempo estimado de resolución que podamos confirmar. Comunicaremos los avances y cualquier estimación de tiempos a medida que contemos con información concreta.

  • Acceso a backups y migración: Mientras la incidencia permanezca activa, por el momento no es posible acceder a los backups ni realizar la migración de los servicios hacia otro nodo. Estas alternativas podrán retomarse una vez normalizada la situación.



Lamentamos los inconvenientes que esta situación está generando y agradecemos especialmente la paciencia y comprensión. Continuaremos actualizando este medio ante cada avance relevante hasta alcanzar la normalización del servicio.
Posted Aug 31, 2026 - 14:09 GMT-03:00

Update

Continuamos trabajando en restablecer el servicio a la mayor brevedad posible.

A continuación, te brindamos detalles sobre el mismo:

  • Alcance: El 100% de los servidores del nodo NOVA

  • Nivel de afectación: Los Cloud Servers del nodo afectado están inaccesibles.

  • Tiempo estimado de resolución: Dado el tipo de falla, la recuperación se ejecuta en etapas verificadas para resguardar la integridad de la información. Esto extiende los tiempos y por el momento no podemos estimar un tiempo de resolución. Te mantendremos al tanto del avance.


Enfocamos todos nuestros esfuerzos en resolver el inconveniente y reestablecer el servicio a la normalidad lo antes posible.
Por este medio iremos publicando actualizaciones del estado de la incidencia, hasta resolver la misma.
Posted Aug 31, 2026 - 08:48 GMT-03:00

Update

Nuestro equipo técnico continúa trabajando en restablecer el servicio a la mayor brevedad posible.

A continuación, te brindamos detalles sobre el mismo:

  • Alcance: El 100% de los servidores del nodo NOVA

  • Nivel de afectación: Los Cloud Servers del nodo afectado están inaccesibles.

  • Tiempo estimado de resolución: Dado el tipo de falla, la recuperación se ejecuta en etapas verificadas para resguardar la integridad de la información. Esto extiende los tiempos y por el momento no podemos estimar un tiempo de resolución. Te mantendremos al tanto del avance.


Enfocamos todos nuestros esfuerzos en resolver el inconveniente y reestablecer el servicio a la normalidad lo antes posible.
Por este medio iremos publicando actualizaciones del estado de la incidencia, hasta resolver la misma.
Posted Aug 31, 2026 - 06:27 GMT-03:00

Update

La incidencia continúa activa y nuestros equipos de Infraestructura y Redes se encuentran trabajando de manera ininterrumpida, abocando todos los recursos necesarios para lograr la normalización del servicio.

Entendemos las molestias que esta situación puede ocasionar y queremos transmitir tranquilidad: no existe riesgo de pérdida de datos. La información almacenada se encuentra segura.

A continuación, detallamos el alcance actual de la incidencia:

Alcance: Nodo Nova
Nivel de afectación: 100% de los servicios inaccesibles

Mantendremos este medio actualizado con cada novedad relevante sobre el estado de la incidencia.

Lamentamos sinceramente los inconvenientes ocasionados y agradecemos especialmente la paciencia y comprensión mientras nuestros equipos continúan trabajando arduamente para restablecer el servicio a la mayor brevedad posible.
Posted Aug 31, 2026 - 00:28 GMT-03:00

Update

La incidencia continúa activa y nuestro equipo de Infraestructura y Redes permanece abocado de forma continua a las tareas necesarias para lograr la normalización del servicio.

Queremos llevar tranquilidad y destacar que no existe riesgo de pérdida de datos. La información y los datos almacenados se encuentran seguros.

A continuación, te brindamos detalles sobre el mismo:

Alcance: Nodo Nova

Nivel de afectación: 100% inaccesibles


Por este medio iremos publicando actualizaciones del estado de la incidencia, hasta resolver la misma.

Agradecemos la paciencia y comprensión mientras nuestros equipos continúan trabajando para resolver la situación.
Posted Aug 30, 2026 - 20:26 GMT-03:00

Update

La incidencia continúa activa y nuestro equipo de Infraestructura y Redes permanece abocado de forma continua a las tareas necesarias para lograr la normalización del servicio.

Queremos llevar tranquilidad y destacar que no existe riesgo de pérdida de datos. La información y los datos almacenados se encuentran seguros.

A continuación, te brindamos detalles sobre el mismo:

Alcance: Nodo Nova

Nivel de afectación: 100% inaccesibles


Por este medio iremos publicando actualizaciones del estado de la incidencia, hasta resolver la misma.

Agradecemos la paciencia y comprensión mientras nuestros equipos continúan trabajando para resolver la situación.
Posted Aug 30, 2026 - 20:04 GMT-03:00

Update

Nuestro equipo de Infraestructura y Redes continúa trabajando activamente para restablecer el servicio y normalizar la situación.

Como parte de las tareas realizadas, se efectuó el reemplazo de un componente de conexión y actualmente se continúa trabajando para normalizar el entorno y restablecer los servicios afectados.

A continuación, te brindamos detalles sobre el mismo:

Alcance: Nodo Nova

Nivel de afectación: 100% inaccesibles


Por este medio iremos publicando actualizaciones del estado de la incidencia, hasta resolver la misma.
Posted Aug 30, 2026 - 16:49 GMT-03:00

Update

Nuestro equipo de Infraestructura y Redes continúa trabajando activamente para restablecer el servicio y normalizar la situación.

Como parte de las tareas realizadas, se efectuó el reemplazo de un componente de conexión y actualmente se continúa trabajando para normalizar el entorno y restablecer los servicios afectados.

A continuación, te brindamos detalles sobre el mismo:

Alcance: Nodo Nova

Nivel de afectación: 100% inaccesibles


Por este medio iremos publicando actualizaciones del estado de la incidencia, hasta resolver la misma.
Posted Aug 30, 2026 - 11:14 GMT-03:00

Update

Nuestro equipo técnico ha logrado identificar la causa de los inconvenientes y ya se encuentran trabajando en restablecer el servicio a la mayor brevedad posible.

A continuación, te brindamos detalles sobre el mismo:

Alcance: Nodo Nova

Nivel de afectación: 100% inaccesibles



Enfocamos todos nuestros esfuerzos en resolver el inconveniente y reestablecer el servicio a la normalidad lo antes posible.

Por este medio iremos publicando actualizaciones del estado de la incidencia, hasta resolver la misma.
Posted Aug 30, 2026 - 09:35 GMT-03:00

Identified

Nuestro equipo técnico ha logrado identificar la causa de los inconvenientes y ya se encuentran trabajando en restablecer el servicio a la mayor brevedad posible.

A continuación, te brindamos detalles sobre el mismo:

  • Alcance: Nodo Nova

  • Nivel de afectación: 100% inaccesibles



Enfocamos todos nuestros esfuerzos en resolver el inconveniente y reestablecer el servicio a la normalidad lo antes posible.

Por este medio iremos publicando actualizaciones del estado de la incidencia, hasta resolver la misma.
Posted Aug 30, 2026 - 09:23 GMT-03:00
This incident affected: Servicios Cloud & IaaS (Nodo NOVA (Cloud Servers & Volúmenes Cloud)).