Articulo de referencia

Falta del tiempo

En informática y telecomunicaciones, el tiempo de inactividad (también conocido coloquialmente como interrupción del sistema o sequía del sistema ) es un período durante el cual...

En informática y telecomunicaciones, el tiempo de inactividad (también conocido coloquialmente como interrupción del sistema o sequía del sistema ) es un período durante el cual un sistema no está disponible. La indisponibilidad se define como la proporción de un lapso de tiempo durante el cual un sistema está inactivo o fuera de línea . Esto suele deberse a que el sistema no funciona correctamente debido a un evento imprevisto o a un mantenimiento rutinario (un evento planificado).

Estos términos se aplican comúnmente a redes y servidores . Las causas habituales de interrupciones no planificadas son fallos del sistema (como un bloqueo ) o fallos de comunicación (conocidos coloquialmente como interrupción de red o sequía de red ). Para las interrupciones debidas a problemas con sistemas informáticos generales , se puede utilizar el término interrupción informática (también interrupción de TI o sequía de TI ).

El término también se aplica comúnmente en entornos industriales en relación con fallas en equipos de producción industrial. Algunas instalaciones miden el tiempo de inactividad durante un turno de trabajo o durante un período de 12 o 24 horas. Otra práctica común es identificar cada evento de inactividad como de origen operativo, eléctrico o mecánico.

Lo opuesto al tiempo de inactividad es el tiempo de actividad .

Tipos

Los estándares de la industria para el término "Duración de la interrupción" o "Duración del mantenimiento" pueden tener diferentes puntos de inicio y finalización, por lo que se debe utilizar la siguiente aclaración para evitar conflictos en la ejecución del contrato:

  1. El servicio integral, denominado "llave en mano", es el más complejo de todos los tipos de interrupción del servicio. La interrupción o el mantenimiento comienza cuando el operador de la planta o el equipo presiona el botón de parada para detener la operación. Salvo que se indique lo contrario, la interrupción o el mantenimiento se considera finalizado cuando la planta o el equipo vuelven a estar en funcionamiento normal, listos para comenzar la producción, sincronizarse con el sistema o la red eléctrica, o funcionar como bomba o compresor.
  2. "Interruptor a interruptor": Esta interrupción o mantenimiento comienza cuando el operador de la planta o equipo desconecta el circuito de potencia (interruptor principal en "apagado", "desconectado" o "encendido en enfriamiento"), pero no el circuito de control. Esto permite que el equipo se enfríe o alcance la temperatura ambiente para que se puedan preparar o iniciar los trabajos de mantenimiento. Dependiendo del tipo de equipo, la interrupción "Interruptor a interruptor" puede ser ventajosa si se subcontrata el mantenimiento relacionado con los controles, ya que este tipo de trabajo de mantenimiento se puede realizar mientras el equipo principal aún está en enfriamiento o en espera. A menos que se indique lo contrario, este tipo de interrupción se considera completa cuando el circuito de potencia se vuelve a energizar mediante la activación del interruptor principal.
  3. "Finalización del bloqueo/etiquetado " Esta parada o mantenimiento (a veces confundido con "apagado/enfriamiento", pero no es lo mismo) comienza con el operador de la planta o equipo retirando el circuito de alimentación, desconectando el circuito de control y realizando otras medidas de neutralización de posibles fuentes de energía y peligro (normalmente llamado bloqueo/etiquetado "LOTO"). Este punto del período de mantenimiento suele ser la última fase de la etapa de inicio de la parada antes de que comience el trabajo real en la instalación, planta o equipo. Siempre debe haber una sesión informativa de seguridad después de la actividad LOTO, antes de realizar cualquier trabajo. A menos que se indique lo contrario, este tipo de parada se considera completa cuando el equipo ha alcanzado la finalización mecánica y está listo para ser puesto en marcha lenta para muchos equipos rotativos pesados, prueba de impacto o verificación de rotación para motores, etc., pero debe seguir el permiso de retorno o trabajo según los procedimientos LOTO.

Las pruebas en línea, las pruebas de rendimiento y los ajustes necesarios no deben computarse para la duración de la interrupción, ya que estas actividades normalmente se realizan después de la finalización de la interrupción o el evento de mantenimiento y están fuera del control de la mayoría de los contratistas de mantenimiento.

Características

Las interrupciones no planificadas pueden ser consecuencia de un mal funcionamiento del equipo, etc.

Clasificaciones de interrupciones en las telecomunicaciones

El tiempo de inactividad puede deberse a fallos en el hardware (equipos físicos), (equipos de control lógico), equipos de interconexión (como cables, instalaciones, enrutadores,...), transmisión (inalámbrica, microondas, satélite) y/o capacidad (límites del sistema).

Las fallas pueden ocurrir debido a daños, fallas, diseño, procedimientos (uso inadecuado por parte de los humanos), ingeniería (cómo usar e implementar), sobrecarga (tráfico o recursos del sistema sobrecargados más allá de los límites diseñados), entorno (sistemas de soporte como energía y HVAC), (interrupciones diseñadas en el sistema con un propósito como actualizaciones de software y crecimiento de equipos), otros (ninguno de los anteriores pero conocido) o desconocido.

Las fallas pueden ser responsabilidad del cliente/proveedor de servicios, vendedor/suministrador, empresa de servicios públicos, gobierno, contratista, cliente final, particular, acto de la naturaleza, otro (ninguno de los anteriores pero conocido) o desconocido.

Impacto

Las interrupciones causadas por fallos del sistema pueden tener un grave impacto en los usuarios de sistemas informáticos/de red, en particular en aquellas industrias que dependen de un servicio prácticamente ininterrumpido:

También pueden verse afectados los usuarios de un proveedor de servicios de Internet (ISP) y otros clientes de una red de telecomunicaciones.

Las corporaciones pueden perder negocios debido a interrupciones en la red o pueden incumplir un contrato, lo que resulta en pérdidas financieras. Según el informe de gestión de datos en la nube de Veeam de 2019, las organizaciones experimentan tiempos de inactividad no planificados, en promedio, de 5 a 10 veces al año, con un costo promedio de una hora de inactividad de $102,450. [ 1 ] El costo real varía significativamente según la industria: las empresas de servicios financieros pueden perder de $500,000 a más de $1 millón por hora debido a transacciones fallidas y exposición regulatoria, los sitios de comercio electrónico empresariales $100,000–$500,000 por ventas perdidas y carritos abandonados, y las empresas SaaS del mercado medio $10,000–$100,000 por créditos de SLA y pérdida de clientes . [ 2 ]

Las personas u organizaciones afectadas por las interrupciones del servicio pueden ser más sensibles a ciertos aspectos:

  • Algunos se ven más afectados por la duración de una interrupción del servicio; para ellos es importante cuánto tiempo se tarda en recuperarse de un problema.
  • Otros son sensibles al momento en que ocurre un corte de energía; los cortes durante las horas pico son los que más les afectan.

Los usuarios más exigentes son aquellos que requieren alta disponibilidad .

Apagones famosos

El Día de la Madre , domingo 8 de mayo de 1988, se produjo un incendio en la sala de conmutación principal de la oficina central de Hinsdale de la compañía telefónica Illinois Bell . Uno de los sistemas de conmutación más grandes del estado, la instalación procesaba más de 3,5 millones de llamadas diarias y prestaba servicio a 38 000 clientes, entre los que se incluían numerosas empresas, hospitales y los aeropuertos O'Hare y Midway de Chicago. [ 3 ]

Prácticamente toda la red de conmutadores de peaje 4ESS de AT&T sufrió interrupciones intermitentes el 15 de enero de 1990, lo que afectó el servicio de larga distancia en todo Estados Unidos. El problema se resolvió espontáneamente al disminuir el tráfico. Se detectó un fallo de software. [ 4 ]

AT&T perdió su red Frame Relay durante 26 horas el 13 de abril de 1998. [ 5 ] Esto afectó a miles de clientes, y las transacciones bancarias fueron una de las víctimas. AT&T no cumplió con el acuerdo de nivel de servicio en sus contratos con los clientes y tuvo que reembolsar [ 6 ] 6600 cuentas de clientes , lo que costó millones de dólares.

Xbox Live sufrió interrupciones intermitentes durante la temporada navideña de 2007-2008, que duraron trece días. [ 7 ] El aumento de la demanda por parte de los compradores de Xbox 360 (el mayor número de nuevos usuarios registrados en la historia de Xbox Live) se atribuyó como la razón de la interrupción; para compensar los problemas del servicio, Microsoft ofreció a sus usuarios la oportunidad de recibir un juego gratis. [ 8 ]

La interrupción del servicio de PlayStation Network de Sony en abril de 2011 comenzó el 20 de abril de 2011 y se restableció gradualmente el 14 de mayo de 2011, inicialmente en Estados Unidos . Esta interrupción fue el período más largo que PSN ha estado fuera de servicio desde su creación en 2006. Sony declaró que el problema fue causado por una intrusión externa que resultó en la confiscación de información personal. El 26 de abril de 2011, Sony informó que se había obtenido una gran cantidad de datos de usuarios mediante el mismo ataque que causó la interrupción del servicio. [ 9 ]

El conmutador de Telstra en Ryde falló a finales de 2011 después de que el agua se filtrara al cuadro eléctrico debido a las continuas lluvias. El conmutador de Ryde es uno de los más grandes de Australia en términos de superficie y afectó a más de 720.000 servicios.

El centro de datos de ServerAxis en Miami quedó fuera de servicio sin previo aviso el 29 de febrero de 2016 y nunca se restableció. Esto afectó a múltiples proveedores y cientos de sitios web. La interrupción impactó la cobertura del torneo de baloncesto femenino de la División I de la NCAA de 2016, ya que WBBState, uno de los sitios afectados, era, con diferencia, el proveedor más completo de estadísticas de baloncesto femenino disponible. [ 10 ]

La plataforma de juegos Roblox sufrió una interrupción del servicio alrededor de octubre de 2021, durante su evento de Chipotle . Muchos usuarios pensaron que se debió al evento, ya que tuvo una gran acogida, pues los usuarios podían obtener un burrito de Chipotle gratis durante el mismo. Esta interrupción fue la más larga que ha sufrido Roblox, con una duración de 3 días. [ 11 ] [ 12 ] [ 13 ]

El 8 de julio de 2022, Rogers sufrió una importante interrupción del servicio a nivel nacional en Canadá . Esto afectó simultáneamente el acceso a la telefonía móvil e internet, provocando fallos en las llamadas al 911 y en las transacciones interbancarias, además de interrumpir los servicios gubernamentales.

El 19 de julio de 2024, CrowdStrike publicó una actualización defectuosa del controlador de su software Falcon, lo que provocó que ordenadores, servidores y máquinas virtuales con Windows se bloquearan y entraran en un bucle de arranque. El incidente afectó involuntariamente a aproximadamente 8,5 millones de equipos con Windows en todo el mundo, incluyendo infraestructuras críticas como los servicios de emergencia 911 en varios estados. Se considera la mayor interrupción del servicio en la historia de la tecnología de la información . [ 14 ] [ 15 ]

Niveles de servicio

En los acuerdos de nivel de servicio , es común mencionar un porcentaje (mensual o anual) que se calcula dividiendo la suma de todos los periodos de inactividad entre el tiempo total de un periodo de referencia (por ejemplo, un mes). Un 0 % de tiempo de inactividad significa que el servidor estuvo disponible en todo momento.

Para los servidores de Internet, los tiempos de inactividad superiores al 1% anual o peores pueden considerarse inaceptables, ya que esto significa un tiempo de inactividad de más de 3 días al año. Para el comercio electrónico y otros usos industriales, cualquier valor superior al 0,1% generalmente se considera inaceptable. [ 16 ]

Respuesta y reducción del impacto

Es responsabilidad del diseñador de la red garantizar que no se produzcan interrupciones en la misma. Cuando estas ocurren, un sistema bien diseñado reducirá aún más sus efectos al permitir que las interrupciones localizadas se detecten y solucionen lo antes posible.

Es necesario contar con un proceso para detectar fallos de funcionamiento ( monitorización de la red ) y restablecer su correcto funcionamiento. Esto generalmente implica un equipo de soporte técnico compuesto por ingenieros capacitados que puedan solucionar problemas. Por lo general, se requiere un equipo de soporte técnico independiente para atender las consultas de los usuarios, lo cual puede resultar especialmente exigente durante un periodo de inactividad.

Un sistema de gestión de red puede utilizarse para detectar componentes defectuosos o en deterioro antes de que se produzcan quejas por parte de los clientes, permitiendo la corrección proactiva de los fallos.

Las técnicas de gestión de riesgos pueden utilizarse para determinar el impacto de las interrupciones de la red en una organización y las medidas necesarias para minimizar el riesgo. Este riesgo puede minimizarse mediante el uso de componentes fiables, el mantenimiento (como las actualizaciones), el uso de sistemas redundantes o la implementación de un plan de contingencia o de continuidad del negocio . Los medios técnicos pueden reducir los errores mediante códigos de corrección de errores , retransmisión , sumas de comprobación o esquemas de diversidad .

Una de las principales causas de tiempo de inactividad es la configuración incorrecta, donde un cambio planificado falla. Por lo general, las organizaciones dependen del trabajo manual para gestionar el proceso de copias de seguridad de la configuración, pero esto requiere ingenieros altamente capacitados con el tiempo necesario para gestionar el proceso en una red de múltiples proveedores. Existen herramientas de automatización para gestionar las copias de seguridad, pero hay muy pocas soluciones que gestionen la recuperación de la configuración, que es necesaria para minimizar el impacto general de la interrupción. [ 17 ]

Planificación

Una interrupción programada es el resultado de una actividad planificada por el propietario del sistema y/o por un proveedor de servicios . Estas interrupciones, a menudo programadas durante la ventana de mantenimiento , pueden utilizarse para realizar tareas que incluyen las siguientes:

  • Mantenimiento diferido, por ejemplo, una reparación de hardware diferida o un reinicio diferido para limpiar una memoria corrupta.
  • Diagnóstico para aislar una falla detectada
  • Reparación de fallos de hardware
  • Corregir un error u omisión en una base de datos de configuración o una omisión en un cambio reciente de la base de datos de configuración.
  • Corrección de un error en la base de datos de la aplicación o un error en un cambio reciente de la base de datos de la aplicación.
  • Parches/actualizaciones de software para corregir un fallo de software.

Los cortes de energía también pueden planificarse como resultado de un evento natural previsible, como un apagón solar .

En las industrias que dependen de sistemas informáticos, los periodos de inactividad por mantenimiento deben programarse cuidadosamente. En muchos casos, se pueden evitar las interrupciones generalizadas del sistema mediante una "actualización progresiva": un proceso que consiste en desactivar gradualmente partes del sistema para su actualización, sin afectar la funcionalidad general.

Evitación

La mayoría de los sitios web cuentan con servicios de monitorización . La monitorización web (sintética o pasiva) es un servicio que "supervisa" el tiempo de inactividad y la actividad de los usuarios en el sitio.

Otros usos

El tiempo de inactividad también puede referirse al tiempo en que el capital humano u otros activos no funcionan. Por ejemplo, si los empleados están en reuniones o no pueden realizar su trabajo debido a alguna otra limitación, se considera tiempo de inactividad. Esto puede resultar igualmente costoso y puede ser consecuencia de la inactividad de otro activo (por ejemplo, ordenadores o sistemas). A esto también se le conoce comúnmente como " tiempo muerto ".

El tiempo de inactividad también se generaliza en un sentido personal, utilizándose para referirse a un período de sueño o recreación . [ 18 ] [ 19 ] [ 20 ]

Este término también se utiliza en fábricas o en entornos industriales. Véase mantenimiento productivo total (TPM).

Medición del tiempo de inactividad

Existen numerosos servicios externos que pueden utilizarse para monitorizar el tiempo de actividad y de inactividad, así como la disponibilidad de un servicio o un servidor.

Un ejemplo notable es Downdetector , un sitio web propiedad de Ookla que rastrea los tiempos de inactividad regulares y las interrupciones importantes con informes de interrupciones de los usuarios realizados en el sitio, que también incluye la página de cada sitio web en el propio Downdetector y en Twitter. [ 21 ] Actualmente está disponible en 45 países (con un sitio diferente en cada país) y rastrea 12 000 servicios a nivel internacional. [ 22 ] [ 23 ]

Véase también

Referencias

  1. "Informe ejecutivo sobre las tendencias de protección de datos de 2021" . Veeam Software .
  2. "El costo real del tiempo de inactividad: calculadora y desglose por industria" . Blog de Vantaj . 21 de junio de 2026. Consultado el 23 de junio de 2026 .
  3. Neumann, Peter G.; Weinstock, Chuck; Townson, Patrick (11 de mayo de 1988). "Riesgos de fallas en puntos únicos: El incendio de Hinsdale" . The RISKS Digest . 6 (82). Archivado del original el 6 de octubre de 2022 , a través del servidor web The Catless.Extracto de TELECOM Digest. 8 (76).
  4. Neumann, Peter G. (26 de febrero de 1990). "El colapso de la red de AT&T en 1990" . Telephone World . The Risks Digest. Archivado del original el 19 de diciembre de 2022.
  5. "Prevención de interrupciones en el servicio de red IP" (PDF) . Agilent Technologies . 15 de marzo de 2002. Archivado del original (PDF) el 28 de septiembre de 2018.
  6. Neumann, Peter G.; Bellovin, Steve; Byrnes, Jim; Newell, Ruthlyn (7 de mayo de 1998). "AT&T anuncia la causa de la interrupción de la red Frame Relay" . The RISKS Digest . 19 (72) vía The Catless Web Server.
  7. Block, Ryan (3 de enero de 2008). "Interrupción de Xbox Live, día 13: sigue con altibajos, sigue impidiendo que la gente se divierta" . Engadget. Archivado del original el 27 de enero de 2012. Recuperado el 27 de abril de 2011 .
  8. Cohen, Peter (4 de enero de 2008). "Microsoft ofrece un juego gratis para solucionar los problemas de Xbox Live durante las vacaciones" . PC World . Macworld. Archivado del original el 1 de diciembre de 2011.
  9. "Comienza la restauración de los servicios PlayStation®Network y Qriocity" . Portal del Grupo Sony - Sede central global de Sony . 15 de mayo de 2011. Consultado el 22 de octubre de 2021 .
  10. Levy, Ian (16 de marzo de 2016). "Un sitio web dejó de funcionar y se llevó consigo la mayor parte de los análisis del baloncesto universitario femenino" . FiveThirtyEight . Archivado del original el 30 de septiembre de 2023.
  11. Plant, Logan (29 de octubre de 2021). "Los servidores de Roblox vuelven a estar en línea [ Actualización ] " . IGN . Archivado del original el 17 de octubre de 2023.
  12. Finnis, Alex. "¿Está caído Roblox? ¿Por qué la plataforma de juegos no funciona hoy y miles de usuarios reportan problemas para iniciar sesión?" . MSN . Archivado del original el 15 de noviembre de 2021.
  13. "Roblox estuvo caído todo el fin de semana, y no por culpa de Chipotle" . 30 de octubre de 2021.
  14. Milmo, Dan; Kollewe, Julia; Quinn, Ben; Taylor, Josh; Ibrahim, Mimi (2024-07-20). "Comienza una lenta recuperación tras la interrupción de TI mientras los expertos advierten sobre riesgos futuros" . The Guardian . ISSN 0261-3077 . Consultado el 21 de julio de 2024 . 
  15. Weston, David (2024-07-20). "Ayudando a nuestros clientes durante la interrupción de CrowdStrike" . El blog oficial de Microsoft . Recuperado el 21 de julio de 2024 .
  16. Cohen, Gad. "Tiempo de inactividad, interrupciones y fallas: comprender sus verdaderos costos" . www.evolven.com . Consultado el 22 de octubre de 2021 .
  17. "¿Por qué es importante el seguimiento del tiempo de inactividad de las máquinas?" . Evocon . 10 de septiembre de 2018 . Consultado el 22 de octubre de 2021 .
  18. "Descanso y relajación: por qué el tiempo libre es importante para los niños" . 19 de septiembre de 2016.
  19. "La importancia de programar los tiempos de inactividad" . 25 de agosto de 2008.
  20. "Lo que la falta de sueño le hace a tu mente" . Mucha gente piensa en dormir simplemente como un lujo: un poco de tiempo libre.
  21. Miners, Zach (7 de mayo de 2013). "Downdetector.com rastrea la esfera de Twitter para detectar interrupciones del servicio más rápidamente" . Computerworld . Boston : IDG Communications . Archivado del original el 31 de octubre de 2020. Recuperado el 12 de marzo de 2025 .
  22. Massie, Graeme (15 de octubre de 2020). "Twitter caído: los usuarios se quejan de que el servicio está sufriendo una interrupción" . The Independent . Los Ángeles . Consultado el 12 de marzo de 2025 .
  23. Stafford, Kevin (20 de julio de 2023). "Cómo las empresas de videojuegos pueden detectar y resolver interrupciones más rápido [ Webinar ] - Ookla®" . Ookla: Proporcionando inteligencia de red para habilitar la conectividad moderna . Recuperado el 12 de marzo de 2025 .
  • Logotipo de WikcionarioDefinición de tiempo de inactividad en Wikcionario