

En ingeniería y teoría de sistemas , la redundancia es la duplicación intencional de componentes o funciones críticas de un sistema con el objetivo de aumentar la confiabilidad del mismo , generalmente en forma de respaldo o sistema a prueba de fallos , o para mejorar el rendimiento real del sistema, como en el caso de los receptores GNSS o el procesamiento informático multihilo .
En muchos sistemas críticos para la seguridad , como los sistemas fly-by-wire e hidráulicos de las aeronaves , algunas partes del sistema de control pueden triplicarse, [ 1 ] lo que se denomina formalmente redundancia modular triple (TMR). Un error en un componente puede ser compensado por los otros dos. En un sistema triplemente redundante, el sistema tiene tres subcomponentes, los cuales deben fallar los tres para que el sistema falle. Dado que cada uno rara vez falla, y los subcomponentes están diseñados para excluir modos de falla comunes (que pueden modelarse como fallas independientes), la probabilidad de que fallen los tres se calcula como extraordinariamente pequeña; a menudo se ve superada por otros factores de riesgo, como el error humano . Las sobretensiones eléctricas derivadas de rayos son un ejemplo de un modo de falla difícil de aislar por completo, a menos que los componentes se alimenten desde buses de alimentación independientes y no tengan una vía eléctrica directa en su interconexión (se requiere comunicación por algún medio para la votación). La redundancia también puede conocerse con los términos "sistemas de votación por mayoría" [ 2 ] o "lógica de votación". [ 3 ]

La redundancia a veces produce menor fiabilidad en lugar de mayor ; crea un sistema más complejo propenso a diversos problemas, puede llevar a la negligencia humana en el cumplimiento de sus funciones y puede generar mayores exigencias de producción que, al sobrecargar el sistema, pueden hacerlo menos seguro. [ 4 ]
La redundancia es una forma de robustez que se practica en la informática .
La redundancia geográfica se ha vuelto importante en la industria de los centros de datos para salvaguardar los datos contra desastres naturales e inestabilidad política (véase más abajo).
Formas de redundancia
En informática, existen cuatro formas principales de redundancia: [ 5 ]
- Redundancia de hardware, como la redundancia modular doble y la redundancia modular triple.
- Redundancia de información, como los métodos de detección y corrección de errores.
- Redundancia temporal, que consiste en realizar la misma operación varias veces, como por ejemplo, ejecutar varias veces un programa o transmitir varias copias de datos.
- Redundancia de software como la programación de N versiones
Una forma modificada de redundancia de software, aplicada al hardware, puede ser:
- Redundancia funcional distintiva, como el frenado mecánico e hidráulico en un automóvil. Aplicado al software, se refiere a código escrito de forma independiente y claramente diferente, pero que produce los mismos resultados para las mismas entradas.
Las estructuras suelen diseñarse con partes redundantes, lo que garantiza que, si una parte falla, la estructura completa no se derrumbe. Una estructura sin redundancia se denomina crítica a la fractura , lo que significa que un solo componente roto puede provocar el colapso de toda la estructura. Entre los puentes que fallaron por falta de redundancia se encuentran el Puente de Plata y el puente de la Interestatal 5 sobre el río Skagit .
Los sistemas paralelos y combinados demuestran diferentes niveles de redundancia. Estos modelos son objeto de estudios en ingeniería de confiabilidad y seguridad. [ 6 ]
Redundancia disímil
A diferencia de la redundancia tradicional, que utiliza más de un elemento idéntico, la redundancia disímil utiliza elementos diferentes. La idea es que es improbable que estos elementos contengan fallos idénticos. El método de votación puede implicar una mayor complejidad si ambos elementos requieren tiempos diferentes. La redundancia disímil se utiliza a menudo en software, ya que un software idéntico contiene fallos idénticos.
La probabilidad de fallo se reduce utilizando al menos dos tipos diferentes de cada uno de los siguientes elementos:
redundancia geográfica
La redundancia geográfica corrige las vulnerabilidades de los dispositivos redundantes mediante la separación geográfica de los dispositivos de respaldo. La redundancia geográfica reduce la probabilidad de que eventos como cortes de energía , inundaciones , fallas en los sistemas de climatización , rayos , tornados , incendios en edificios, incendios forestales y tiroteos masivos inhabiliten la mayor parte del sistema, si no la totalidad.
Las ubicaciones de redundancia geográfica pueden ser
- más de 621 millas (999 km) continentales , [ 10 ]
- a más de 62 millas de distancia y a menos de 93 millas (150 km) de distancia, [ 10 ]
- a menos de 62 millas de distancia, pero no en el mismo campus, o
- edificios diferentes que están separados por más de 91 metros (300 pies ) en el mismo campus.
Los siguientes métodos pueden reducir los riesgos de daños causados por un incendio :
- grandes edificios separados por al menos 80 pies (24 m) a 110 pies (34 m) , pero a veces por un mínimo de 210 pies (64 m) . [ 11 ] [ 12 ] : 9
- edificios de gran altura separados por al menos 82 pies (25 m) [ 12 ] : 12 [ 13 ]
- espacios abiertos libres de vegetación inflamable dentro de 200 pies (61 m) a cada lado de los objetos [ 14 ]
- distintas alas en el mismo edificio, en habitaciones separadas por más de 91 metros (300 pies ).
- diferentes pisos en la misma ala de un edificio en habitaciones que están desplazadas horizontalmente por un mínimo de 70 pies (21 m) con paredes cortafuegos entre las habitaciones que están en diferentes pisos
- dos habitaciones separadas por otra habitación, dejando un espacio de al menos 70 pies entre las dos habitaciones.
- Debe haber un mínimo de dos muros cortafuegos separados y en lados opuestos de un pasillo [ 10 ].
Amazon Web Services (AWS), Google Cloud Platform (GCP), Microsoft Azure, Netflix, Dropbox, Salesforce, LinkedIn, PayPal, Twitter, Facebook, Apple iCloud, Cisco Meraki y muchos otros utilizan la redundancia geográfica para proporcionar redundancia geográfica, alta disponibilidad, tolerancia a fallos y garantizar la disponibilidad y fiabilidad de sus servicios en la nube. [ 15 ]
Como otro ejemplo, para minimizar el riesgo de daños por fuertes vientos o inundaciones, los edificios pueden ubicarse a una distancia mínima de 3,2 km (2 millas) de la costa, con una elevación mínima de 1,5 m (5 pies) sobre el nivel del mar. Para mayor protección, pueden ubicarse a una distancia mínima de 30 m (100 pies) de las zonas inundables. [ 16 ] [ 17 ]
Funciones de la redundancia
Las dos funciones de la redundancia son la redundancia pasiva y la redundancia activa . Ambas funciones evitan que el rendimiento disminuya más allá de los límites de especificación sin intervención humana, mediante el uso de capacidad adicional.
La redundancia pasiva utiliza capacidad excedente para reducir el impacto de las fallas de los componentes. Una forma común de redundancia pasiva es la mayor resistencia del cableado y los puntales utilizados en los puentes. Esta resistencia adicional permite que algunos componentes estructurales fallen sin que el puente se derrumbe. La resistencia adicional utilizada en el diseño se denomina margen de seguridad.
Los ojos y los oídos son ejemplos prácticos de redundancia pasiva. La pérdida de visión en un ojo no causa ceguera, pero sí afecta la percepción de profundidad . La pérdida de audición en un oído no causa sordera , pero sí la direccionalidad. La disminución del rendimiento suele asociarse a la redundancia pasiva cuando se produce un número limitado de fallos.
La redundancia activa elimina la disminución del rendimiento mediante la monitorización del desempeño de cada dispositivo, y esta monitorización se utiliza en la lógica de votación. Dicha lógica está vinculada a la conmutación, que reconfigura automáticamente los componentes. La detección y corrección de errores y el Sistema de Posicionamiento Global (GPS) son dos ejemplos de redundancia activa.
La distribución de energía eléctrica es un ejemplo de redundancia activa. Varias líneas eléctricas conectan cada planta de generación con los clientes. Cada línea incluye monitores que detectan sobrecargas y disyuntores. La combinación de estas líneas proporciona capacidad adicional. Los disyuntores desconectan una línea cuando los monitores detectan una sobrecarga, y la energía se redistribuye entre las líneas restantes. En el aeropuerto de Toronto, existen cuatro líneas eléctricas redundantes. Cada una de ellas suministra energía suficiente para todo el aeropuerto. Una subestación de red puntual utiliza relés de corriente inversa para abrir los disyuntores de las líneas que fallan, permitiendo que la energía siga fluyendo hacia el aeropuerto.
Los sistemas de energía eléctrica utilizan la programación de la energía para reconfigurar la redundancia activa. Los sistemas informáticos ajustan la producción de cada central generadora cuando otras fallan repentinamente. Esto evita apagones durante eventos importantes como un terremoto.
Desventajas
Charles Perrow , autor de Accidentes normales , ha afirmado que, en ocasiones, las redundancias resultan contraproducentes y generan menor fiabilidad, en lugar de mayor. Esto puede ocurrir de tres maneras: Primero, los dispositivos de seguridad redundantes dan como resultado un sistema más complejo, más propenso a errores y accidentes. Segundo, la redundancia puede llevar a la evasión de responsabilidades entre los trabajadores. Tercero, la redundancia puede aumentar la presión sobre la producción, lo que resulta en un sistema que opera a mayor velocidad, pero con menor seguridad. [ 4 ]
Lógica de votación
La lógica de votación utiliza la monitorización del rendimiento para determinar cómo reconfigurar los componentes individuales, de modo que el funcionamiento continúe sin infringir las limitaciones de especificación del sistema en su conjunto. Si bien la lógica de votación suele involucrar ordenadores, también puede utilizarse para reconfigurar sistemas compuestos por otros elementos. Los disyuntores son un ejemplo de lógica de votación sin ordenadores.
La lógica de votación más simple en los sistemas informáticos consta de dos componentes: primario y alternativo. Ambos ejecutan un software similar, pero la salida del alternativo permanece inactiva durante el funcionamiento normal. El primario se monitoriza a sí mismo y envía periódicamente un mensaje de actividad al alternativo mientras todo esté correcto. Todas las salidas del primario se detienen, incluido el mensaje de actividad, cuando el primario detecta un fallo. El alternativo activa su salida y toma el control del primario tras un breve retardo cuando cesa el mensaje de actividad. Los errores en la lógica de votación pueden provocar que ambas salidas estén activas o inactivas simultáneamente, o que parpadeen intermitentemente.
Una lógica de votación más fiable utiliza un número impar de tres o más dispositivos. Todos realizan funciones idénticas y sus salidas se comparan mediante dicha lógica. En caso de desacuerdo, la lógica determina la mayoría, la cual desactiva la salida de los demás dispositivos que discrepan. Un único fallo no interrumpe el funcionamiento normal. Esta técnica se utiliza en sistemas de aviónica , como los que controlan el funcionamiento del transbordador espacial .
Cálculo de la probabilidad de fallo del sistema
Cada componente duplicado que se agrega al sistema disminuye la probabilidad de falla del sistema según la siguiente fórmula:
dónde:
- – número de componentes
- – probabilidad de fallo del componente i
- – la probabilidad de que fallen todos los componentes (fallo del sistema)
Esta fórmula presupone la independencia de los eventos de falla. Esto significa que la probabilidad de que un componente B falle dado que un componente A ya ha fallado es la misma que la de que B falle cuando A no ha fallado. Existen situaciones en las que esto no es razonable, como por ejemplo, usar dos fuentes de alimentación conectadas al mismo enchufe de tal manera que si una falla , la otra también lo hará.
También parte de la premisa de que solo se necesita un componente para que el sistema funcione.
Redundancia y alta disponibilidad
Puedes lograr una mayor disponibilidad mediante la redundancia. Supongamos que tienes tres componentes redundantes: A, B y C. Puedes usar la siguiente fórmula para calcular la disponibilidad del sistema completo:
Disponibilidad de componentes redundantes = 1 - (1 - disponibilidad del componente A) X (1 - disponibilidad del componente B) X (1 - disponibilidad del componente C) [ 18 ] [ 19 ]
Como corolario, si tienes N componentes en paralelo, cada uno con una disponibilidad X, entonces:
Disponibilidad de componentes en paralelo = 1 - (1 - X)^ N

El uso de componentes redundantes puede aumentar exponencialmente la disponibilidad del sistema en general. [ 19 ] Por ejemplo, si cada uno de sus hosts tiene solo un 50 % de disponibilidad, al usar 10 hosts en paralelo, puede lograr una disponibilidad del 99,9023 %.
Tenga en cuenta que la redundancia no siempre conduce a una mayor disponibilidad. De hecho, la redundancia aumenta la complejidad, lo que a su vez reduce la disponibilidad. Según Marc Brooker, para aprovechar la redundancia, asegúrese de que: [ 20 ]
- Usted logra una mejora neta positiva en la disponibilidad general de su sistema.
- Sus componentes redundantes fallan de forma independiente.
- Su sistema puede detectar de forma fiable componentes redundantes en buen estado.
- Su sistema puede escalar horizontalmente y verticalmente de forma fiable, incorporando componentes redundantes.
Véase también
- Espacio aéreo (redes) – Medida de seguridad de red
- Causa común y causa especial (estadística) – Concepto estadístico
- Redundancia de datos : excedente de datos informáticos para la corrección de errores.
- Conmutación doble
- Tolerancia a fallos : resiliencia de los sistemas ante fallos o errores de los componentes.
- Resistencia a la radiación : Cómo hacer que los dispositivos resistan la radiación ionizante.
- Factor de seguridad : resistencia del sistema más allá de la carga prevista.
- Ingeniería de confiabilidad : Subdisciplina de la ingeniería de sistemas que enfatiza la fiabilidad.
- Teoría de la fiabilidad del envejecimiento y la longevidad – Teoría biofísica
- Ingeniería de seguridad – Disciplina de ingeniería
- Fiabilidad (redes informáticas) – Capacidad de confirmación de protocolo
- MTBF : tiempo transcurrido previsto entre fallos inherentes de un sistema durante su funcionamiento. Páginas que muestran breves descripciones de los objetivos de redirección.
- Redundancia N+1 : forma de resiliencia con componentes de respaldo independientes.
- Sistema informático tolerante a fallos : resiliencia de los sistemas ante fallos o errores de componentes. Páginas que muestran breves descripciones de destinos de redirección.
- ZFS – Sistema de archivos de copia en escritura
- Fallo bizantino : fallo en un sistema informático que presenta síntomas diferentes a distintos observadores.
- Paxos bizantino : familia de protocolos para resolver el consenso.
- Acuerdo bizantino cuántico : versión cuántica del protocolo de acuerdo bizantino.
- El problema de los dos generales : un experimento mental.
- Degeneración : un proceso en biología.
Referencias
- ↑ Técnica de gestión de redundancia para ordenadores del transbordador espacial (PDF), IBM Research
- ↑ R. Jayapal (4 de diciembre de 2003). "El circuito de votación analógico es más flexible que su versión digital" . elecdesign.com. Archivado del original el 3 de marzo de 2007. Consultado el 1 de junio de 2014 .
- ↑ "The Aerospace Corporation | Asegurando el éxito de las misiones espaciales" . Aero.org. 20 de mayo de 2014. Archivado del original el 10 de abril de 2008. Consultado el 1 de junio de 2014 .
- 1 2 Scott D. Sagan (marzo de 2004). "Aprender de los accidentes normales" (PDF) . Organización y medio ambiente . Archivado del original (PDF) el 14 de julio de 2004.
- ↑ Koren, Israel; Krishna, C. Mani (2007). Sistemas tolerantes a fallos . San Francisco, California: Morgan Kaufmann. pag. 3.ISBN 978-0-12-088525-1.
- ↑Institución Smithsonian | Oficina de Seguridad, Salud y Gestión Ambiental | Manual de Diseño de Protección contra Incendios y Seguridad de la Vida | Fuentes Independientes | Las instalaciones con una pérdida máxima posible por incendio que supere los 50 millones de dólares deben tener dos fuentes independientes de agua para la protección contra incendios.
- ↑¿Por qué las arquitecturas redundantes disímiles son una necesidad para DAL A? | Curtis Wright Defense Systems
- ↑Circuitos de alarma contra incendios | Un circuito de clase X seguirá funcionando incluso con un solo circuito abierto o un solo cortocircuito mediante el uso de una ruta redundante.
- ↑Protección contra la potencia de los rayos | para proteger contra sobretensiones inducidas en lugar de descargas directas de rayos. 1 de febrero de 2005. Par trenzado.
- 1 2 3Redundancia de emplazamientos de centros de datos | HM Brotherton y J. Eric Dietz | Tecnología de la Información Informática, Universidad de Purdue
- ↑Compañía de Seguros Mutuos de Fábrica | 1-20 Protección contra la exposición al fuego exterior
- 1 2Consejo Nacional de Investigación | Canadá | División de Investigación de la Construcción | Separación espacial de edificios | Noviembre de 1959
- ↑Directrices de diseño para edificios altos | Ciudad de Toronto | Marzo de 2013 | Página 52 | La distancia de separación entre torres en el mismo sitio debe ser de 25 metros o más.
- ↑Protección de viviendas contra incendios forestales | por Howard E. Moore (Informe técnico general PSW-50) | página 30, punto 10.
- ↑ La nube local es un fracaso. Google tiene la solución | Elias Khnaser | 17/05/2023
- ↑ https://www.archives.gov/files/records-mgmt/storage-standards-toolkit/file3.pdf Normas para instalaciones de almacenamiento de documentos
- ↑ https://www.archives.gov/preservation/storage/presidential-library-standards.html Normas para el almacenamiento de documentos permanentes y bibliotecas presidenciales
- ↑ Sandborn, Peter; Lucyshyn, William (2022). System Sustainment: Acquisition And Engineering Processes For The Sustainment Of Critical And Legacy Systems . World Scientific. ISBN 9789811256868.
- 1 2 Trivedi, Kishor S.; Bobbio, Andrea (2017). Ingeniería de confiabilidad y disponibilidad: modelado, análisis y aplicaciones . Cambridge University Press. ISBN 978-1107099500.
- ↑ Vitillo, Roberto (23 de febrero de 2022). Comprensión de los sistemas distribuidos, segunda edición: Lo que todo desarrollador debe saber sobre las grandes aplicaciones distribuidas . Roberto Vitillo. ISBN 978-1838430214.
Enlaces externos
- Propulsión segura mediante control redundante avanzado.
- Utilizar la red eléctrica como canal de comunicación redundante
- Flammini, Francesco; Marrone, Stefano; Mazzocca, Nicola; Vittorini, Valeria (2009). "Un nuevo enfoque de modelado para la evaluación de seguridad de sistemas informáticos redundantes N-modulares en presencia de mantenimiento imperfecto". Reliability Engineering & System Safety . 94 (9): 1422– 1432. arXiv : 1304.6656 . doi : 10.1016/j.ress.2009.02.014 . S2CID 6932645 .
- conceptos de ingeniería
- Ingeniería de confiabilidad
- Seguridad
- Sistemas informáticos tolerantes a fallos