Articulo de referencia

Fiabilidad, disponibilidad y facilidad de mantenimiento.

Confiabilidad, disponibilidad y facilidad de mantenimiento ( RAS ), también conocida como confiabilidad, disponibilidad y mantenibilidad ( RAM ), es un término de ingeniería de ...

Confiabilidad, disponibilidad y facilidad de mantenimiento ( RAS ), también conocida como confiabilidad, disponibilidad y mantenibilidad ( RAM ), es un término de ingeniería de hardware informático que abarca la ingeniería de confiabilidad , la alta disponibilidad y el diseño de facilidad de mantenimiento . La frase fue utilizada originalmente por IBM para describir la robustez de sus computadoras centrales . [ 1 ] [ 2 ]

Los ordenadores diseñados con niveles más altos de RAS tienen muchas características que protegen la integridad de los datos y ayudan a que permanezcan disponibles durante largos períodos de tiempo sin fallos . [ 3 ] Esta integridad de datos y tiempo de actividad es un punto de venta particular para los mainframes y los sistemas tolerantes a fallos .

Definiciones

Si bien RAS se originó como un término orientado al hardware , el pensamiento de sistemas ha extendido el concepto de confiabilidad-disponibilidad-mantenibilidad a los sistemas en general, incluido el software : [ 4 ]

  • La fiabilidad se puede definir como la probabilidad de que un sistema produzca resultados correctos hasta un tiempo determinado t . [ 5 ] La fiabilidad se ve mejorada por características que ayudan a evitar, detectar y reparar fallos de hardware. Un sistema fiable no continúa funcionando silenciosamente ni entrega resultados que incluyan datos corruptos sin corregir. En cambio, detecta y, si es posible, corrige la corrupción, por ejemplo: reintentando una operación para errores transitorios ( suaves ) o intermitentes, o bien, para errores incorregibles, aislando el fallo e informándolo a mecanismos de recuperación de nivel superior (que pueden conmutar a hardware de reemplazo redundante, etc.), o bien deteniendo el programa afectado o todo el sistema e informando de la corrupción. La fiabilidad se puede caracterizar en términos de tiempo medio entre fallos (MTBF), con fiabilidad = exp(−t/MTBF). [ 5 ]
  • La disponibilidad se refiere a la probabilidad de que un sistema esté operativo en un momento dado, es decir, el porcentaje de tiempo que un dispositivo está realmente en funcionamiento con respecto al tiempo total que debería estarlo. Los sistemas de alta disponibilidad pueden informar la disponibilidad en términos de minutos u horas de inactividad por año. Las funciones de disponibilidad permiten que el sistema permanezca operativo incluso cuando se producen fallos. Un sistema de alta disponibilidad desactivaría la parte defectuosa y continuaría funcionando a una capacidad reducida. Por el contrario, un sistema menos capaz podría fallar y quedar totalmente inoperativo. La disponibilidad se suele expresar como un porcentaje del tiempo que se espera que un sistema esté disponible, por ejemplo, 99,999 % (" cinco nueves ").
  • La facilidad de mantenimiento se refiere a la simplicidad y rapidez con la que se puede reparar o mantener un sistema; si aumenta el tiempo de reparación de un sistema averiado, disminuirá su disponibilidad. La facilidad de mantenimiento incluye diversos métodos para diagnosticar fácilmente el sistema cuando surgen problemas. La detección temprana de fallos puede reducir o evitar el tiempo de inactividad del sistema. Por ejemplo, algunos sistemas empresariales pueden llamar automáticamente a un centro de servicio (sin intervención humana) cuando el sistema experimenta un fallo. Tradicionalmente, el enfoque se ha centrado en realizar las reparaciones correctas con la menor interrupción posible de las operaciones normales.

Nótese la distinción entre fiabilidad y disponibilidad: la fiabilidad mide la capacidad de un sistema para funcionar correctamente, incluyendo la prevención de la corrupción de datos, mientras que la disponibilidad mide la frecuencia con la que el sistema está disponible para su uso, incluso si no funciona correctamente. Por ejemplo, un servidor puede funcionar indefinidamente y, por lo tanto, tener una disponibilidad ideal, pero puede ser poco fiable y sufrir frecuentes daños en los datos. [ 6 ]

Tipos de fallos

Los fallos físicos pueden ser temporales o permanentes:

  • Las fallas permanentes dan lugar a un error continuo y generalmente se deben a alguna falla física, como la electromigración del metal o la ruptura dieléctrica.
  • Las fallas temporales incluyen fallas transitorias e intermitentes .
    • Las fallas transitorias (también llamadas fallas leves ) provocan errores puntuales e independientes y no se deben a fallas permanentes del hardware: algunos ejemplos son las partículas alfa que alteran un bit de memoria, el ruido electromagnético o las fluctuaciones en la fuente de alimentación.
    • Las fallas intermitentes ocurren debido a un componente débil del sistema, por ejemplo, la degradación de los parámetros del circuito, lo que lleva a errores que probablemente se repitan. [ 5 ]

Respuestas ante fallos

Las fallas transitorias e intermitentes generalmente se pueden detectar y corregir, por ejemplo, mediante códigos ECC o la repetición de instrucciones (véase más abajo). Las fallas permanentes generan errores irrecuperables que se pueden solucionar reemplazando el hardware por duplicado (por ejemplo, mediante la reserva de procesadores) o transfiriendo el error irrecuperable a mecanismos de recuperación de alto nivel. Una falla intermitente corregida con éxito también se puede notificar al sistema operativo para proporcionar información para el análisis predictivo de fallas .

Características del hardware

Entre las características de hardware que pueden servir de ejemplo para mejorar el RAS se incluyen las siguientes, listadas por subsistema:

Los diseños tolerantes a fallos ampliaron la idea al convertir la fiabilidad, disponibilidad y disponibilidad ( RAS ) en la característica definitoria de sus ordenadores para aplicaciones como las bolsas de valores o el control del tráfico aéreo , donde las caídas del sistema serían catastróficas. Los ordenadores tolerantes a fallos (por ejemplo, Tandem Computers y Stratus Technologies ), que suelen tener componentes duplicados funcionando de forma sincronizada para garantizar la fiabilidad, se han vuelto menos populares debido a su elevado coste. Los sistemas de alta disponibilidad , que utilizan técnicas de computación distribuida como los clústeres de ordenadores , se emplean a menudo como alternativas más económicas.

Véase también

Referencias

  1. Siewiorek, Daniel P.; Swarz, Robert S. (1998). Sistemas informáticos fiables: diseño y evaluación . Taylor & Francis. pág . 508. ISBN  9781568810928."El acrónimo RAS (fiabilidad, accesibilidad y capacidad de servicio) fue ampliamente aceptado en IBM como sustituto del concepto de gestión de recuperación."
  2. División de Procesamiento de Datos, International Business Machines Corp., 1970 (1970). "Procesador de datos, números 13-17".{{cite journal}}: |author=tiene nombre genérico ( ayuda ) ; Se requiere citar la revista |journal=( ayuda ) CS1 maint: nombres múltiples: lista de autores ( enlace ) CS1 maint: nombres numéricos: lista de autores ( enlace ) - "La confiabilidad [...] experimentada por otros usuarios de System/370 es el resultado de una estrategia basada en RAS (Fiabilidad-Disponibilidad-Capacidad de servicio)"
  3. Siewert, Sam (marzo de 2005). "Lecciones de hierro grande, parte 2: Fiabilidad y disponibilidad: ¿Cuál es la diferencia?" (PDF) . Archivado del original (PDF) el 3 de marzo de 2022. Recuperado el 23 de enero de 2021 .
  4. Por ejemplo: Laros III, James H. (4 de septiembre de 2012). Computación de alto rendimiento energéticamente eficiente: medición y ajuste . SpringerBriefs in Computer Science. et al. Springer Science & Business Media (publicado en 2012). pág. 8. ISBN  9781447144922Recuperado el 8 de julio de 2014. Históricamente, los sistemas de confiabilidad, disponibilidad y capacidad de servicio (RAS) eran comúnmente proporcionados por los proveedores en sistemas de clase mainframe. [...] El sistema RAS será una unión sistemática de software y hardware con el propósito de administrar y monitorear todos los componentes de hardware y software del sistema hasta su máximo potencial.
  5. 1 2 3 E.J. McClusky y S. Mitra (2004). "Tolerancia a fallos" en Computer Science Handbook 2ed. ed. AB Tucker. CRC Press .
  6. Spencer, Richard H.; Floyd, Raymond E. (11 de julio de 2011). Perspectivas sobre ingeniería . Bloomington, Indiana: AuthorHouse (publicado en 2011). pág. 33. ISBN  9781463410919. Recuperado el 05/05/2014 . [...] un servidor de sistema puede tener una disponibilidad excelente (funciona indefinidamente), pero continúa teniendo corrupción de datos frecuente (no es muy confiable).
  7. Daniel Lipetz y Eric Schwarz (2011). "Autocomprobación en unidades de punto flotante actuales. Actas del 20.º Simposio IEEE de Aritmética Computacional de 2011" (PDF) . Archivado del original (PDF) el 24 de enero de 2012. Consultado el 6 de mayo de 2012 .
  8. L. Spainhower y TA Gregg (septiembre de 1999). "Tolerancia a fallos del servidor empresarial paralelo IBM S/390 G5: una perspectiva histórica. IBM Journal of Research and Development. Volumen 43 Número 5" (PDF) . CiteSeerX 10.1.1.85.5994 . 
  9. "La tecnología de repetición de instrucciones de Intel detecta y corrige errores" . Consultado el 7 de diciembre de 2012 .
  10. HP. "Evolución de la tecnología de memoria: una visión general de las tecnologías de memoria del sistema. Resumen tecnológico, 9.ª edición (página 8)" (PDF) . Archivado del original (PDF) el 24 de julio de 2011.
  11. Intel Corp. (2003). "PCI Express proporciona confiabilidad, disponibilidad y facilidad de servicio para empresas" .
  12. "Mejores prácticas para la confiabilidad de datos con Oracle VM Server para SPARC" (PDF) . Consultado el 2 de julio de 2013 .
  13. "Consideraciones sobre la redundancia de IBM Power" . Consultado el 2 de julio de 2013 .
  • Características de confiabilidad, disponibilidad y facilidad de servicio (RAS) de Itanium Archivado el 11/11/2011 en Wayback Machine Descripción general de las características RAS en general y características específicas del procesador Itanium .
  • POWER7 System RAS Aspectos clave de la confiabilidad, disponibilidad y facilidad de mantenimiento de los sistemas Power. Daniel Henderson, Jim Mitchell y George Ahrens. 10 de febrero de 2012. Archivado el 28 de diciembre de 2018 en Wayback Machine . Descripción general de las características RAS en los procesadores Power .
  • Intel Corp. Fiabilidad, disponibilidad y facilidad de mantenimiento para la empresa siempre activa (apéndice B) y la familia de procesadores Intel Xeon E7: compatibilidad con servidores RAS de próxima generación. Libro blanco. Descripción general de las funciones RAS en los procesadores Xeon .
  • Descripción general del sistema zEnterprise 196. IBM Corp. (Capítulo 10) Descripción general de las características RAS del procesador IBM z196 y del servidor zEnterprise 196 .
  • Maximización de la fiabilidad y disponibilidad de las aplicaciones con las funciones RAS del servidor SPARC M5-32 de Oracle.