El análisis predictivo de fallos ( PFA , por sus siglas en inglés) se refiere a los métodos destinados a predecir fallos inminentes de sistemas o componentes (software o hardware) y, potencialmente, habilitar mecanismos para evitar o contrarrestar problemas de fallos, o recomendar el mantenimiento de los sistemas antes de que se produzcan fallos.
Por ejemplo, mecanismos informáticos que analizan las tendencias en los errores corregidos para predecir fallos futuros de los componentes de hardware/memoria y habilitar proactivamente mecanismos para evitarlos. El análisis predictivo de fallos se utilizó originalmente como término para una tecnología propietaria de IBM para monitorizar la probabilidad de fallo de las unidades de disco duro , aunque ahora el término se utiliza de forma genérica para diversas tecnologías que permiten evaluar el fallo inminente de las CPU, la memoria y los dispositivos de E/S. [ 1 ]
discos
IBM introdujo el término "PFA" y su tecnología en 1992, haciendo referencia a su unidad 0662-S1x ( disco Fast-Wide SCSI-2 de 1052 MB que funcionaba a 5400 rpm ).
Esta tecnología se basa en la medición de varios parámetros clave (principalmente mecánicos) de la unidad de disco, como la altura de vuelo de los cabezales . El firmware de la unidad compara los parámetros medidos con umbrales predefinidos y evalúa su estado. Si la unidad parece estar a punto de fallar, el sistema envía una notificación al controlador de disco.
Los principales inconvenientes de la tecnología incluían:
- El resultado binario: el único estado visible para el host era la presencia o ausencia de una notificación.
- Las comunicaciones unidireccionales: el firmware del controlador envía notificaciones.
Esta tecnología se fusionó con IntelliSafe para formar la tecnología de automonitoreo, análisis e informes (SMART, por sus siglas en inglés).
Procesador y memoria
Un elevado número de errores intermitentes de RAM corregidos por ECC puede predecir fallos futuros de DIMM [ 2 ] , por lo que se puede utilizar la desconexión automática de las cachés de memoria y CPU para evitar errores futuros [ 3 ]. Por ejemplo, en el sistema operativo Linux, el demonio mcelog eliminará automáticamente del uso las páginas de memoria que muestren correcciones excesivas y los núcleos del procesador que muestren errores de memoria corregibles en caché excesivos [ 4 ] .
Medios ópticos
En los soportes ópticos ( CD , DVD y Blu-ray ), se pueden predecir las fallas causadas por la degradación del soporte y detectar los soportes de baja calidad de fabricación antes de que se produzca la pérdida de datos, midiendo la tasa de errores de datos corregibles mediante software como QpxTool o Nero DiscSpeed . Sin embargo, no todos los fabricantes y modelos de unidades ópticas permiten el escaneo de errores. [ 5 ]
Referencias
- ↑ Intel Corp (2011). "Familia de procesadores Intel Xeon E7: soporte para servidores RAS de próxima generación. Libro blanco" . Consultado el 9 de mayo de 2012 .
- ↑ Bianca Schroeder ; Eduardo Pinheiro; Wolf-Dietrich Weber (2009). "Errores de DRAM en entornos reales: un estudio de campo a gran escala. Actas de SIGMETRICS, 2009" .
- ^ Espiga, Arruthers, Totari, Shapiro (2006). ""Evaluación del efecto de la eliminación de páginas de memoria en la fiabilidad, disponibilidad y fiabilidad de los sistemas frente a fallos de hardware", Actas de la Conferencia Internacional de 2006 sobre Sistemas y Redes Confiables.
{{cite news}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ "mcelog - manejo de errores de memoria en el espacio de usuario. Linux Kongress 2010" (PDF) . 2010.
- ↑ Lista de dispositivos compatibles con el software de escaneo de calidad de documentos QPxTool
Véase también
- MCELog: demonio de Linux para el procesamiento de comprobaciones de máquinas x86 para el análisis predictivo de fallos.
- Almacenamiento en disco duro de la computadora
- Dispositivos de almacenamiento de IBM
- Ranuras de almacenamiento de computadora