En estadística , la imputación es el proceso de reemplazar los datos faltantes con valores sustituidos. Cuando se sustituye un punto de datos, se conoce como " imputación de unidad "; cuando se sustituye un componente de un punto de datos, se conoce como " imputación de ítem ". Existen tres problemas principales que causan los datos faltantes: pueden introducir una cantidad sustancial de sesgo , dificultar el manejo y el análisis de los datos y reducir la eficiencia . [ 1 ] Debido a que los datos faltantes pueden crear problemas para el análisis de datos, la imputación se considera una forma de evitar los inconvenientes relacionados con la eliminación de casos con valores faltantes. Es decir, cuando falta uno o más valores para un caso, la mayoría de los paquetes estadísticos descartan por defecto cualquier caso que tenga un valor faltante, lo que puede introducir sesgo o afectar la representatividad de los resultados. La imputación preserva todos los casos reemplazando los datos faltantes con un valor estimado basado en otra información disponible. Una vez que se han imputado todos los valores faltantes, el conjunto de datos se puede analizar utilizando técnicas estándar para datos completos. [ 2 ] Los científicos han adoptado muchas teorías para explicar los datos faltantes, pero la mayoría de ellas introducen sesgos. Algunos de los intentos más conocidos para tratar los datos faltantes incluyen: imputación por baraja caliente y baraja fría ; eliminación por lista y por pares ; imputación por media ; factorización de matrices no negativas ; imputación por regresión ; última observación llevada adelante ; imputación estocástica ; e imputación múltiple .
Eliminación por lista (casos completos)
El método más común para tratar los datos faltantes es la eliminación de casos con valores faltantes (también conocida como eliminación de casos completos), que consiste en eliminar todos los casos con un valor faltante. Si los datos faltan completamente al azar , la eliminación de casos con valores faltantes no introduce ningún sesgo, pero sí disminuye la potencia del análisis al reducir el tamaño efectivo de la muestra. Por ejemplo, si se recopilan 1000 casos, pero 80 tienen valores faltantes, el tamaño efectivo de la muestra después de la eliminación de casos con valores faltantes es de 920. Si los casos no faltan completamente al azar, la eliminación de casos con valores faltantes introduce sesgo porque la submuestra de casos representada por los datos faltantes no es representativa de la muestra original (y si la muestra original era en sí misma una muestra representativa de una población, los casos completos tampoco son representativos de esa población). [ 3 ] Si bien la eliminación de casos con valores faltantes no presenta sesgo cuando los datos faltan completamente al azar, esto rara vez ocurre en la práctica. [ 4 ]
La eliminación por pares (o "análisis de casos disponibles") implica eliminar un caso cuando le falta una variable necesaria para un análisis particular, pero incluirlo en los análisis para los que están presentes todas las variables requeridas. Cuando se utiliza la eliminación por pares, el N total para el análisis no será consistente entre las estimaciones de parámetros. Debido a los valores incompletos de N en algunos momentos, si bien se mantiene una comparación completa de casos para otros parámetros, la eliminación por pares puede introducir situaciones matemáticas imposibles, como correlaciones superiores al 100 %. [ 5 ]
La principal ventaja de la eliminación completa de casos sobre otros métodos es su sencillez y facilidad de implementación. Esta es una de las razones principales por las que la eliminación completa de casos es el método más popular para gestionar datos faltantes, a pesar de sus numerosas desventajas.
imputación única
Cubierta caliente
Un método de imputación que antes era común era la imputación por baraja caliente, en la que un valor faltante se imputaba a partir de un registro similar seleccionado al azar. El término "baraja caliente" se remonta al almacenamiento de datos en tarjetas perforadas e indica que los donantes de información provienen del mismo conjunto de datos que los receptores. La pila de tarjetas estaba "caliente" porque se estaba procesando en ese momento.
Una forma de imputación por el método de la última observación arrastrada (o LOCF, por sus siglas en inglés) se denomina "última observación arrastrada" (o LOCF, por sus siglas en inglés), que consiste en ordenar un conjunto de datos según varias variables, creando así un conjunto de datos ordenado. La técnica encuentra el primer valor faltante y utiliza el valor de la celda inmediatamente anterior para imputar dicho valor. El proceso se repite para la siguiente celda con un valor faltante hasta que se hayan imputado todos los valores faltantes. En el caso común de mediciones repetidas de una variable para una persona u otra entidad, esto representa la creencia de que, si falta una medición, la mejor suposición es que no ha cambiado desde la última vez que se midió. Se sabe que este método aumenta el riesgo de sesgo y de conclusiones potencialmente falsas. Por esta razón, no se recomienda el uso de LOCF. [ 6 ]
Cubierta fría
Por el contrario, la imputación por baraja fría selecciona donantes de otro conjunto de datos. Gracias a los avances en la capacidad informática, los métodos de imputación más sofisticados han reemplazado en general las técnicas originales de imputación por baraja caliente, tanto aleatoria como ordenada. Es un método para reemplazar los valores de respuesta de ítems similares de encuestas anteriores. Está disponible en encuestas que miden intervalos de tiempo.
Sustitución media
Otra técnica de imputación consiste en reemplazar cualquier valor faltante con la media de esa variable para todos los demás casos, lo que tiene la ventaja de no modificar la media muestral de dicha variable. Sin embargo, la imputación por la media atenúa cualquier correlación que involucre a la(s) variable(s) imputada(s). Esto se debe a que, en los casos con imputación, se garantiza que no existe relación entre la variable imputada y ninguna otra variable medida. Por lo tanto, la imputación por la media presenta algunas propiedades atractivas para el análisis univariado, pero se vuelve problemática para el análisis multivariado.
La imputación de la media se puede realizar dentro de las clases (por ejemplo, categorías como el género) y se puede expresar comodóndees el valor imputado para el registroyes la media muestral de los datos de los encuestados dentro de alguna claseEste es un caso especial de imputación de regresión generalizada:
Aquí los valoresse estiman a partir de la regresiónenen datos no imputados,es una variable ficticia para la pertenencia a la clase, y los datos se dividen en encuestados () y faltante (). [ 7 ] [ 8 ]
Factorización de matrices no negativas
La factorización de matrices no negativas (NMF) puede manejar datos faltantes minimizando su función de costo, en lugar de tratarlos como ceros que podrían introducir sesgos. [ 9 ] Esto la convierte en un método matemáticamente probado para la imputación de datos. La NMF puede ignorar los datos faltantes en la función de costo, y el impacto de estos puede ser tan pequeño como un efecto de segundo orden.
Regresión
La imputación por regresión presenta el problema opuesto al de la imputación por la media. Se estima un modelo de regresión para predecir los valores observados de una variable a partir de otras variables, y dicho modelo se utiliza para imputar valores cuando falta el valor de esa variable. En otras palabras, la información disponible para los casos completos e incompletos se utiliza para predecir el valor de una variable específica. Los valores ajustados del modelo de regresión se utilizan para imputar los valores faltantes. El problema radica en que los datos imputados no incluyen un término de error en su estimación, por lo que las estimaciones se ajustan perfectamente a la línea de regresión sin varianza residual . Esto provoca una sobreidentificación de las relaciones y sugiere una mayor precisión en los valores imputados de la que se justifica. El modelo de regresión predice el valor más probable de los datos faltantes, pero no proporciona información sobre la incertidumbre de dicho valor.
La regresión estocástica fue un intento bastante exitoso de corregir la falta de un término de error en la imputación de regresión al agregar la varianza promedio de la regresión a las imputaciones de regresión para introducir error. La regresión estocástica muestra mucho menos sesgo que las técnicas mencionadas anteriormente, pero aún le faltaba algo: si se imputan datos, intuitivamente se pensaría que se debería introducir más ruido en el problema que la simple varianza residual. [ 5 ]
imputación múltiple
Para abordar el problema del aumento de ruido debido a la imputación, Rubin (1987) [ 10 ] desarrolló un método para promediar los resultados en múltiples conjuntos de datos imputados para tener esto en cuenta. Todos los métodos de imputación múltiple siguen tres pasos. [ 3 ]
- Imputación: Al igual que en la imputación simple, se imputan los valores faltantes. Sin embargo, los valores imputados se extraen m veces de una distribución en lugar de solo una vez. Al final de este paso, se obtendrán m conjuntos de datos completos.
- Análisis: Cada uno de los m conjuntos de datos se analiza. Al final de este paso, debería haber m análisis.
- Agrupación: Los m resultados se consolidan en un solo resultado calculando la media, la varianza y el intervalo de confianza de la variable de interés [ 11 ] [ 12 ] o combinando simulaciones de cada modelo por separado. [ 13 ]
La imputación múltiple puede utilizarse en casos donde los datos faltan completamente al azar , faltan al azar y faltan no al azar , aunque puede estar sesgada en este último caso. [ 14 ] Un enfoque es la imputación múltiple por ecuaciones encadenadas (MICE), también conocida como "especificación totalmente condicional" e "imputación múltiple de regresión secuencial". [ 15 ] MICE está diseñada para datos que faltan al azar, aunque hay evidencia de simulación que sugiere que con un número suficiente de variables auxiliares también puede funcionar con datos que faltan no al azar. Sin embargo, MICE puede sufrir problemas de rendimiento cuando el número de observaciones es grande y los datos tienen características complejas, como no linealidades y alta dimensionalidad.
Los enfoques más recientes para la imputación múltiple utilizan técnicas de aprendizaje automático para mejorar su rendimiento. MIDAS (Imputación Múltiple con Autoencoders de Eliminación de Ruido), por ejemplo, utiliza autoencoders de eliminación de ruido, un tipo de red neuronal no supervisada, para aprender representaciones latentes detalladas de los datos observados. [ 16 ] Se ha demostrado que MIDAS ofrece ventajas en precisión y eficiencia con respecto a las estrategias tradicionales de imputación múltiple.
Como se mencionó en la sección anterior, la imputación simple no considera la incertidumbre en las imputaciones. Después de la imputación, los datos se tratan como si fueran los valores reales en la imputación simple. La omisión de la incertidumbre en la imputación puede llevar a resultados excesivamente precisos y errores en las conclusiones extraídas. [ 17 ] Al imputar varias veces, la imputación múltiple considera la incertidumbre y el rango de valores que podría haber tomado el valor verdadero. Como era de esperar, la combinación de estimación de incertidumbre y aprendizaje profundo para la imputación se encuentra entre las mejores estrategias y se ha utilizado para modelar datos heterogéneos de descubrimiento de fármacos . [ 18 ] [ 19 ]
Además, si bien la imputación simple y la imputación de casos completos son más fáciles de implementar, la imputación múltiple no es muy difícil de implementar. Existe una amplia gama de paquetes estadísticos en diferentes programas de software estadístico que realizan fácilmente la imputación múltiple. Por ejemplo, el paquete MICE permite a los usuarios de R realizar la imputación múltiple utilizando el método MICE. [ 20 ] MIDAS se puede implementar en R con el paquete rMIDAS y en Python con el paquete MIDASpy. [ 16 ]
Véase también
Referencias
- ↑ Barnard, J.; Meng, XL (1999-03-01). "Aplicaciones de la imputación múltiple en estudios médicos: del SIDA al NHANES". Métodos estadísticos en investigación médica . 8 (1): 17– 36. doi : 10.1177/096228029900800103 . ISSN 0962-2802 . PMID 10347858 . S2CID 11453137 .
- ↑ Gelman, Andrew y Jennifer Hill . Análisis de datos mediante modelos de regresión y multinivel/jerárquicos. Cambridge University Press, 2006. Cap. 25
- 1 2 Lall, Ranjit (2016). "Cómo la imputación múltiple marca la diferencia" . Análisis político . 24 (4): 414– 433. doi : 10.1093/pan/mpw020 .
- ↑ Kenward, Michael G (26 de febrero de 2013). "El manejo de datos faltantes en ensayos clínicos" . Clinical Investigation . 3 (3): 241– 250. doi : 10.4155/cli.13.7 (inactivo el 12 de julio de 2025). ISSN 2041-6792 .
{{cite journal}}: CS1 maint: DOI inactivo desde julio de 2025 ( enlace ) - 1 2 Enders, CK (2010). Análisis aplicado de datos faltantes . Nueva York: Guilford Press. ISBN 978-1-60623-639-0.
- ↑ Molnar, Frank J.; Hutton, Brian; Fergusson, Dean (2008-10-07). "¿Introduce sesgo el análisis que utiliza la 'última observación llevada adelante' en la investigación sobre la demencia?" . Canadian Medical Association Journal . 179 (8): 751– 753. doi : 10.1503/cmaj.080820 . ISSN 0820-3946 . PMC 2553855 . PMID 18838445 .
- ↑ Kalton, Graham (1986). "El tratamiento de los datos faltantes en las encuestas". Metodología de encuestas . 12 : 1–16 .
- ↑ Kalton, Graham; Kasprzyk, Daniel (1982). "Imputación de respuestas faltantes en encuestas" ( PDF) . Actas de la Sección sobre Métodos de Investigación de Encuestas . 22. Asociación Estadounidense de Estadística . S2CID 195855359. Archivado del original (PDF) el 12 de febrero de 2020.
- ↑ Ren, Bin; Pueyo, Laurent; Chen, Christine; Choquet, Elodie; Debes, John H; Duchene, Gaspard; Menard, Francois; Perrin, Marshall D. (2020). "Uso de la imputación de datos para la separación de señales en imágenes de alto contraste" . The Astrophysical Journal . 892 (2): 74. arXiv : 2001.00563 . Bibcode : 2020ApJ...892...74R . doi : 10.3847/1538-4357/ab7024 . S2CID 209531731 .
- ↑ Rubin, Donald (9 de junio de 1987). Imputación múltiple para la falta de respuesta en encuestas . Serie Wiley en Probabilidad y Estadística. Wiley. doi : 10.1002/9780470316696 . ISBN 9780471087052.
- ↑ Yuan, Yang C. (2010). "Imputación múltiple para datos faltantes: conceptos y nuevos desarrollos" (PDF) . SAS Institute Inc., Rockville, MD . 49 : 1–11 . Archivado del original (PDF) el 3 de noviembre de 2018. Recuperado el 17 de enero de 2018 .
- ↑ Van Buuren, Stef (29 de marzo de 2012). "2. Imputación múltiple". Imputación flexible de datos faltantes . Serie de estadística interdisciplinaria Chapman & Hall/CRC. Vol. 20125245. Chapman and Hall/CRC. doi : 10.1201/b11826 . ISBN 9781439868249. S2CID 60316970 .
- ↑ King, Gary ; Honaker, James; Joseph, Anne; Scheve, Kenneth (marzo de 2001). "Análisis de datos incompletos de ciencia política: un algoritmo alternativo para la imputación múltiple" . American Political Science Review . 95 (1): 49–69 . doi : 10.1017/S0003055401000235 . ISSN 1537-5943 . S2CID 15484116 .
- ↑ Pepinsky, Thomas B. (2018-08-03). "Una nota sobre la eliminación de listas frente a la imputación múltiple" . Análisis político . 26 (4). Cambridge University Press (CUP): 480– 488. doi : 10.1017/pan.2018.18 . ISSN 1047-1987 .
- ↑ Azur, Melissa J.; Stuart, Elizabeth A.; Frangakis, Constantine; Leaf, Philip J. (2011-03-01). "Imputación múltiple por ecuaciones encadenadas: ¿qué es y cómo funciona?" . International Journal of Methods in Psychiatric Research . 20 (1): 40– 49. doi : 10.1002/mpr.329 . ISSN 1557-0657 . PMC 3074241 . PMID 21499542 .
- 1 2 Lall, Ranjit; Robinson, Thomas (2021). "El toque MIDAS: Imputación precisa y escalable de datos faltantes con aprendizaje profundo" . Análisis político . 30 (2): 179– 196. doi : 10.1017/pan.2020.49 .
- ↑ Graham, John W. (1 de enero de 2009). "Análisis de datos faltantes: cómo hacerlo funcionar en el mundo real". Annual Review of Psychology . 60 : 549–576 . doi : 10.1146/annurev.psych.58.110405.085530 . ISSN 0066-4308 . PMID 18652544 .
- ↑ Irwin, Benedict (1 de junio de 2020). " Aplicaciones prácticas del aprendizaje profundo para imputar datos heterogéneos de descubrimiento de fármacos". Journal of Chemical Information and Modeling . 60 (6): 2848– 2857. doi : 10.1021/acs.jcim.0c00443 . PMID 32478517. S2CID 219171721 .
- ↑ Whitehead, Thomas (12 de febrero de 2019). "Imputación de datos de bioactividad de ensayos mediante aprendizaje profundo". Journal of Chemical Information and Modeling . 59 (3): 1197– 1204. doi : 10.1021/acs.jcim.8b00768 . PMID 30753070. S2CID 73429643 .
- ↑ Horton, Nicholas J.; Kleinman, Ken P. (2007-02-01). "Mucho ruido y pocas nueces: una comparación de métodos y software para el manejo de datos faltantes para ajustar modelos de regresión con datos incompletos" . The American Statistician . 61 (1): 79– 90. doi : 10.1198/000313007X172556 . ISSN 0003-1305 . PMC 1839993. PMID 17401454 .
Enlaces externos
- Datos faltantes: Heffalumps a nivel de instrumento y Woozles a nivel de ítem
- Importación múltiple.com
- Preguntas frecuentes sobre imputación múltiple, Universidad Estatal de Pensilvania
- Descripción archivada el 14 de enero de 2005 en la Wayback Machine sobre la imputación de datos mediante el método hot deck de Statistics Finland.
- Artículo que amplía el enfoque de Rao-Shao y analiza los problemas relacionados con la imputación múltiple.
- Algoritmo de inducción de reglas difusas no ordenadas utilizado como método de imputación de valores faltantes para la agrupación K-medias en datos cardiovasculares reales.
- Aplicación práctica de la imputación por la Oficina Nacional de Estadística del Reino Unido
- Datos faltantes
- Codificación de datos estadísticos
- Transformación de datos estadísticos