Los bosques aleatorios o bosques de decisión aleatorios son un método de aprendizaje conjunto para clasificación , regresión y otras tareas que funciona creando multitud de árboles de decisión durante el entrenamiento. Para tareas de clasificación, la salida del bosque aleatorio es la clase seleccionada por la mayoría de los árboles. Para tareas de regresión, la salida es el promedio de las predicciones de los árboles. [ 1 ] [ 2 ] Los bosques aleatorios corrigen la tendencia de los árboles de decisión a sobreajustarse a su conjunto de entrenamiento . [ 3 ] : 587–588
El primer algoritmo para bosques de decisión aleatorios fue creado en 1995 por Tin Kam Ho [ 1 ] utilizando el método del subespacio aleatorio , [ 2 ] que, en la formulación de Ho, es una forma de implementar el enfoque de "discriminación estocástica" para la clasificación propuesto por Eugene Kleinberg. [ 4 ] [ 5 ] [ 6 ]
Leo Breiman [ 7 ] y Adele Cutler [ 8 ] desarrollaron una extensión del algoritmo, quienes registraron [ 9 ] "Random Forests" como marca comercial en 2006 ( a partir de 2019) ., propiedad de Minitab, Inc. ). [ 10 ] La extensión combina la idea de " bagging " de Breiman y la selección aleatoria de características, introducida primero por Ho [ 1 ] y luego independientemente por Amit y Geman [ 11 ] para construir una colección de árboles de decisión con varianza controlada.
Historia
El método general de bosques de decisión aleatorios fue propuesto por primera vez por Salzberg y Heath en 1993, [ 12 ] con un método que utilizaba un algoritmo de árbol de decisión aleatorio para crear múltiples árboles y luego combinarlos mediante votación mayoritaria. Esta idea fue desarrollada posteriormente por Ho en 1995. [ 1 ] Ho estableció que los bosques de árboles que se dividen con hiperplanos oblicuos pueden ganar precisión a medida que crecen sin sufrir sobreajuste, siempre que los bosques estén restringidos aleatoriamente para ser sensibles solo a dimensiones de características seleccionadas . Un trabajo posterior en la misma línea [ 2 ] concluyó que otros métodos de división se comportan de manera similar, siempre que se les obligue aleatoriamente a ser insensibles a algunas dimensiones de características. Esta observación de que un clasificador más complejo (un bosque más grande) se vuelve más preciso de forma casi monótona contrasta marcadamente con la creencia común de que la complejidad de un clasificador solo puede crecer hasta cierto nivel de precisión antes de verse perjudicado por el sobreajuste. La explicación de la resistencia del método de bosques al sobreajuste se puede encontrar en la teoría de discriminación estocástica de Kleinberg. [ 4 ] [ 5 ] [ 6 ]
El desarrollo inicial de la noción de bosques aleatorios de Breiman estuvo influenciado por el trabajo de Amit y Geman [ 11 ], quienes introdujeron la idea de buscar en un subconjunto aleatorio de las decisiones disponibles al dividir un nodo, en el contexto del crecimiento de un solo árbol . La idea de selección aleatoria de subespacios de Ho [ 2 ] también influyó en el diseño de bosques aleatorios. Este método genera un bosque de árboles e introduce variación entre ellos proyectando los datos de entrenamiento en un subespacio elegido aleatoriamente antes de ajustar cada árbol o cada nodo. Finalmente, la idea de optimización aleatoria de nodos, donde la decisión en cada nodo se selecciona mediante un procedimiento aleatorio, en lugar de una optimización determinista, fue introducida por primera vez por Thomas G. Dietterich [ 13 ] .
La introducción adecuada a los bosques aleatorios se realizó en un artículo de Leo Breiman , [ 7 ] que se ha convertido en uno de los artículos más citados del mundo. [ 14 ] Este artículo describe un método para construir un bosque de árboles no correlacionados utilizando un procedimiento similar a CART , combinado con optimización aleatoria de nodos y bagging . Además, este artículo combina varios ingredientes, algunos previamente conocidos y otros novedosos, que forman la base de la práctica moderna de los bosques aleatorios, en particular:
- Utilizar el error fuera de la bolsa como una estimación del error de generalización .
- Medición de la importancia de las variables mediante permutaciones.
El informe también ofrece el primer resultado teórico para bosques aleatorios en forma de una cota para el error de generalización que depende de la fuerza de los árboles en el bosque y su correlación .
Algoritmo
Preliminares: aprendizaje de árboles de decisión
Los árboles de decisión son un método popular para diversas tareas de aprendizaje automático. El aprendizaje de árboles es casi un "procedimiento listo para usar en minería de datos", afirman Hastie et al. , "porque es invariante ante el escalado y otras transformaciones de los valores de las características, es robusto ante la inclusión de características irrelevantes y produce modelos inspeccionables. Sin embargo, rara vez son precisos". [ 3 ] : 352
En particular, los árboles que crecen muy profundamente tienden a aprender patrones muy irregulares: se sobreajustan a sus conjuntos de entrenamiento, es decir, tienen un sesgo bajo, pero una varianza muy alta . Los bosques aleatorios son una forma de promediar múltiples árboles de decisión profundos, entrenados en diferentes partes del mismo conjunto de entrenamiento, con el objetivo de reducir la varianza. [ 3 ] : 587–588 Esto se produce a costa de un pequeño aumento en el sesgo y cierta pérdida de interpretabilidad, pero generalmente mejora enormemente el rendimiento en el modelo final.
Harpillera

El algoritmo de entrenamiento para bosques aleatorios aplica la técnica general de agregación bootstrap , o bagging, a los algoritmos de aprendizaje de árboles. Dado un conjunto de entrenamiento X = x 1 , ..., x n con respuestas Y = y 1 , ..., y n , el bagging selecciona repetidamente ( B veces) una muestra aleatoria con reemplazo del conjunto de entrenamiento y ajusta árboles a estas muestras:
- Muestrear, con reemplazo, n ejemplos de entrenamiento de X , Y ; llame a estos X b , Y b .
- Entrenar un árbol de clasificación o regresión f b en X b , Y b .
Después del entrenamiento, se pueden hacer predicciones para muestras no vistas x' promediando las predicciones de todos los árboles de regresión individuales sobre x' :
o mediante votación por mayoría simple en el caso de árboles de clasificación.
Este procedimiento de remuestreo (bootstrapping) mejora el rendimiento del modelo al disminuir su varianza sin aumentar el sesgo. Esto significa que, si bien las predicciones de un solo árbol son muy sensibles al ruido en su conjunto de entrenamiento, el promedio de muchos árboles no lo es, siempre que no estén correlacionados. Entrenar muchos árboles con un solo conjunto de entrenamiento daría como resultado árboles fuertemente correlacionados (o incluso el mismo árbol varias veces, si el algoritmo de entrenamiento es determinista); el muestreo bootstrap es una forma de descorrelacionar los árboles mostrándoles diferentes conjuntos de entrenamiento.
Además, se puede hacer una estimación de la incertidumbre de la predicción como la desviación estándar de las predicciones de todos los árboles de regresión individuales en x ′ :
El número B de muestras (o, equivalentemente, de árboles) es un parámetro libre. Normalmente, se utilizan entre unos cientos y varios miles de árboles, dependiendo del tamaño y la naturaleza del conjunto de entrenamiento. B puede optimizarse mediante validación cruzada o observando el error fuera de la bolsa : el error de predicción medio en cada muestra de entrenamiento x i , utilizando solo los árboles que no tenían x i en su muestra de arranque. [ 15 ]
El error de entrenamiento y de prueba tiende a estabilizarse después de que se haya ajustado un cierto número de árboles.
Del bagging a los bosques aleatorios
El procedimiento anterior describe el algoritmo de bagging original para árboles. Los bosques aleatorios también incluyen otro tipo de esquema de bagging: utilizan un algoritmo de aprendizaje de árboles modificado que selecciona, en cada división candidata del proceso de aprendizaje, un subconjunto aleatorio de las características . Este proceso a veces se denomina "bagging de características". La razón para hacer esto es la correlación de los árboles en una muestra bootstrap ordinaria: si una o pocas características son predictores muy fuertes de la variable de respuesta (salida objetivo), estas características se seleccionarán en muchos de los árboles B , lo que hará que se correlacionen. Ho [ 16 ] proporciona un análisis de cómo el bagging y la proyección de subespacio aleatorio contribuyen a las ganancias de precisión bajo diferentes condiciones.
Normalmente, para un problema de clasificación concaracterísticas,Las características (redondeadas hacia abajo) se utilizan en cada división. [ 3 ] : 592 Para problemas de regresión, los inventores recomiendan(redondeado hacia abajo) con un tamaño de nodo mínimo de 5 como valor predeterminado. [ 3 ] : 592 En la práctica, los mejores valores para estos parámetros deben ajustarse caso por caso para cada problema. [ 3 ] : 592
Árboles adicionales
Agregar un paso más de aleatorización produce árboles extremadamente aleatorios , o ExtraTrees. Al igual que con los bosques aleatorios ordinarios, son un conjunto de árboles individuales, pero hay dos diferencias principales: (1) cada árbol se entrena usando toda la muestra de aprendizaje (en lugar de una muestra bootstrap), y (2) la división de arriba hacia abajo es aleatoria: para cada característica en consideración, se selecciona una serie de puntos de corte aleatorios , en lugar de calcular el punto de corte óptimo local (basado, por ejemplo, en la ganancia de información o la impureza de Gini ). Los valores se eligen de una distribución uniforme dentro del rango empírico de la característica (en el conjunto de entrenamiento del árbol). Luego, de todas las divisiones elegidas aleatoriamente, se elige la división que produce la puntuación más alta para dividir el nodo.
De forma similar a los bosques aleatorios ordinarios, se puede especificar el número de características seleccionadas aleatoriamente que se considerarán en cada nodo. Los valores predeterminados para este parámetro son:para la clasificación ypara regresión, dondees el número de características en el modelo. [ 17 ]
Bosques aleatorios para datos de alta dimensión
El procedimiento básico de bosque aleatorio puede no funcionar bien en situaciones donde hay una gran cantidad de características, pero solo una pequeña proporción de estas características son informativas con respecto a la clasificación de la muestra. Esto se puede solucionar fomentando que el procedimiento se centre principalmente en las características y los árboles que son informativos. Algunos métodos para lograr esto son:
- Prefiltrado: Eliminar características que son principalmente ruido. [ 18 ] [ 19 ]
- Bosque aleatorio enriquecido (ERF): Utiliza muestreo aleatorio ponderado en lugar de muestreo aleatorio simple en cada nodo de cada árbol, dando mayor peso a las características que parecen ser más informativas. [ 20 ] [ 21 ] [ 22 ]
- Bosque aleatorio ponderado por árboles (TWRF): Se da mayor peso a los árboles más precisos. [ 23 ] [ 24 ]
Propiedades
Importancia de las variables
Los bosques aleatorios pueden utilizarse para clasificar la importancia de las variables en un problema de regresión o clasificación de forma natural. La siguiente técnica se describió en el artículo original de Breiman [ 7 ] y está implementada en el paquete R [ 8 ]randomForest .
Importancia de la permutación
Para medir la importancia de una característica en un conjunto de datos.Primero, se entrena un bosque aleatorio con los datos. Durante el entrenamiento, se registra el error fuera de la muestra para cada punto de datos y se calcula el promedio en todo el bosque. (Si no se utiliza el bagging durante el entrenamiento, se pueden calcular los errores en un conjunto de prueba independiente).
Tras el entrenamiento, los valores de la característica se permutan en las muestras fuera de la bolsa y se vuelve a calcular el error fuera de la bolsa sobre este conjunto de datos perturbado. La importancia de la característica se calcula promediando la diferencia en el error fuera de la bolsa antes y después de la permutación en todos los árboles. La puntuación se normaliza mediante la desviación estándar de estas diferencias.
Las características que producen valores altos para esta puntuación se clasifican como más importantes que las características que producen valores bajos. La definición estadística de la medida de importancia de la variable fue dada y analizada por Zhu et al. [ 25 ].
Este método para determinar la importancia de las variables tiene algunos inconvenientes:
- Cuando las características tienen diferente número de valores, los bosques aleatorios favorecen las características con más valores. Las soluciones a este problema incluyen permutaciones parciales [ 26 ] [ 27 ] [ 28 ] y el crecimiento de árboles no sesgados. [ 29 ] [ 30 ]
- Si los datos contienen grupos de características correlacionadas de relevancia similar, entonces se prefieren los grupos más pequeños a los grupos grandes. [ 31 ]
- Si existen características colineales, el procedimiento podría no identificar características importantes. Una solución consiste en permutar grupos de características correlacionadas. [ 32 ]
Disminución media en la importancia de las características de impurezas
Este enfoque para la importancia de las características en bosques aleatorios considera importantes las variables que disminuyen mucho la impureza durante la división. [ 33 ] Se describe en el libro Classification and Regression Trees de Leo Breiman [ 34 ] y es la implementación predeterminada en scikit learnR. La definición es:dónde
- es una característica
- es el número de árboles en el bosque
- es árbol
- es la fracción de muestras que llegan al nodo
- es el cambio en la impureza en el árbolen el nodo.
Como medida de impureza para muestras que caen en un nodo, por ejemplo, se pueden utilizar las siguientes estadísticas:
La importancia normalizada se obtiene normalizando todas las características, de modo que la suma de las importancias normalizadas de las características sea 1.
La scikit learnimplementación predeterminada puede informar una importancia de características engañosa: [ 32 ]
- favorece las características de alta cardinalidad
- utiliza estadísticas de entrenamiento y, por lo tanto, no refleja la utilidad de una característica para predicciones en un conjunto de prueba [ 35 ].
Relación con los vecinos más cercanos
Lin y Jeon señalaron en 2002 una relación entre los bosques aleatorios y el algoritmo de k vecinos más cercanos ( k -NN). [ 36 ] Ambos pueden considerarse esquemas de vecindarios ponderados . Estos son modelos construidos a partir de un conjunto de entrenamiento.que hacen prediccionespara nuevos puntos x' observando el "vecindario" del punto, formalizado por una función de peso W :Aquí,es el peso no negativo del i -ésimo punto de entrenamiento en relación con el nuevo punto x' en el mismo árbol. Para cualquier x' , los pesos para los puntosLa suma debe ser igual a 1. Las funciones de ponderación son las siguientes:
- En k -NN,si x i es uno de los k puntos más cercanos a x' , y cero en caso contrario.
- En un árbol,si x i es uno de los k' puntos en la misma hoja que x' , y cero en caso contrario.
Dado que un bosque promedia las predicciones de un conjunto de m árboles con funciones de peso individuales, sus predicciones son
Esto demuestra que todo el bosque es nuevamente un esquema de vecindad ponderada, con ponderaciones que promedian las de los árboles individuales. Los vecinos de x' en esta interpretación son los puntoscompartiendo la misma hoja en cualquier árbolDe esta forma, el vecindario de x' depende de manera compleja de la estructura de los árboles y, por lo tanto, de la estructura del conjunto de entrenamiento. Lin y Jeon muestran que la forma del vecindario utilizado por un bosque aleatorio se adapta a la importancia local de cada característica. [ 36 ]
Aprendizaje no supervisado
Como parte de su construcción, los predictores de bosques aleatorios conducen naturalmente a una medida de disimilitud entre observaciones. Se puede definir de forma análoga la disimilitud entre datos sin etiquetar, entrenando un bosque para distinguir los datos originales "observados" de datos sintéticos generados adecuadamente a partir de una distribución de referencia. [ 7 ] [ 37 ] La disimilitud de bosques aleatorios es atractiva porque maneja muy bien tipos de variables mixtas, es invariante a transformaciones monótonas de las variables de entrada y es robusta a observaciones atípicas. La disimilitud de bosques aleatorios maneja fácilmente un gran número de variables semicontinuas debido a su selección intrínseca de variables; por ejemplo, la disimilitud de bosques aleatorios "Addcl 1" pondera la contribución de cada variable según su dependencia de otras variables. La disimilitud de bosques aleatorios se ha utilizado en diversas aplicaciones, por ejemplo, para encontrar grupos de pacientes basados en datos de marcadores tisulares. [ 38 ]
Variantes
En lugar de árboles de decisión, se han propuesto y evaluado modelos lineales como estimadores base en bosques aleatorios, en particular la regresión logística multinomial y los clasificadores bayesianos ingenuos . [ 39 ] [ 40 ] [ 41 ] En los casos en que la relación entre los predictores y la variable objetivo es lineal, los aprendices base pueden tener una precisión igualmente alta que el aprendiz de conjunto. [ 42 ] [ 39 ]
Bosque aleatorio de kernel
En el aprendizaje automático, los bosques aleatorios de kernel (KeRF) establecen la conexión entre los bosques aleatorios y los métodos de kernel . Al modificar ligeramente su definición, los bosques aleatorios pueden reescribirse como métodos de kernel , que son más interpretables y fáciles de analizar. [ 43 ]
Historia
Leo Breiman [ 44 ] fue el primero en notar el vínculo entre los bosques aleatorios y los métodos de kernel . Señaló que los bosques aleatorios entrenados usando vectores aleatorios i.i.d. en la construcción del árbol son equivalentes a un kernel que actúa sobre el margen verdadero. Lin y Jeon [ 45 ] establecieron la conexión entre los bosques aleatorios y el vecino más cercano adaptativo, lo que implica que los bosques aleatorios pueden verse como estimaciones de kernel adaptativas. Davies y Ghahramani [ 46 ] propusieron el Bosque Aleatorio de Kernel (KeRF) y demostraron que puede superar empíricamente a los métodos de kernel de última generación. Scornet [ 43 ] definió por primera vez las estimaciones de KeRF y dio el vínculo explícito entre las estimaciones de KeRF y los bosques aleatorios. También dio expresiones explícitas para kernels basados en el bosque aleatorio centrado [ 47 ] y el bosque aleatorio uniforme [ 48 ] , dos modelos simplificados de bosque aleatorio. Denominó a estos dos KeRF KeRF Centrado y KeRF Uniforme, y demostró límites superiores en sus tasas de consistencia.
Notaciones y definiciones
Preliminares: Bosques centrados
El bosque centrado [ 47 ] es un modelo simplificado del bosque aleatorio original de Breiman, que selecciona uniformemente un atributo entre todos los atributos y realiza divisiones en el centro de la celda a lo largo del atributo preseleccionado. El algoritmo se detiene cuando se forma un árbol binario completo de nivelestá construido, dondees un parámetro del algoritmo.
Bosque uniforme
El bosque uniforme [ 48 ] es otro modelo simplificado para el bosque aleatorio original de Breiman, que selecciona uniformemente una característica entre todas las características y realiza divisiones en un punto dibujado uniformemente en el lado de la celda, a lo largo de la característica preseleccionada.
De bosques aleatorios a KeRF
Dado un ejemplo de entrenamiento devariables aleatorias independientes con valor -distribuidas como el par prototipo independiente, dóndeNuestro objetivo es predecir la respuesta., asociada con la variable aleatoria, estimando la función de regresión. Un bosque de regresión aleatoria es un conjunto deárboles de regresión aleatorios. Denotemosel valor previsto en el puntopor el-ésimo árbol, dondeson variables aleatorias independientes, distribuidas como una variable aleatoria genérica, independientemente de la muestraEsta variable aleatoria puede utilizarse para describir la aleatoriedad inducida por la división de nodos y el procedimiento de muestreo para la construcción del árbol. Los árboles se combinan para formar la estimación del bosque finito.. Para los árboles de regresión, tenemos, dóndees la célula que contienediseñado con aleatoriedady conjunto de datos, y.
Por lo tanto, las estimaciones de bosques aleatorios satisfacen, para todo,El bosque de regresión aleatoria tiene dos niveles de promediado, primero sobre las muestras en la celda objetivo de un árbol, luego sobre todos los árboles. Por lo tanto, las contribuciones de las observaciones que están en celdas con una alta densidad de puntos de datos son menores que las de las observaciones que pertenecen a celdas menos pobladas. Para mejorar los métodos de bosque aleatorio y compensar la estimación errónea, Scornet [ 43 ] definió KeRF mediante que es igual a la media de laestá cayendo en las células que contienenen el bosque. Si definimos la función de conexión delbosque finito como, es decir, la proporción de células compartidas entrey, entonces casi con seguridad tenemos, que define el KeRF.
KeRF centrado
La construcción de KeRF centrado de niveles lo mismo que para el bosque centrado, excepto que las predicciones se hacen por, la función kernel correspondiente, o función de conexión, es
KeRF uniforme
Uniform KeRF se construye de la misma manera que Uniform Forest, excepto que las predicciones se hacen mediante..., la función kernel correspondiente, o función de conexión, es
Propiedades
Relación entre KeRF y el bosque aleatorio
Las predicciones proporcionadas por KeRF y los bosques aleatorios son similares si se controla el número de puntos en cada celda:
Supongamos que existen secuenciasde tal manera que, casi con seguridad, Entonces, casi con seguridad,
Relación entre KeRF infinito y bosque aleatorio infinito
Cuando el número de árbolesSi tiende a infinito, entonces tenemos un bosque aleatorio infinito y un KeRF infinito. Sus estimaciones son similares si el número de observaciones en cada celda está acotado:
Supongamos que existen secuenciasde tal manera que, casi con seguridad
Entonces, casi con seguridad,
Resultados consistentes
Supongamos que, dóndees un ruido gaussiano centrado, independiente de, con varianza finita. Además,está distribuido uniformemente enyes Lipschitz . Scornet [ 43 ] demostró cotas superiores en las tasas de consistencia para KeRF centrado y KeRF uniforme.
Consistencia de KeRF centrado
Siempre quey, existe una constantede tal manera que, para todos, .
Consistencia de KeRF uniforme
Siempre quey, existe una constantede tal manera que, .
Desventajas
Si bien los bosques aleatorios suelen lograr una mayor precisión que un solo árbol de decisión, sacrifican la interpretabilidad intrínseca de estos últimos. Los árboles de decisión pertenecen a una familia relativamente pequeña de modelos de aprendizaje automático que son fácilmente interpretables, junto con los modelos lineales, los modelos basados en reglas y los modelos basados en atención . Esta interpretabilidad es una de las principales ventajas de los árboles de decisión. Permite a los desarrolladores confirmar que el modelo ha aprendido información realista de los datos y permite a los usuarios finales tener confianza en las decisiones tomadas por el modelo. [ 39 ] [ 3 ] Por ejemplo, seguir la ruta que toma un árbol de decisión para tomar su decisión es bastante trivial, pero seguir las rutas de decenas o cientos de árboles es mucho más difícil. Para lograr tanto rendimiento como interpretabilidad, algunas técnicas de compresión de modelos permiten transformar un bosque aleatorio en un árbol de decisión mínimo "renacido" que reproduce fielmente la misma función de decisión. [ 39 ] [ 49 ] [ 50 ]
Otra limitación de los bosques aleatorios es que si las características están correlacionadas linealmente con el objetivo, el bosque aleatorio puede no mejorar la precisión del clasificador base. [ 39 ] [ 42 ] Lo mismo ocurre en problemas con múltiples variables categóricas. [ 51 ]
Véase también
- Boosting – Método de aprendizaje por conjuntos
- Aprendizaje mediante árboles de decisión : algoritmo de aprendizaje automático
- Aprendizaje de conjuntos : estadística y técnicas de aprendizaje automático
- Potenciación del gradiente : técnica de aprendizaje automático
- Estadística no paramétrica : tipo de análisis estadístico. Páginas que muestran breves descripciones de los destinos de redireccionamiento.
- Algoritmo aleatorio : Algoritmo que emplea un grado de aleatoriedad como parte de su lógica o procedimiento.
Referencias
- 1 2 3 4 Ho, Tin Kam (1995). Bosques de decisión aleatorios (PDF) . Actas de la 3.ª Conferencia Internacional sobre Análisis y Reconocimiento de Documentos, Montreal, QC, 14-16 de agosto de 1995. págs. 278-282 . Archivado del original (PDF) el 17 de abril de 2016. Recuperado el 5 de junio de 2016 .
- 1 2 3 4 Ho TK (1998). "El método del subespacio aleatorio para la construcción de bosques de decisión" (PDF) . IEEE Transactions on Pattern Analysis and Machine Intelligence . 20 (8): 832– 844. Bibcode : 1998ITPAM..20..832T . doi : 10.1109/34.709601 . S2CID 206420153 .
- 1 2 3 4 5 6 7 Hastie, Trevor ; Tibshirani, Robert ; Friedman, Jerome (2008). Los elementos del aprendizaje estadístico (2.ª ed.). Springer. ISBN 0-387-95284-5.
- 1 2 Kleinberg E (1990). "Discriminación estocástica" (PDF) . Anales de Matemáticas e Inteligencia Artificial . 1 ( 1–4 ): 207–239 . Bibcode : 1990AnMAI...1..207K . CiteSeerX 10.1.1.25.6750 . doi : 10.1007/BF01531079 . S2CID 206795835. Archivado del original (PDF) el 18 de enero de 2018.
- 1 2 Kleinberg E (1996). "Un método de modelado estocástico resistente al sobreentrenamiento para el reconocimiento de patrones" . Annals of Statistics . 24 (6): 2319– 2349. doi : 10.1214/aos/1032181157 . MR 1425956 .
- 1 2 Kleinberg E (2000). "Sobre la implementación algorítmica de la discriminación estocástica" (PDF) . IEEE Transactions on Pattern Analysis and Machine Intelligence . 22 (5): 473– 490. Bibcode : 2000ITPAM..22..473K . CiteSeerX 10.1.1.33.4131 . doi : 10.1109/34.857004 . S2CID 3563126. Archivado del original (PDF) el 18 de enero de 2018.
- 1 2 3 4 Breiman L (2001). "Bosques aleatorios" . Aprendizaje automático . 45 (1): 5– 32. Bibcode : 2001MachL..45....5B . doi : 10.1023/A:1010933404324 .
- 1 2 Liaw A (16 de octubre de 2012). "Documentación para el paquete randomForest de R" (PDF) . Recuperado el 15 de marzo de 2013 .
- ↑ Número de registro de marca comercial estadounidense 3185828, registrada el 19/12/2006.
- ↑ "RANDOM FORESTS Marca registrada de Health Care Productivity, Inc. - Número de registro 3185828 - Número de serie 78642027 :: Marcas registradas de Justia" .
- 1 2 Amit Y, Geman D (1997). "Cuantización de forma y reconocimiento con árboles aleatorios" (PDF) . Neural Computation . 9 (7): 1545– 1588. CiteSeerX 10.1.1.57.6069 . doi : 10.1162/neco.1997.9.7.1545 . S2CID 12470146. Archivado del original (PDF) el 5 de febrero de 2018. Recuperado el 1 de abril de 2008 .
- ↑ Heath, D., Kasif, S. y Salzberg, S. (1993). k-DT: Un método de aprendizaje de árboles múltiples. En Actas del Segundo Taller Internacional sobre Aprendizaje Multiestrategia , págs. 138-149.
- ↑ Dietterich, Thomas (2000). "Una comparación experimental de tres métodos para construir conjuntos de árboles de decisión: Bagging, Boosting y Randomization" . Machine Learning . 40 (2): 139– 157. doi : 10.1023/A:1007607513941 .
- ↑ Helen Pearson; Heidi Ledford; Matthew Hutson; Richard Van Noorden (15 de abril de 2025). "Exclusiva: los artículos más citados del siglo XXI". Nature . 640 (8059): 588– 592. doi : 10.1038/D41586-025-01125-9 . ISSN 1476-4687 . Wikidata Q135104889 .
- ↑ Gareth James; Daniela Witten; Trevor Hastie; Robert Tibshirani (2013). Introducción al aprendizaje estadístico . Springer. págs. 316–321 .
- ↑ Ho, Tin Kam (2002). "Análisis de complejidad de datos de las ventajas comparativas de los constructores de bosques de decisión" (PDF) . Pattern Analysis and Applications . 5 (2): 102– 112. doi : 10.1007/s100440200009 . S2CID 7415435. Archivado del original (PDF) el 17 de abril de 2016. Recuperado el 13 de noviembre de 2015 .
- ^ Geurts P, Ernst D, Wehenkel L (2006). "Árboles extremadamente aleatorios" (PDF) . Aprendizaje automático . 63 : 3– 42. doi : 10.1007/s10994-006-6226-1 .
- ↑ Dessi, N. & Milia, G. & Pes, B. (2013). Mejora del rendimiento de los bosques aleatorios en la clasificación de datos de microarrays. Artículo de conferencia, 99-103. 10.1007/978-3-642-38326-7_15.
- ↑ Ye, Y., Li, H., Deng, X., y Huang, J. (2008) Bosque aleatorio ponderado por características para la detección de interfaces de búsqueda web ocultas. Journal of Computational Linguistics and Chinese Language Processing, 13, 387–404.
- ↑ Amaratunga, D., Cabrera, J., Lee, YS (2008) Bosque aleatorio enriquecido. Bioinformática, 24, 2010-2014.
- ↑ Ghosh D, Cabrera J. (2022) Bosque aleatorio enriquecido para datos genómicos de alta dimensión. IEEE/ACM Trans Comput Biol Bioinform. 19(5):2817-2828. doi:10.1109/TCBB.2021.3089417.
- ↑ Amaratunga, D., Cabrera, J., Shkedy, Z. (2014). Exploración y análisis de microarrays de ADN y otros datos de alta dimensión. Nueva York: John Wiley. Segunda edición. 0.1002/9781118364505.
- ↑ Winham, Stacey & Freimuth, Robert & Biernacka, Joanna. (2013). Un enfoque de bosques aleatorios ponderados para mejorar el rendimiento predictivo. Análisis estadístico y minería de datos. 6. 10.1002/sam.11196.
- ↑ Li, HB, Wang, W., Ding, HW y Dong, J. (10-12 de noviembre de 2010). Método de bosque aleatorio ponderado por árboles para la clasificación de datos ruidosos de alta dimensión. Ponencia presentada en la 7.ª Conferencia Internacional IEEE de Ingeniería de Negocios Electrónicos de 2010.
- ↑ Zhu R, Zeng D, Kosorok MR (2015). "Árboles de aprendizaje por refuerzo" . Journal of the American Statistical Association . 110 (512): 1770– 1784. Bibcode : 2015JASA..110.1770Z . doi : 10.1080/01621459.2015.1036994 . PMC 4760114. PMID 26903687 .
- ↑ Deng, H.; Runger, G.; Tuv, E. (2011). Sesgo de las medidas de importancia para atributos y soluciones multivaluados . Actas de la 21.ª Conferencia Internacional sobre Redes Neuronales Artificiales (ICANN). págs. 293–300 .
- ↑ Altmann A, Toloşi L, Sander O, Lengauer T (mayo de 2010). "Importancia de la permutación: una medida de importancia de características corregida" . Bioinformatics . 26 (10): 1340–7 . doi : 10.1093/bioinformatics/btq134 . PMID 20385727 .
- ↑ Piryonesi S. Madeh; El-Diraby Tamer E. (2020-06-01). "El papel del análisis de datos en la gestión de activos de infraestructura: superando los problemas de tamaño y calidad de los datos". Journal of Transportation Engineering, Part B: Pavements . 146 (2): 04020022. doi : 10.1061/JPEODX.0000175 . S2CID 216485629 .
- ↑ Strobl C, Boulesteix AL, Augustin T (2007). "Selección de división imparcial para árboles de clasificación basada en el índice de Gini" (PDF) . Computational Statistics & Data Analysis . 52 : 483–501 . CiteSeerX 10.1.1.525.3178 . doi : 10.1016/j.csda.2006.12.030 .
- ↑ Painsky A, Rosset S (2017). "La selección de variables con validación cruzada en métodos basados en árboles mejora el rendimiento predictivo". IEEE Transactions on Pattern Analysis and Machine Intelligence . 39 (11): 2142– 2153. arXiv : 1512.03444 . Bibcode : 2017ITPAM..39.2142P . doi : 10.1109/tpami.2016.2636831 . PMID 28114007 . S2CID 5381516 .
- ↑ Tolosi L, Lengauer T (julio de 2011). "Clasificación con características correlacionadas: falta de fiabilidad de la clasificación de características y soluciones" . Bioinformatics . 27 (14): 1986–94 . doi : 10.1093/bioinformatics/btr300 . PMID 21576180 .
- 1 2 "Cuidado con las importancias predeterminadas de Random Forest" . explained.ai . Consultado el 25/10/2023 .
- ↑ Ortiz-Posadas, Martha Refugio (29 de febrero de 2020). Técnicas de reconocimiento de patrones aplicadas a problemas biomédicos . Springer Nature. ISBN 978-3-030-38021-2.
- ↑ Breiman, Leo (25 de octubre de 2017). Árboles de clasificación y regresión . Nueva York: Routledge. doi : 10.1201/9781315139470 . ISBN 978-1-315-13947-0.
- ↑ https://scikit-learn.org/stable/auto_examples/inspection/plot_permutation_importance.html 31 de agosto de 2023
- 1 2 Lin, Yi; Jeon, Yongho (2002). Bosques aleatorios y vecinos más cercanos adaptativos (Informe técnico). Informe técnico n.° 1055. Universidad de Wisconsin. CiteSeerX 10.1.1.153.9168 .
- ↑ Shi, T.; Horvath, S. (2006). "Aprendizaje no supervisado con predictores de bosques aleatorios". Journal of Computational and Graphical Statistics . 15 (1): 118– 138. CiteSeerX 10.1.1.698.2365 . doi : 10.1198/106186006X94072 . JSTOR 27594168 . S2CID 245216 .
- ↑ Shi T, Seligson D, Belldegrun AS, Palotie A, Horvath S (abril de 2005). "Clasificación de tumores mediante perfiles de microarrays tisulares: agrupamiento de bosques aleatorios aplicado al carcinoma de células renales" . Modern Pathology . 18 (4): 547– 57. doi : 10.1038/modpathol.3800322 . PMID 15529185 .
- 1 2 3 4 5 Piryonesi, S. Madeh; El-Diraby, Tamer E. (2021-02-01). "Uso del aprendizaje automático para examinar el impacto del tipo de indicador de rendimiento en el modelado del deterioro del pavimento flexible" . Journal of Infrastructure Systems . 27 (2): 04021005. doi : 10.1061/(ASCE)IS.1943-555X.0000602 . ISSN 1076-0342 . S2CID 233550030 .
- ↑ Prinzie, A.; Van den Poel, D. (2008). "Bosques aleatorios para clasificación multiclase: Logit multinomio aleatorio". Expert Systems with Applications . 34 (3): 1721– 1732. doi : 10.1016/j.eswa.2007.01.029 .
- ↑ Prinzie, Anita (2007). "Clasificación multiclase aleatoria: generalización de bosques aleatorios a MNL aleatorio y NB aleatorio". En Roland Wagner; Norman Revell; Günther Pernul (eds.). Aplicaciones de bases de datos y sistemas expertos: 18.ª Conferencia Internacional, DEXA 2007, Ratisbona, Alemania, 3-7 de septiembre de 2007, Actas . Lecture Notes in Computer Science. Vol. 4653. pp. 349–358 . doi : 10.1007/978-3-540-74469-6_35 . ISBN 978-3-540-74467-2.
- 1 2 Smith, Paul F.; Ganesh, Siva; Liu, Ping (2013-10-01). "Una comparación de la regresión de bosques aleatorios y la regresión lineal múltiple para la predicción en neurociencia" . Journal of Neuroscience Methods . 220 (1): 85– 91. doi : 10.1016/j.jneumeth.2013.08.024 . PMID 24012917. S2CID 13195700 .
- 1 2 3 4 Scornet, Erwan (2015). "Bosques aleatorios y métodos de kernel". arXiv : 1502.03836 [ math.ST ].
- ↑ Breiman, Leo (2000). "Alguna teoría del infinito para conjuntos de predictores" . Informe técnico 579, Departamento de Estadística, UCB.
{{cite journal}}: Para citar una revista se requiere|journal=( ayuda ) - ↑ Lin, Yi; Jeon, Yongho (2006). "Bosques aleatorios y vecinos más cercanos adaptativos". Journal of the American Statistical Association . 101 (474): 578– 590. Bibcode : 2006JASA..101..578L . CiteSeerX 10.1.1.153.9168 . doi : 10.1198/016214505000001230 . S2CID 2469856 .
- ↑ Davies, Alex; Ghahramani, Zoubin (2014). "El núcleo de bosque aleatorio y otros núcleos para grandes datos a partir de particiones aleatorias". arXiv : 1402.4293 [ stat.ML ].
- 1 2 Breiman L, Ghahramani Z (2004). "Consistencia para un modelo simple de bosques aleatorios". Departamento de Estadística, Universidad de California en Berkeley. Informe técnico (670). CiteSeerX 10.1.1.618.90 .
- 1 2 Arlot S, Genuer R (2014). "Análisis del sesgo de bosques puramente aleatorios". arXiv : 1407.3939 [ math.ST ].
- ↑ Sagi, Omer; Rokach, Lior (2020). "Bosque de decisiones explicable: Transformando un bosque de decisiones en un árbol interpretable" . Information Fusion . 61 : 124–138 . Bibcode : 2020InfFu..61..124S . doi : 10.1016/j.inffus.2020.03.013 . S2CID 216444882 .
- ↑ Vidal, Thibaut; Schiffer, Maximilian (2020). "Born-Again Tree Ensembles" . Conferencia Internacional sobre Aprendizaje Automático . 119. PMLR: 9743–9753 . arXiv : 2003.11132 .
- ↑ Piryonesi, Sayed Madeh (noviembre de 2019). La aplicación del análisis de datos a la gestión de activos: deterioro y adaptación al cambio climático en las carreteras de Ontario (tesis doctoral ).
Lecturas adicionales
- Prinzie A, Poel D (2007). "Clasificación multiclase aleatoria: generalización de bosques aleatorios a MNL aleatorio y NB aleatorio" . Aplicaciones de bases de datos y sistemas expertos . Notas de clase en ciencias de la computación . Vol. 4653. pág. 349. doi : 10.1007/978-3-540-74469-6_35 . ISBN 978-3-540-74467-2.
- Denisko D, Hoffman MM (febrero de 2018). "Clasificación e interacción en bosques aleatorios" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 115 ( 8): 1690– 1692. Bibcode : 2018PNAS..115.1690D . doi : 10.1073/pnas.1800256115 . PMC 5828645. PMID 29440440 .
- Hajjem, Ahlem; Bellavance, François; Larocque, Denis (2014-06-03). "Bosque aleatorio de efectos mixtos para datos agrupados" . Journal of Statistical Computation and Simulation . 84 (6): 1313– 1328. doi : 10.1080/00949655.2012.741599 . ISSN 0094-9655 .
Enlaces externos
- Descripción del clasificador Random Forests (sitio web de Leo Breiman)
- Liaw, Andy y Wiener, Matthew "Clasificación y regresión mediante randomForest" R News (2002) Vol. 2/3 pág. 18 (Discusión sobre el uso del paquete random forest para R )
- Algoritmos de clasificación
- Aprendizaje en conjunto
- Árboles de decisión
- Teoría de la decisión
- estadística computacional
- algoritmos de aprendizaje automático