
Un árbol de decisiones es una estructura de partición recursiva de apoyo a la toma de decisiones que utiliza un modelo arbóreo de las decisiones y sus posibles consecuencias, incluyendo resultados de eventos aleatorios , costos de recursos y utilidad . Es una forma de visualizar un algoritmo que solo contiene sentencias de control condicionales.
Los árboles de decisión se utilizan comúnmente en la investigación operativa , específicamente en el análisis de decisiones , [ 1 ] para ayudar a identificar la estrategia con mayor probabilidad de alcanzar un objetivo, pero también son una herramienta popular en el aprendizaje automático .
Descripción general
Un árbol de decisión es una estructura similar a un diagrama de flujo en la que cada nodo interno representa una prueba sobre un atributo (por ejemplo, si al lanzar una moneda sale cara o cruz), cada rama representa el resultado de la prueba y cada nodo hoja representa una etiqueta de clase (decisión tomada tras calcular todos los atributos). Las rutas desde la raíz hasta las hojas representan reglas de clasificación .
En el análisis de decisiones , se utiliza un árbol de decisiones y el diagrama de influencia, estrechamente relacionado, como herramienta visual y analítica de apoyo a la toma de decisiones, donde se calculan los valores esperados (o la utilidad esperada ) de las alternativas en competencia.
Un árbol de decisión consta de tres tipos de nodos: [ 2 ]
- Nodos de decisión: generalmente representados por cuadrados.
- Nodos de probabilidad: generalmente representados por círculos.
- Nodos finales: generalmente representados por triángulos.
Los árboles de decisión se utilizan comúnmente en la investigación operativa y la gestión de operaciones . Si, en la práctica, se deben tomar decisiones en línea sin posibilidad de recordar información y con conocimiento incompleto, un árbol de decisión debe complementarse con un modelo de probabilidad como modelo de mejor elección o algoritmo de selección en línea . Otro uso de los árboles de decisión es como medio descriptivo para calcular probabilidades condicionales .
Los árboles de decisión, los diagramas de influencia , las funciones de utilidad y otras herramientas y métodos de análisis de decisiones se enseñan a estudiantes de pregrado en facultades de negocios, economía de la salud y salud pública, y son ejemplos de métodos de investigación operativa o de ciencias de la gestión . Estas herramientas también se utilizan para predecir las decisiones de los hogares en situaciones normales y de emergencia. [ 3 ] [ 4 ]
Componentes básicos de un árbol de decisiones
Elementos del árbol de decisión

Dibujado de izquierda a derecha, un árbol de decisión solo tiene nodos de bifurcación (rutas que se dividen) pero no nodos de convergencia (rutas que se unen). Por lo tanto, al usarlos manualmente, pueden volverse muy grandes y, a menudo, resulta difícil dibujarlos completamente a mano. Tradicionalmente, los árboles de decisión se han creado manualmente —como muestra el ejemplo adjunto—, aunque cada vez se utiliza más software especializado.
Reglas de decisión
El árbol de decisión se puede linealizar en reglas de decisión , [ 5 ] donde el resultado es el contenido del nodo hoja y las condiciones a lo largo del camino forman una conjunción en la cláusula if. En general, las reglas tienen la forma:
- si condición1 y condición2 y condición3 entonces resultado.
Las reglas de decisión se pueden generar construyendo reglas de asociación con la variable objetivo a la derecha. También pueden denotar relaciones temporales o causales. [ 6 ]
Árbol de decisión mediante símbolos de diagrama de flujo
Generalmente, un árbol de decisiones se representa utilizando símbolos de diagrama de flujo , ya que resulta más fácil de leer y comprender para muchos. Cabe destacar que existe un error conceptual en el cálculo de "Proceder" del árbol que se muestra a continuación; dicho error se refiere al cálculo de las "costos" otorgadas en un proceso judicial.

Ejemplo de análisis
El análisis puede tener en cuenta la función de preferencia o utilidad del responsable de la toma de decisiones (por ejemplo, la empresa) , como por ejemplo:

La interpretación básica en esta situación es que la empresa prefiere el riesgo y las ganancias de B bajo coeficientes de preferencia de riesgo realistas (superiores a 400.000 dólares; en ese rango de aversión al riesgo, la empresa necesitaría modelar una tercera estrategia, "Ni A ni B").
Otro ejemplo, comúnmente utilizado en cursos de investigación operativa , es la distribución de socorristas en playas (también conocido como el ejemplo "La vida es una playa"). [ 7 ] El ejemplo describe dos playas con socorristas que se distribuirán en cada una. Existe un presupuesto máximo B que se puede distribuir entre las dos playas (en total), y utilizando una tabla de rendimientos marginales, los analistas pueden decidir cuántos socorristas asignar a cada playa.
En este ejemplo, se puede dibujar un árbol de decisiones para ilustrar los principios de rendimientos decrecientes en la playa n.° 1.

El árbol de decisiones ilustra que, al distribuir secuencialmente a los socorristas, colocar al primer socorrista en la playa n.° 1 sería lo óptimo si solo se dispone del presupuesto para uno. Pero si se dispone del presupuesto para dos socorristas, entonces colocarlos a ambos en la playa n.° 2 evitaría un mayor número de ahogamientos.

Diagrama de influencia
Gran parte de la información contenida en un árbol de decisiones puede representarse de forma más compacta como un diagrama de influencia , centrando la atención en los problemas y las relaciones entre los eventos.

Inducción de reglas de asociación
Los árboles de decisión también pueden considerarse modelos generativos de reglas de inducción a partir de datos empíricos. Un árbol de decisión óptimo se define entonces como un árbol que explica la mayor parte de los datos, minimizando al mismo tiempo el número de niveles (o "preguntas"). [ 8 ] Se han ideado varios algoritmos para generar dichos árboles óptimos, como ID3 /4/5, [ 9 ] CLS, ASSISTANT y CART.
Ventajas y desventajas
Entre las herramientas de apoyo a la toma de decisiones, los árboles de decisión (y los diagramas de influencia ) presentan varias ventajas. Árboles de decisión:
- Son fáciles de entender e interpretar. Las personas pueden comprender los modelos de árbol de decisión después de una breve explicación.
- Se puede obtener información valiosa incluso con pocos datos concretos. Es posible generar información importante a partir de la descripción que hacen los expertos de una situación (sus alternativas, probabilidades y costes) y sus preferencias en cuanto a los resultados.
- Ayudar a determinar los valores peores, mejores y esperados para diferentes escenarios.
- Utilice un modelo de caja blanca . Si un modelo proporciona un resultado determinado.
- Puede combinarse con otras técnicas de toma de decisiones.
- Se puede tener en cuenta la actuación de más de una persona que toma decisiones.
Desventajas de los árboles de decisión:
- Son inestables, lo que significa que un pequeño cambio en los datos puede provocar un gran cambio en la estructura del árbol de decisión óptimo.
- Suelen ser relativamente imprecisos. Muchos otros predictores funcionan mejor con datos similares. Esto se puede solucionar reemplazando un único árbol de decisión por un bosque aleatorio de árboles de decisión, pero un bosque aleatorio no es tan fácil de interpretar como un único árbol de decisión.
- Para datos que incluyen variables categóricas con diferente número de niveles, la ganancia de información en los árboles de decisión está sesgada a favor de aquellos atributos con más niveles. [ 10 ]
- Los cálculos pueden volverse muy complejos, especialmente si muchos valores son inciertos y/o si muchos resultados están relacionados.
Optimización de un árbol de decisiones
Hay varios aspectos que se deben considerar para mejorar la precisión del clasificador de árbol de decisión. A continuación, se presentan algunas optimizaciones posibles para asegurar que el modelo de árbol de decisión generado tome la decisión o clasificación correcta. Cabe destacar que estos no son los únicos aspectos a considerar, sino solo algunos.
Aumentar el número de niveles del árbol
La precisión del árbol de decisión puede variar según su profundidad. En muchos casos, las hojas del árbol son nodos puros . [ 11 ] Un nodo puro significa que todos sus datos pertenecen a una sola clase. [ 12 ] Por ejemplo, si las clases del conjunto de datos son Cáncer y No Cáncer, un nodo hoja se considera puro cuando todos sus datos de muestra pertenecen a una sola clase: cáncer o no cáncer. Un árbol más profundo no siempre es mejor para optimizar el árbol de decisión. Puede afectar negativamente el tiempo de ejecución. Si se utiliza un algoritmo de clasificación específico, un árbol más profundo podría ralentizar significativamente su tiempo de ejecución. Asimismo, existe la posibilidad de que el algoritmo que construye el árbol de decisión se vuelva mucho más lento a medida que aumenta su profundidad. Si el algoritmo divide los nodos puros, podría disminuir la precisión general del clasificador. En ocasiones, profundizar en el árbol puede provocar una disminución de la precisión en general, por lo que es fundamental probar la modificación de la profundidad del árbol de decisión y seleccionar la que produzca los mejores resultados. En resumen, observando los puntos a continuación, definiremos el número D como la profundidad del árbol.
Posibles ventajas de aumentar el número D:
- Aumenta la precisión del modelo de clasificación basado en árboles de decisión.
Posibles desventajas de aumentar D
- Problemas de tiempo de ejecución
- Disminución de la precisión en general
- Las divisiones de nodos puros al profundizar pueden causar problemas.
Es fundamental poder comprobar las diferencias en los resultados de clasificación al modificar D. Debemos poder cambiar y probar fácilmente las variables que podrían afectar la precisión y la fiabilidad del modelo de árbol de decisión.
La elección de funciones de división de nodos
La función de división de nodos utilizada puede influir en la precisión del árbol de decisión. Por ejemplo, usar la función de ganancia de información puede ofrecer mejores resultados que usar la función phi. La función phi se conoce como una medida de la "calidad" de una división candidata en un nodo del árbol de decisión. La función de ganancia de información se conoce como una medida de la "reducción de la entropía ". A continuación, construiremos dos árboles de decisión. Un árbol de decisión se construirá utilizando la función phi para dividir los nodos y el otro, utilizando la función de ganancia de información.
Las principales ventajas y desventajas de la ganancia de información y la función phi.
- Una desventaja importante de la ganancia de información es que la característica que se elige como el siguiente nodo en el árbol tiende a tener más valores únicos. [ 13 ]
- Una ventaja de la ganancia de información es que tiende a seleccionar las características más relevantes que se encuentran cerca de la raíz del árbol. Es una medida muy útil para determinar la relevancia de ciertas características.
- La función phi también es una buena medida para decidir la relevancia de algunas características en función de su "calidad".
Esta es la fórmula de la función de ganancia de información. La fórmula establece que la ganancia de información es una función de la entropía de un nodo del árbol de decisión menos la entropía de una división candidata en el nodo t del árbol de decisión.
Esta es la fórmula de la función phi. La función phi se maximiza cuando la característica elegida divide las muestras de manera que se produzcan divisiones homogéneas y cada división tenga aproximadamente el mismo número de muestras.
Estableceremos D, que representa la profundidad del árbol de decisión que estamos construyendo, en tres (D = 3). También disponemos del siguiente conjunto de datos de muestras de cáncer y no cáncer, junto con las características de mutación que presentan o no dichas muestras. Si una muestra presenta una mutación, se considera positiva para esa mutación y se representa con el valor uno. Si una muestra no presenta una mutación, se considera negativa para esa mutación y se representa con el valor cero.
En resumen, C significa cáncer y NC significa no cáncer. La letra M significa mutación , y si una muestra presenta una mutación específica, aparecerá en la tabla con un uno; de lo contrario, con un cero.
Ahora, podemos usar las fórmulas para calcular los valores de la función phi y los valores de ganancia de información para cada M en el conjunto de datos. Una vez calculados todos los valores, se puede generar el árbol. Lo primero que se debe hacer es seleccionar el nodo raíz. En la ganancia de información y la función phi, consideramos que la división óptima es la mutación que produce el valor más alto para la ganancia de información o la función phi. Supongamos que M1 tiene el valor más alto de la función phi y M4 tiene el valor más alto de ganancia de información. La mutación M1 será la raíz de nuestro árbol de la función phi y M4 será la raíz de nuestro árbol de ganancia de información. Puedes observar los nodos raíz a continuación.

Una vez seleccionado el nodo raíz, podemos dividir las muestras en dos grupos según presenten o no la mutación del nodo raíz. Estos grupos se denominarán grupo A y grupo B. Por ejemplo, si utilizamos M1 para dividir las muestras en el nodo raíz, obtendremos las muestras NC2 y C2 en el grupo A, y el resto de las muestras NC4, NC3, NC1 y C1 en el grupo B.
Ignorando la mutación elegida para el nodo raíz, proceda a colocar las siguientes mejores características que tengan los valores más altos de ganancia de información o la función phi en los nodos hijos izquierdo o derecho del árbol de decisión. Una vez elegido el nodo raíz y los dos nodos hijos para el árbol de profundidad = 3, podemos simplemente agregar las hojas. Las hojas representarán la decisión de clasificación final que el modelo ha producido en función de las mutaciones que una muestra tiene o no tiene. El árbol de la izquierda es el árbol de decisión que obtenemos al usar la ganancia de información para dividir los nodos, y el árbol de la derecha es el que obtenemos al usar la función phi para dividir los nodos.


Ahora supongamos que los resultados de clasificación de ambos árboles se dan utilizando una matriz de confusión .
Matriz de confusión sobre la ganancia de información:
Matriz de confusión de la función Phi:
El árbol que utiliza la ganancia de información arroja los mismos resultados que el que utiliza la función phi al calcular la precisión. Al clasificar las muestras con el modelo que utiliza la ganancia de información, obtenemos un verdadero positivo, un falso positivo, cero falsos negativos y cuatro verdaderos negativos. Con el modelo que utiliza la función phi, obtenemos dos verdaderos positivos, cero falsos positivos, un falso negativo y tres verdaderos negativos. El siguiente paso consiste en evaluar la efectividad del árbol de decisión utilizando algunas métricas clave que se analizarán en la sección de evaluación de árboles de decisión más adelante. Estas métricas pueden ayudar a determinar los siguientes pasos para optimizar el árbol de decisión.
Otras técnicas
La información anterior no es el final del proceso para construir y optimizar un árbol de decisión. Existen muchas técnicas para mejorar los modelos de clasificación de árboles de decisión que construimos. Una de ellas consiste en crear nuestro modelo de árbol de decisión a partir de un conjunto de datos de remuestreo (bootstrap ). Este conjunto de datos ayuda a eliminar el sesgo que se produce al construir un modelo de árbol de decisión con los mismos datos con los que se prueba. La capacidad de aprovechar el poder de los bosques aleatorios también puede ayudar a mejorar significativamente la precisión general del modelo. Este método genera múltiples decisiones a partir de varios árboles de decisión y suma los votos de cada uno para realizar la clasificación final. Existen muchas técnicas, pero el objetivo principal es probar la construcción del modelo de árbol de decisión de diferentes maneras para asegurar que alcance el máximo rendimiento posible.
Evaluación de un árbol de decisiones
Es importante conocer las métricas utilizadas para evaluar los árboles de decisión. Las principales métricas empleadas son la exactitud , la sensibilidad , la especificidad , la precisión , la tasa de errores , la tasa de falsos descubrimientos y la tasa de falsas omisiones . Todas estas métricas se derivan del número de verdaderos positivos , falsos positivos , verdaderos negativos y falsos negativos obtenidos al procesar un conjunto de muestras mediante el modelo de clasificación del árbol de decisión. Además, se puede crear una matriz de confusión para visualizar estos resultados. Todas estas métricas principales revelan información sobre las fortalezas y debilidades del modelo de clasificación construido a partir del árbol de decisión. Por ejemplo, una baja sensibilidad con una alta especificidad podría indicar que el modelo de clasificación no identifica correctamente las muestras cancerosas frente a las no cancerosas.
Analicemos la matriz de confusión que aparece a continuación.
Ahora calcularemos los valores de exactitud, sensibilidad, especificidad, precisión, tasa de errores, tasa de falsos descubrimientos y tasa de falsas omisiones.
Exactitud:
Sensibilidad (TPR – tasa de verdaderos positivos): [ 14 ]
Especificidad (TNR – tasa de verdaderos negativos):
Precisión (VPP – valor predictivo positivo):
Tasa de omisión (FNR – tasa de falsos negativos):
Tasa de falsos descubrimientos (FDR):
Tasa de falsa omisión (FOR):
Una vez que hayamos calculado las métricas clave, podemos hacer algunas conclusiones iniciales sobre el rendimiento del modelo de árbol de decisión construido. La precisión que calculamos fue del 71,60 %. El valor de precisión es bueno para empezar, pero nos gustaría que nuestros modelos fueran lo más precisos posible manteniendo el rendimiento general. El valor de sensibilidad del 19,64 % significa que de todas las personas que realmente dieron positivo para cáncer, dieron positivo. Si observamos el valor de especificidad del 99,06 %, sabemos que de todas las muestras que dieron negativo para cáncer, dieron negativo. En cuanto a la sensibilidad y la especificidad, es importante tener un equilibrio entre ambos valores, por lo que si podemos disminuir nuestra especificidad para aumentar la sensibilidad, eso resultaría beneficioso. [ 15 ] Estos son solo algunos ejemplos de cómo usar estos valores y sus significados para evaluar el modelo de árbol de decisión y mejorarlo en la siguiente iteración.
Véase también
- Árbol de comportamiento (inteligencia artificial, robótica y control) : modelo matemático de ejecución de planes.
- Diagrama de decisión binaria : estructura de datos para funciones booleanas.
- Boosting (aprendizaje automático) – Método de aprendizaje de conjunto
- Finanzas corporativas § Valoración de la flexibilidad - Aplicación de la técnica en valoraciones
- Ciclo de decisión : secuencia de pasos para la toma de decisiones.
- Lista de decisiones
- Matriz de decisión : lista de valores para comparación
- Tabla de decisiones : tabla que especifica acciones en función de las condiciones.
- Modelo de árbol de decisión – Modelo de complejidad computacional de la computación
- Fundamentación del diseño : enumeración explícita de las decisiones de diseño.
- DRAKON – Herramienta de mapeo de algoritmos
- Cadena de Markov : proceso aleatorio independiente del historial pasado.
- Bosque aleatorio : métodos de aprendizaje automático de conjunto basados en árboles
- Enfoque de prioridad ordinal : método de análisis de decisiones multicriterio
- Algoritmo de probabilidades : método para calcular estrategias óptimas para problemas de último éxito.
- Combinatoria topológica – Materia matemática
- Tabla de verdad : tabla matemática utilizada en lógica.
Referencias
- ↑ von Winterfeldt, Detlof; Edwards, Ward (1986). «Árboles de decisión». Análisis de decisiones e investigación del comportamiento . Cambridge University Press. págs. 63–89 . ISBN 0-521-27304-8.
- ↑ Kamiński, B.; Jakubczyk, M.; Szufel, P. (2017). "Un marco para el análisis de sensibilidad de árboles de decisión" . Central European Journal of Operations Research . 26 (1): 135– 159. doi : 10.1007/s10100-017-0479-6 . PMC 5767274. PMID 29375266 .
- ↑ Xu, Ningzhe; Lovreglio, Ruggiero; Kuligowski, Erica D.; Cova, Thomas J.; Nilsson, Daniel; Zhao, Xilei (1 de marzo de 2023). "Predicción y evaluación de la toma de decisiones sobre evacuación en incendios forestales mediante aprendizaje automático: resultados del incendio de Kincade de 2019". Fire Technology . 59 (2): 793–825 . doi : 10.1007/s10694-023-01363-1 . ISSN 1572-8099 .
- ↑ Díaz-Ramírez, Jenny; Estrada-García, Juan Alberto; Figueroa-Sayago, Juliana (1 de diciembre de 2023). "Predicción de las preferencias de elección del modo de transporte en un distrito universitario con modelos basados en árboles de decisión" . City and Environment Interactions . 20 100118. Bibcode : 2023CEnvI..2000118D . doi : 10.1016/j.cacint.2023.100118 . ISSN 2590-2520 .
- ↑ Quinlan, JR (1987). "Simplificando árboles de decisión". International Journal of Man-Machine Studies . 27 (3): 221– 234. CiteSeerX 10.1.1.18.4267 . doi : 10.1016/S0020-7373(87)80053-6 .
- ↑ K. Karimi y HJ Hamilton (2011), " Generación e interpretación de reglas de decisión temporales ", Revista internacional de sistemas de información informática y aplicaciones de gestión industrial, volumen 3
- ↑ Wagner, Harvey M. (1 de septiembre de 1975). Principios de investigación operativa: con aplicaciones a las decisiones gerenciales (2.ª ed.). Englewood Cliffs, NJ: Prentice Hall. ISBN 978-0-13-709592-6.
- ↑ R. Quinlan, "Aprendizaje de procedimientos de clasificación eficientes" , Machine Learning: an artificial intelligence approach , Michalski, Carbonell y Mitchell (eds.), Morgan Kaufmann, 1983, págs. 463-482. doi : 10.1007/978-3-662-12405-5_15
- ↑ Utgoff, PE (1989). Inducción incremental de árboles de decisión. Machine learning, 4(2), 161–186. doi : 10.1023/A:1022699900025
- ↑ Deng, H.; Runger, G.; Tuv, E. (2011). Sesgo de las medidas de importancia para atributos y soluciones multivaluados . Actas de la 21.ª Conferencia Internacional sobre Redes Neuronales Artificiales (ICANN).
- ↑ Larose, Chantal, Daniel (2014). Descubriendo conocimiento en los datos . Hoboken, NJ: John Wiley & Sons. pág. 167. ISBN 978-0-470-90874-7.
{{cite book}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Plapinger, Thomas (29 de julio de 2017). "¿Qué es un árbol de decisión?" . Hacia la ciencia de datos . Archivado del original el 10 de diciembre de 2021. Recuperado el 5 de diciembre de 2021 .
- ↑ Tao, Christopher (6 de septiembre de 2020). "No utilice árboles de decisión de esta manera" . Hacia la ciencia de datos . Archivado del original el 10 de diciembre de 2021. Recuperado el 10 de diciembre de 2021 .
- ↑ "Tasa de falsos positivos | Glosario de Split" . Split . Consultado el 10 de diciembre de 2021 .
- ↑ "Sensibilidad vs. Especificidad" . Análisis y separaciones de redes tecnológicas . Consultado el 10 de diciembre de 2021 .
Enlaces externos
- Amplios tutoriales y ejemplos sobre árboles de decisión.
- Galería de ejemplos de árboles de decisión
- Árboles de decisión potenciados por gradiente
- Árboles de decisión
- Análisis de decisiones