La utilidad de la categoría es una medida de "calidad de la categoría" definida en Gluck y Corter (1985) [ 1 ] y Corter y Gluck (1992) [ 2 ] . Busca maximizar tanto la probabilidad de que dos objetos de la misma categoría tengan valores de atributos comunes como la probabilidad de que objetos de categorías diferentes tengan valores de atributos distintos. Su objetivo era reemplazar medidas más limitadas de calidad de la categoría, como la " validez de la señal " [ 3 ] [ 4 ] y el "índice de colocación" [ 5 ] . Proporciona una medida normativa de la teoría de la información sobre la ventaja predictiva obtenida por el observador que conoce la estructura de la categoría (es decir, las etiquetas de clase de las instancias) frente al observador que no la conoce . En este sentido, la motivación para la medida de utilidad de la categoría es similar a la métrica de ganancia de información utilizada en el aprendizaje de árboles de decisión . En ciertas presentaciones, también es formalmente equivalente a la información mutua , como se analiza más adelante. En el libro de Witten y Frank de 2005 se ofrece una revisión de la utilidad de categoría en su encarnación probabilística, con aplicaciones al aprendizaje automático . [ 6 ]
Definición de utilidad de categoría desde la perspectiva de la teoría de la probabilidad
La definición de utilidad de categoría basada en la teoría de la probabilidad que se da en Fisher (1987) [ 7 ] y Witten y Frank (2005) [ 8 ] es la siguiente:
dóndees un tamaño-conjunto decaracterísticas -arias yes un conjunto decategorías. El términodesigna la probabilidad marginal de que la característicaadquiere valory el términodesigna la probabilidad condicional de categoría que la característicaadquiere valordado que el objeto en cuestión pertenece a la categoría.
La motivación y el desarrollo de esta expresión para la utilidad de la categoría, y el papel del multiplicando.como un control de sobreajuste rudimentario , se da en las fuentes anteriores. En términos generales, [ 7 ] el términoes el número esperado de valores de atributos que un observador puede adivinar correctamente utilizando una estrategia de coincidencia de probabilidades junto con el conocimiento de las etiquetas de categoría, mientras quees el número esperado de valores de atributos que un observador puede adivinar correctamente con la misma estrategia, pero sin conocimiento de las etiquetas de categoría. Por lo tanto, su diferencia refleja la ventaja relativa que obtiene el observador al conocer la estructura de la categoría.
Definición teórica de la utilidad de categoría desde la perspectiva de la información.
La definición teórica de la información de utilidad de categoría para un conjunto de entidades con tamaño-conjunto de características binariasy una categoría binariaEn Gluck y Corter (1985) se presenta de la siguiente manera:
dóndees la probabilidad previa de que una entidad pertenezca a la categoría positiva(en ausencia de información sobre características),es la probabilidad condicional de que una entidad tenga una característicadado que la entidad pertenece a la categoría,es asimismo la probabilidad condicional de que una entidad tenga característicadado que la entidad pertenece a la categoría, yes la probabilidad previa de que una entidad posea una característica(en ausencia de información sobre la categoría).
La intuición detrás de la expresión anterior es la siguiente: El términorepresenta el costo (en bits) de codificar (o transmitir) de manera óptima la información de características cuando se sabe que los objetos a describir pertenecen a la categoría. De manera similar, el término representa el costo (en bits) de codificar (o transmitir) de manera óptima la información de características cuando se sabe que los objetos a describir pertenecen a la categoría. La suma de estos dos términos entre paréntesis es, por lo tanto, el promedio ponderado de estos dos costos. El término final,, representa el costo (en bits) de codificar (o transmitir) de forma óptima la información de características cuando no se dispone de información de categoría. El valor de la utilidad de la categoría será, en la formulación anterior, no negativo.
Utilidad de la categoría e información mutua
Gluck y Corter (1985) y Corter y Gluck (1992) mencionan que la utilidad de categoría es equivalente a la información mutua . [ 1 ] [ 2 ] He aquí una demostración sencilla de la naturaleza de esta equivalencia. Supongamos un conjunto de entidades, cada una con la mismacaracterísticas, es decir, conjunto de características, donde cada variable de característica tiene cardinalidad. Es decir, cada característica tiene la capacidad de adoptar cualquiera devalores distintos (que no necesitan estar ordenados; todas las variables pueden ser nominales); para el caso especialEstas características se considerarían binarias , pero de manera más general, para cualquier, las características son simplemente m-arias . Para los fines de esta demostración, sin pérdida de generalidad , el conjunto de característicaspuede ser reemplazado por una única variable agregadaque tiene cardinalidady adopta un valor únicocorrespondiente a cada combinación de características en el producto cartesiano. (La ordinalidad no importa, porque la información mutua no es sensible a la ordinalidad). En lo que sigue, un término comoo simplementese refiere a la probabilidad con la queadopta el valor particular. (Utilizando la variable de característica agregada)(Reemplaza múltiples sumas y simplifica la presentación posterior).
Para esta demostración, supongamos también una variable de una sola categoría., que tiene cardinalidad. Esto es equivalente a un sistema de clasificación en el que haycategorías que no se intersecan. En el caso especial deExisten dos casos de categorías discutidos anteriormente. A partir de la definición de información mutua para variables discretas, la información mutuaentre la variable de característica agregaday la variable de categoríaestá dado por:
dóndees la probabilidad previa de la variable de característicaadoptar valor,es la probabilidad marginal de la variable de categoríaadoptar valor, yes la probabilidad conjunta de variablesyadoptando simultáneamente esos valores respectivos. En términos de las probabilidades condicionales, esto puede reescribirse (o definirse) como
Si la definición original de la utilidad de categoría de arriba se reescribe con,
Esta ecuación tiene claramente la misma forma que la ecuación ( azul ) que expresa la información mutua entre el conjunto de características y la variable de categoría; la diferencia es que la sumaEn la categoría, la ecuación de utilidad se ejecuta sobre variables binarias independientes., mientras que la sumaen la información mutua corre sobre los valores del únicovariable -ariaLas dos medidas son realmente equivalentes solo cuando las características, son independientes (y suponiendo que los términos en la suma correspondientes aTambién se añaden).
Insensibilidad de la utilidad de la categoría a la ordinalidad
Al igual que la información mutua, la utilidad de la categoría no es sensible a ningún orden en los valores de las variables de características o categorías. Es decir, en lo que respecta a la utilidad de la categoría, el conjunto de categorías {small,medium,large,jumbo}no es cualitativamente diferente del conjunto de categorías {desk,fish,tree,mop}ya que la formulación de la utilidad de la categoría no tiene en cuenta ningún orden de la variable de clase. De manera similar, una variable de características que adopta valores {1,2,3,4,5}no es cualitativamente diferente de una variable de características que adopta valores {fred,joe,bob,sue,elaine}. En lo que respecta a la utilidad de la categoría o la información mutua , todas las variables de categoría y características son variables nominales. Por esta razón, la utilidad de la categoría no refleja ningún aspecto gestáltico de "bondad de la categoría" que pudiera basarse en tales efectos de orden. Un posible ajuste para esta insensibilidad a la ordinalidad viene dado por el esquema de ponderación descrito en el artículo para la información mutua .
Categoría "bondad": modelos y filosofía
Esta sección ofrece información básica sobre los orígenes y la necesidad de medidas formales de "calidad de la categoría", como la utilidad de la categoría, y parte de la historia que llevó al desarrollo de esta métrica en particular.
¿Qué características definen una buena categoría?
Al menos desde la época de Aristóteles, la filosofía ha sentido una enorme fascinación por la naturaleza de los conceptos y los universales . ¿Qué tipo de entidad es un concepto como «caballo»? Tales abstracciones no designan a ningún individuo en particular en el mundo, y sin embargo, difícilmente podemos imaginar comprender el mundo sin su uso. ¿Tiene, por lo tanto, el concepto «caballo» una existencia independiente fuera de la mente? Si la tiene, ¿cuál es el lugar de esta existencia independiente? La cuestión del lugar fue un tema importante sobre el cual las escuelas clásicas de Platón y Aristóteles discreparon notablemente. Sin embargo, coincidieron en que los universales sí tenían una existencia independiente de la mente. Por lo tanto, siempre hubo una verdad innegable sobre qué conceptos y universales existen en el mundo.
A finales de la Edad Media (quizás comenzando con Occam , aunque Porfirio también hace una observación mucho anterior que indica cierta incomodidad con el statu quo), sin embargo, la certeza que existía sobre este tema comenzó a erosionarse, y se volvió aceptable entre los llamados nominalistas y empiristas considerar los conceptos y universales como entidades estrictamente mentales o convenciones del lenguaje. Desde esta perspectiva de los conceptos —que son construcciones puramente representacionales— surge entonces una nueva pregunta: "¿Por qué poseemos un conjunto de conceptos en lugar de otro?". ¿Qué hace que un conjunto de conceptos sea "bueno" y otro "malo"? Esta es una pregunta con la que los filósofos modernos, y posteriormente los teóricos del aprendizaje automático y los científicos cognitivos, han lidiado durante muchas décadas.
¿Qué propósito tienen los conceptos?
Un enfoque para responder a tales preguntas es investigar el "papel" o "propósito" de los conceptos en la cognición. Así, la respuesta a "¿Para qué sirven los conceptos en primer lugar?" de Mill [ 9 ] y muchos otros es que la clasificación (concepción) es un precursor de la inducción : al imponer una categorización particular al universo, un organismo obtiene la capacidad de lidiar con objetos o situaciones físicamente no idénticos de manera idéntica, obteniendo así una ventaja predictiva sustancial. [ 10 ] [ 11 ] Como lo expresa JS Mill , [ 12 ]
El problema general de la clasificación... [es] proveer que las cosas sean pensadas en tales grupos, y esos grupos en tal orden, que mejor conduzca al recuerdo y a la determinación de sus leyes... [y] uno de los usos de tal clasificación es que al llamar la atención sobre las propiedades en las que se basa, y que, si la clasificación es buena, son características de muchas otras, facilita el descubrimiento de esas otras.
Partiendo de esta base, Mill llega a la siguiente conclusión, que anticipa gran parte del pensamiento posterior sobre la bondad de la categoría, incluida la noción de utilidad de la categoría: [ 12 ]
Los objetivos de la clasificación científica se alcanzan mejor cuando los objetos se agrupan según los cuales se pueden formular un mayor número de proposiciones generales, y estas proposiciones son más importantes que las que se podrían formular respecto de cualquier otro grupo en el que se pudieran distribuir las mismas cosas. Por lo tanto, las propiedades según las cuales se clasifican los objetos deberían, de ser posible, ser aquellas que son causa de muchas otras propiedades; o, al menos, que son indicadores claros de ellas.
Esto puede compararse con la "hipótesis de utilidad de la categoría" propuesta por Corter y Gluck en 1992: "Una categoría es útil en la medida en que se espera que mejore la capacidad de una persona para predecir con precisión las características de las instancias de esa categoría". [ 2 ] Mill parece sugerir aquí que la mejor estructura de categoría es aquella en la que las características (propiedades) de los objetos son lo más informativas posible sobre la clase del objeto y, simultáneamente, la clase del objeto es lo más informativa posible sobre las características del objeto. En otras palabras, un esquema de clasificación útil es aquel en el que el conocimiento de la categoría puede usarse para inferir con precisión las propiedades de los objetos, y el conocimiento de las propiedades puede usarse para inferir con precisión las clases de los objetos. También se puede comparar esta idea con el criterio de contrapredicación de Aristóteles para los predicados definicionales, así como con la noción de conceptos descrita en el análisis formal de conceptos .
Intentos de formalización
Se han sugerido diversas medidas con el objetivo de capturar formalmente esta noción de "bondad de categoría", la más conocida de las cuales es probablemente la " validez de la señal ". Validez de la señal de una característicacon respecto a la categoríase define como la probabilidad condicional de la categoría dada la característica, [ 3 ] [ 4 ] [ 13 ], o como la desviación de la probabilidad condicional de la tasa base de la categoría, [ 14 ] [ 15 ]Claramente, estas medidas cuantifican solo la inferencia de característica a categoría (es decir, validez de la señal ), pero no de categoría a característica, es decir, validez de la categoría.Además, si bien la validez de la señal se concibió originalmente para explicar la aparición demostrable de categorías básicas en la cognición humana —categorías de un nivel particular de generalidad que son evidentemente preferidas por los aprendices humanos—, rápidamente surgieron varias fallas importantes en la validez de la señal en este sentido. [ 2 ] [ 16 ] [ 5 ] (y otros)
Jones (1983) [ 5 ] intentó abordar ambos problemas maximizando simultáneamente la validez de las características y la validez de las categorías al definir el "índice de colocación" como el producto, pero esta construcción fue bastante ad hoc . [ 2 ] La utilidad de la categoría se introdujo como un refinamiento más sofisticado de la validez de la señal, que intenta cuantificar más rigurosamente el poder inferencial completo de una estructura de clase. Como se muestra arriba, desde cierto punto de vista la utilidad de la categoría es equivalente a la información mutua entre la variable de característica y la variable de categoría. Se ha sugerido que las categorías que tienen la mayor utilidad general de la categoría son aquellas que no solo son las "mejores" en un sentido normativo, sino también las que los aprendices humanos prefieren usar, por ejemplo, las categorías "básicas". [ 2 ] Otras medidas relacionadas de la bondad de la categoría son la "cohesión" [ 17 ] [ 18 ] y la "saliencia". [ 19 ]
Aplicaciones
- La utilidad de la categoría se utiliza como medida de evaluación de la categoría en el popular algoritmo de agrupamiento conceptual llamado COBWEB. [ 7 ]
Véase también
Referencias
- 1 2 Gluck, Mark A.; Corter, James E. ( 1985), "Información, incertidumbre y la utilidad de las categorías", Programa de la Séptima Conferencia Anual de la Sociedad de Ciencias Cognitivas , págs. 283–287
- 1 2 3 4 5 6 Corter, James E.; Gluck, Mark A. (marzo de 1992). "Explicando categorías básicas: predictibilidad de características e información" . Psychological Bulletin . 111 (2): 291– 303. doi : 10.1037/0033-2909.111.2.291 . ISSN 1939-1455 .
- 1 2 Reed, Stephen K. (julio de 1972). "Reconocimiento y categorización de patrones" . Psicología cognitiva . 3 (3): 382– 407. doi : 10.1016/0010-0285(72)90014-X .
- 1 2 Rosch, Eleanor; Mervis, Carolyn B (octubre de 1975). "Semejanzas familiares: estudios sobre la estructura interna de las categorías" . Psicología cognitiva . 7 (4): 573– 605. doi : 10.1016/0010-0285(75)90024-9 .
- 1 2 3 Jones, Gregory V. (noviembre de 1983). "Identificación de categorías básicas" . Psychological Bulletin . 94 (3): 423– 428. doi : 10.1037/0033-2909.94.3.423 . ISSN 1939-1455 .
- ↑ Witten, Ian H.; Frank, Eibe (2005). "Minería de datos: herramientas y técnicas prácticas de aprendizaje automático" . www.cs.waikato.ac.nz . págs. 260–262 . Archivado del original el 19 de enero de 2024. Recuperado el 20 de octubre de 2025 .
- 1 2 3 Fisher, Douglas H. (septiembre de 1987). "Adquisición de conocimiento mediante agrupamiento conceptual incremental" . Machine Learning . 2 (2): 139– 172. doi : 10.1007/BF00114265 . ISSN 0885-6125 .
- ↑ ( Witten y Frank 2005 )
- ↑ Mill (1843 , pág. 425)
- ↑ Smith, Edward E.; Medin, Douglas L. (1981). Categorías y conceptos . Cambridge, Massachusetts: Harvard University Press. ISBN 978-0674102750.
- ↑ Harnad, Stevan (2005), "Cognición es categorización: La cognición es categorización" , en Henri Cohen y Claire Lefebvre (eds.), Manual de categorización en ciencias cognitivas , Ámsterdam: Elsevier, pp . 19–43
- 1 2 Mill, John Stewart (1843). Un sistema de lógica, racional e inductiva: una visión conectada de los principios de la evidencia y los métodos de investigación científica . Londres: Longmans, Green and Co. pp. 466–468 .
- ↑ Rosch, Eleanor (1978), "Principios de categorización", en Eleanor Rosch y Barbara B. Lloyd (eds.), Cognición y categorización , Hillsdale, Nueva Jersey : Lawrence Erlbaum, pp . 27–48
- ↑ Kruschke, John K.; Johansen, Mark K. (1999). "Un modelo de aprendizaje de categorías probabilísticas" . Journal of Experimental Psychology: Learning, Memory, and Cognition . 25 (5): 1083– 1119. doi : 10.1037/0278-7393.25.5.1083 . ISSN 1939-1285 . PMID 10505339 .
- ↑ Edgell, Stephen E. (1993), "Uso de información configuracional y dimensional", en N. John Castellan (ed.), Toma de decisiones individual y grupal: temas actuales , Hillsdale, Nueva Jersey : Lawrence Erlbaum, pp . 43–64
- ↑ Murphy, Gregory L. (enero de 1982). "Validez de las señales y niveles de categorización" . Psychological Bulletin . 91 (1): 174– 177. doi : 10.1037/0033-2909.91.1.174 . ISSN 1939-1455 .
- ↑ Hanson, Stephen José; Bauer, Malcolm (marzo de 1989). "Agrupamiento conceptual, categorización y polimorfismo". Machine Learning . 3 (4): 343– 372. doi : 10.1007/BF00116838 . ISSN 0885-6125 .
- ↑ Gennari, John H.; Langley, Pat; Fisher, Doug (septiembre de 1989). "Modelos de formación incremental de conceptos". Inteligencia Artificial . 40 ( 1–3 ): 11–61 . doi : 10.1016/0004-3702(89)90046-5 .
- ↑ Gennari, John H. (1989). "Formación de conceptos focalizada". Actas del Sexto Taller Internacional sobre Aprendizaje Automático . Ithaca, Nueva York: Morgan Kaufmann. págs. 379–382 .
- Aprendizaje automático
- Ciencia cognitiva