En aprendizaje automático , el perceptrón es un algoritmo para el aprendizaje supervisado de clasificadores binarios . Un clasificador binario es una función que puede decidir si una entrada, representada por un vector de números, pertenece o no a alguna clase específica. [ 1 ] Es un tipo de clasificador lineal , es decir, un algoritmo de clasificación que realiza sus predicciones basándose en una función predictora lineal que combina un conjunto de pesos con el vector de características .
Historia


La neurona artificial y la red neuronal artificial fueron inventadas en 1943 por Warren McCulloch y Walter Pitts en su artículo fundamental " Un cálculo lógico de las ideas inmanentes en la actividad nerviosa ". [ 5 ]
En 1957, Frank Rosenblatt se encontraba en el Laboratorio Aeronáutico de Cornell . Simuló el perceptrón en un IBM 704. [ 6 ] [ 7 ] Más interesado en las implementaciones de hardware [ 8 ] , obtuvo financiación de la Rama de Sistemas de Información de la Oficina de Investigación Naval de los Estados Unidos y del Centro de Desarrollo Aeronáutico de Roma para construir una computadora analógica a medida, el Perceptrón Mark I. El equipo de Rosenblatt lo ensambló y probó en el Laboratorio Aeronáutico de Cornell (CAL) en Buffalo, NY, EE. UU., entre junio de 1959 y el 14 de diciembre de 1959 [ 8 ] . Su primera demostración pública tuvo lugar el 23 de junio de 1960. [ 9 ] La máquina fue "parte de un esfuerzo previamente secreto de cuatro años del NPIC [ Centro Nacional de Interpretación Fotográfica de los EE. UU. ] desde 1963 hasta 1966 para desarrollar este algoritmo como una herramienta útil para los fotointérpretes". [ 10 ]
Rosenblatt describió los detalles del perceptrón en un artículo de 1958. [ 11 ] Su organización del perceptrón se compone de tres tipos de células ("unidades"): S, A, R, que representan "sensorial", "asociación" y "respuesta". Presentó su trabajo en el primer simposio internacional sobre IA, Mecanización de los Procesos del Pensamiento , que tuvo lugar en noviembre de 1958. [ 12 ]
El proyecto de Rosenblatt fue financiado bajo el Contrato Nonr-401(40) "Programa de Investigación de Sistemas Cognitivos", que duró de 1959 a 1970, [ 13 ] y el Contrato Nonr-2381(00) "Proyecto PARA" ("PARA" significa "Autómatas de Percepción y Reconocimiento"), que duró de 1957 [ 6 ] a 1963. [ 14 ]
En 1959, el Instituto de Análisis de Defensa adjudicó a su grupo un contrato de 10.000 dólares. En septiembre de 1961, la ONR adjudicó otros contratos por valor de 153.000 dólares, con 108.000 dólares comprometidos para 1962. [ 15 ]
El director de investigación de la ONR, Marvin Denicoff, declaró que la ONR, en lugar de la ARPA , financió el proyecto Perceptrón porque era improbable que produjera resultados tecnológicos a corto o medio plazo. La financiación de la ARPA asciende a millones de dólares, mientras que la de la ONR ronda los 10 000 dólares. Por su parte, el director de IPTO en la ARPA, JCR Licklider , se interesó en los métodos «autoorganizados», «adaptativos» y otros métodos de inspiración biológica en la década de 1950; pero a mediados de la década de 1960 los criticó abiertamente, incluido el perceptrón. En cambio, defendió firmemente el enfoque de IA lógica de Simon y Newell . [ 16 ]
Máquina perceptrón Mark I

El perceptrón fue concebido como una máquina, no como un programa, y si bien su primera implementación fue en software para el IBM 704 , posteriormente se implementó en hardware personalizado como el Perceptrón Mark I con el nombre de proyecto "Proyecto PARA", [ 17 ] diseñado para el reconocimiento de imágenes . La máquina se encuentra actualmente en el Museo Nacional de Historia Americana del Smithsonian . [ 18 ]
El perceptrón Mark I tenía tres capas. Una versión se implementó de la siguiente manera:
- Un conjunto de 400 fotocélulas dispuestas en una cuadrícula de 20x20, denominadas "unidades sensoriales" (unidades S) o "retina de entrada". Cada unidad S puede conectarse a hasta 40 unidades A.
- Una capa oculta de 512 perceptrones, denominados "unidades de asociación" (unidades A).
- Una capa de salida compuesta por ocho perceptrones, denominados "unidades de respuesta" (unidades R).
Rosenblatt denominó a esta red de perceptrones de tres capas perceptrón alfa , para distinguirla de otros modelos de perceptrones con los que experimentó. [ 9 ]
Las unidades S se conectan a las unidades A de forma aleatoria (según una tabla de números aleatorios) mediante un panel de conexiones (véase la foto), para «eliminar cualquier sesgo intencional en el perceptrón». Los pesos de conexión son fijos, no aprendidos. Rosenblatt insistió en las conexiones aleatorias, pues creía que la retina se conectaba aleatoriamente a la corteza visual, y quería que su máquina perceptrón se asemejara a la percepción visual humana. [ 19 ]
Las unidades A están conectadas a las unidades R, con pesos ajustables codificados en potenciómetros , y las actualizaciones de peso durante el aprendizaje se realizaron mediante motores eléctricos. [ 2 ] : 193 Los detalles del hardware se encuentran en un manual del operador. [ 17 ]

En una conferencia de prensa organizada por la Marina de los EE. UU. en 1958, Rosenblatt hizo declaraciones sobre el perceptrón que causaron una acalorada controversia entre la incipiente comunidad de IA ; basándose en las declaraciones de Rosenblatt, The New York Times informó que el perceptrón era "el embrión de una computadora electrónica que [la Marina] espera que pueda caminar, hablar, ver, escribir, reproducirse y ser consciente de su existencia". [ 20 ]
La División de Fotografía de la Agencia Central de Inteligencia , entre 1960 y 1964, estudió el uso de la máquina Perceptrón Mark I para reconocer objetivos silueteados de interés militar (como aviones y barcos) en fotografías aéreas . [ 21 ] [ 22 ]
Principios de Neurodinámica (1962)
Rosenblatt describió sus experimentos con muchas variantes de la máquina Perceptrón en el libro Principios de Neurodinámica (1962). El libro es una versión publicada del informe de 1961. [ 23 ]
Entre las variantes se encuentran:
- "acoplamiento cruzado" (conexiones entre unidades dentro de la misma capa) con posibles bucles cerrados,
- "acoplamiento inverso" (conexiones de unidades de una capa posterior a unidades de una capa anterior),
- perceptrones de cuatro capas donde las dos últimas capas tienen pesos ajustables (y por lo tanto un perceptrón multicapa adecuado),
- incorporando retardos de tiempo a las unidades perceptrón, para permitir el procesamiento de datos secuenciales,
- Analizar audio (en lugar de imágenes).
La máquina fue enviada de Cornell al Smithsonian en 1967, en virtud de una transferencia gubernamental administrada por la Oficina de Investigación Naval. [ 10 ]
Perceptrones (1969)
Aunque el perceptrón parecía prometedor en un principio, pronto se demostró que no podía entrenarse para reconocer muchas clases de patrones. Esto provocó un estancamiento en el campo de la investigación de redes neuronales durante muchos años, hasta que se reconoció que una red neuronal de alimentación directa con dos o más capas (también llamada perceptrón multicapa ) tenía mayor capacidad de procesamiento que los perceptrones de una sola capa (también llamados perceptrones monocapa ).
Los perceptrones de una sola capa solo son capaces de aprender patrones linealmente separables . [ 24 ] Para una tarea de clasificación con una función de activación escalonada, un solo nodo tendrá una sola línea que divide los puntos de datos que forman los patrones. Más nodos pueden crear más líneas divisorias, pero estas deben combinarse de alguna manera para formar clasificaciones más complejas. Una segunda capa de perceptrones, o incluso nodos lineales, son suficientes para resolver muchos problemas que de otro modo no serían separables.
En 1969, un famoso libro titulado Perceptrones, de Marvin Minsky y Seymour Papert, demostró que era imposible para estas clases de redes aprender una función XOR . A menudo se cree erróneamente que también conjeturaron que un resultado similar se cumpliría para una red de perceptrones multicapa. Sin embargo, esto no es cierto, ya que tanto Minsky como Papert ya sabían que los perceptrones multicapa eran capaces de producir una función XOR. (Véase la página sobre Perceptrones (libro) para más información). No obstante, el texto de Minsky y Papert, a menudo citado erróneamente, provocó una disminución significativa del interés y la financiación de la investigación en redes neuronales. Tuvieron que pasar diez años más hasta que la investigación en redes neuronales experimentó un resurgimiento en la década de 1980. [ 24 ] Este texto se reimprimió en 1987 como "Perceptrones - Edición ampliada", donde se muestran y corrigen algunos errores del texto original.
Trabajos posteriores
Rosenblatt continuó trabajando en perceptrones a pesar de la disminución de la financiación. El último intento fue Tobermory, construido entre 1961 y 1967, diseñado para el reconocimiento de voz. [ 25 ] Ocupaba una habitación entera. [ 26 ] Tenía 4 capas con 12 000 pesos implementados mediante núcleos magnéticos toroidales . Para cuando se completó, la simulación en computadoras digitales se había vuelto más rápida que las máquinas de perceptrones diseñadas específicamente para ello. [ 27 ] Murió en un accidente de barco en 1971.
Se escribió un programa de simulación para redes neuronales para IBM 7090/7094 , y se utilizó para estudiar diversas aplicaciones de reconocimiento de patrones, como el reconocimiento de caracteres , las trayectorias de partículas en fotografías de cámaras de burbujas ; el reconocimiento de fonemas, palabras aisladas y habla continua ; la verificación del hablante ; y los mecanismos de centro de atención para el procesamiento de imágenes . [ 28 ] [ 29 ]

El algoritmo perceptrón kernel fue introducido en 1964 por Aizerman et al. [ 30 ] Freund y Schapire (1998) [ 1 ] dieron garantías de límites de margen para el algoritmo perceptrón en el caso general no separable, y más recientemente Mohri y Rostamizadeh (2013) extendieron resultados anteriores y dieron nuevos límites L1 más favorables. [ 31 ] [ 32 ]
El perceptrón es un modelo simplificado de una neurona biológica . Si bien la complejidad de los modelos de neuronas biológicas suele ser necesaria para comprender completamente el comportamiento neuronal, las investigaciones sugieren que un modelo lineal similar al perceptrón puede reproducir algunos comportamientos observados en neuronas reales. [ 33 ]
En [ 34 ] se estudian los espacios de soluciones de los límites de decisión para todas las funciones binarias y los comportamientos de aprendizaje.
Definición

En el sentido moderno, el perceptrón es un algoritmo para aprender un clasificador binario llamado función umbral : una función que mapea su entrada(un vector de valores reales ) a un valor de salida(un único valor binario ):
dóndees la función escalón de Heaviside (donde una entrada dela salida es 1; de lo contrario, la salida es 0 ),es un vector de pesos de valor real,es el producto escalardonde m es el número de entradas al perceptrón y b es el sesgo . El sesgo desplaza el límite de decisión alejándolo del origen y no depende de ningún valor de entrada.
De forma equivalente, dado que, podemos agregar el término de sesgocomo otro pesoy agregar una coordenadaa cada entraday luego escribirlo como un clasificador lineal que pasa por el origen:
El valor binario de(0 o 1) se utiliza para realizar una clasificación binaria encomo un caso positivo o negativo. Espacialmente, el sesgo desplaza la posición (aunque no la orientación) del límite de decisión planar .
En el contexto de las redes neuronales, un perceptrón es una neurona artificial que utiliza la función escalón de Heaviside como función de activación. El algoritmo del perceptrón también se denomina perceptrón de una sola capa , para distinguirlo de un perceptrón multicapa , que es un nombre inapropiado para una red neuronal más compleja. Como clasificador lineal, el perceptrón de una sola capa es la red neuronal de propagación directa más simple .
Poder de representación
teoría de la información
Desde el punto de vista de la teoría de la información , un perceptrón simple con K entradas tiene una capacidad de 2K bits de información. [ 35 ] Este resultado se debe a Thomas Cover . [ 36 ]
Específicamente dejarSea el número de maneras de separar linealmente N puntos en K dimensiones, entoncesCuando K es grande,está muy cerca de uno cuando, pero muy cerca de cero cuandoEn otras palabras, una unidad de perceptrón puede memorizar casi con certeza una asignación aleatoria de etiquetas binarias en N puntos cuandopero casi con toda seguridad no cuando.
Función booleana
Cuando se opera solo con entradas binarias, un perceptrón se denomina función booleana linealmente separable o función booleana de umbral. La secuencia de números de funciones booleanas de umbral en n entradas es OEIS A000609 . El valor solo se conoce con exactitud hastacaso, pero el orden de magnitud se conoce con bastante exactitud: tiene límite superiory límite inferior. [ 37 ]
Cualquier función de umbral lineal booleana puede implementarse solo con pesos enteros. Además, el número de bits necesarios y suficientes para representar un único parámetro de peso entero es. [ 37 ]
Teorema de aproximación universal
Un único perceptrón puede aprender a clasificar cualquier semiplano. No puede resolver vectores linealmente no separables, como el problema de la disyunción exclusiva booleana (el famoso "problema XOR").
Una red perceptrón con una capa oculta puede aprender a clasificar cualquier subconjunto compacto con una precisión arbitraria. De igual modo, también puede aproximar cualquier función continua con soporte compacto con una precisión arbitraria. Esto es, en esencia, un caso particular de los teoremas de George Cybenko y Kurt Hornik .
perceptrón local conjuntivo
Los perceptrones (Minsky y Papert, 1969) estudiaron el tipo de redes de perceptrones necesarias para aprender diversas funciones booleanas.
Consideremos una red perceptrón conunidades de entrada, una capa oculta y una salida, similar a la máquina Perceptrón Mark I. Calcula una función booleana de tipo. Llaman a una función conjuntivamente local de orden, si y solo si existe una red perceptrón tal que cada unidad en la capa oculta se conecta a como máximounidades de entrada.
Teorema. (Teorema 3.1.1): La función de paridad es conjuntivamente local de orden.
Teorema. (Sección 5.5): La función de conectividad es conjuntivamente local de orden.
Algoritmo de aprendizaje para un perceptrón de una sola capa

A continuación se muestra un ejemplo de algoritmo de aprendizaje para un perceptrón de una sola capa con una única unidad de salida. Para un perceptrón de una sola capa con múltiples unidades de salida, dado que los pesos de cada unidad son completamente independientes de los de las demás, se puede aplicar el mismo algoritmo a cada una de ellas.
Para perceptrones multicapa con capa oculta, se deben utilizar algoritmos más sofisticados, como la retropropagación . Si la función de activación o el proceso subyacente modelado por el perceptrón no es lineal , se pueden usar algoritmos de aprendizaje alternativos, como la regla delta, siempre que la función de activación sea diferenciable . No obstante, el algoritmo de aprendizaje descrito en los pasos siguientes suele funcionar, incluso para perceptrones multicapa con funciones de activación no lineales.
Cuando se combinan varios perceptrones en una red neuronal artificial, cada neurona de salida funciona independientemente de las demás; por lo tanto, el aprendizaje de cada salida puede considerarse de forma aislada.
Definiciones
Primero definimos algunas variables:
- es la tasa de aprendizaje del perceptrón. La tasa de aprendizaje es un número positivo que generalmente se elige menor que 1. Cuanto mayor sea el valor, mayor será la probabilidad de volatilidad en los cambios de peso.
- es el conjunto de entrenamiento demuestras, donde:
- es elvector de entrada delespacio euclidiano de -dimensiones.
- es el valor de salida deseado del perceptrón para esa entrada.
Mostramos los valores de las características de la siguiente manera:
- es el valor de lala característica delvector de entrada de entrenamiento th .
- .
Para representar los pesos:
- es elel valor en el vector de peso , que se multiplicará por el valor della función de entrada.
- Porque, eles efectivamente un sesgo que usamos en lugar de la constante de sesgo..
Para mostrar la dependencia temporal de, nosotros usamos:
- es el pesoen ese momento.
Pasos
- Inicializa los pesos. Los pesos pueden inicializarse a 0 o a un pequeño valor aleatorio. En el ejemplo siguiente, usamos 0. Configura el contador de tiempo.a 0.
- Para cada ejemplo j en nuestro conjunto de entrenamiento D , realice los siguientes pasos sobre la entraday el resultado deseado:
- Calcula la salida con el vector de pesos actual.:
- Actualizar los pesos:
- , para todas las funciones,es la tasa de aprendizaje .
- Incrementar el contador de tiempo:
- Calcula la salida con el vector de pesos actual.:
Para el aprendizaje fuera de línea , el segundo paso puede repetirse hasta que se produzca el error de iteración.es menor que un umbral de error especificado por el usuario, o se ha completado un número predeterminado de iteraciones, donde s es nuevamente el tamaño del conjunto de muestras.
El algoritmo actualiza los pesos después de cada muestra de entrenamiento en el paso 2b, aunque se puede observar que los pesos permanecen sin cambios siempre que.
Convergencia de un perceptrón en un conjunto de datos linealmente separable.

Un perceptrón simple es un clasificador lineal . Solo puede alcanzar un estado estable si todos los vectores de entrada se clasifican correctamente. Si el conjunto de entrenamiento D no es linealmente separable , es decir, si los ejemplos positivos no se pueden separar de los negativos mediante un hiperplano, el algoritmo no convergerá, ya que no existe solución. Por lo tanto, si se desconoce de antemano la linealidad separable del conjunto de entrenamiento, se debe utilizar una de las variantes de entrenamiento que se describen a continuación. El análisis detallado y las extensiones del teorema de convergencia se encuentran en el Capítulo 11 de Perceptrones (1969).
La separabilidad lineal se puede comprobar en el tiempo., dóndees el número de puntos de datos, yes la dimensión de cada punto. [ 38 ]
Si el conjunto de entrenamiento es linealmente separable, entonces se garantiza que el perceptrón convergerá después de cometer una cantidad finita de errores. [ 39 ] El teorema fue demostrado por Rosenblatt et al.
Teorema de convergencia del perceptrón : dado un conjunto de datos, de tal manera quey es linealmente separable por algún vector unitario., con margen: :=\min _{(x,y)\in D}y(w^{*}\cdot x)}
Entonces el algoritmo de aprendizaje del perceptrón 0-1 converge después de realizar como máximoerrores, para cualquier tasa de aprendizaje y cualquier método de muestreo del conjunto de datos.
La siguiente demostración sencilla se debe a Novikoff (1962). La idea de la demostración es que el vector de pesos siempre se ajusta en una cantidad acotada en una dirección con la que tiene un producto escalar negativo , y por lo tanto puede acotarse superiormente por O ( √t ) , donde t es el número de cambios en el vector de pesos. Sin embargo, también puede acotarse inferiormente por O ( t ) , ya que si existe un vector de pesos satisfactorio (desconocido), entonces cada cambio produce un progreso en esta dirección (desconocida) en una cantidad positiva que depende únicamente del vector de entrada.
Supongamos que en el paso, el perceptrón con pesocomete un error en el punto de datos, luego se actualiza a.
Si, el argumento es simétrico, así que lo omitimos.
WLOG ,, entonces,, y.
Por hipótesis, tenemos separación con márgenes:De este modo,
Tambiény puesto que el perceptrón cometió un error,, y entonces
Desde que comenzamos con, después de hacererrores,pero también
Combinando ambos, tenemos

Si bien el algoritmo del perceptrón garantiza la convergencia en alguna solución en el caso de un conjunto de entrenamiento linealmente separable, aún puede elegir cualquier solución y los problemas pueden admitir muchas soluciones de calidad variable. [ 40 ] El perceptrón de estabilidad óptima , hoy más conocido como máquina de vectores de soporte lineal , fue diseñado para resolver este problema (Krauth y Mezard , 1987). [ 41 ]
Teorema del ciclo del perceptrón
Cuando el conjunto de datos no es linealmente separable, entonces no hay manera de que un solo perceptrón converja. Sin embargo, todavía tenemos [ 42 ]
Teorema del ciclo del perceptrón : si el conjunto de datostiene solo un número finito de puntos, entonces existe un número límite superior, de tal manera que para cualquier vector de peso inicialvector de peso completotiene norma limitada por
Esto lo demuestra primero Bradley Efron . [ 43 ]
Aprender una función booleana
Consideremos un conjunto de datos donde elson de, es decir, los vértices de un hipercubo n-dimensional centrado en el origen, y. Es decir, todos los puntos de datos con positivotenery viceversa. Según el teorema de convergencia del perceptrón, un perceptrón convergería después de realizar como máximoerrores.
Si escribiéramos un programa lógico para realizar la misma tarea, cada ejemplo positivo muestra que una de las coordenadas es la correcta, y cada ejemplo negativo muestra que su complemento es un ejemplo positivo. Al recopilar todos los ejemplos positivos conocidos, finalmente eliminamos todas las coordenadas excepto una, momento en el que se aprende el conjunto de datos. [ 44 ]
Esta cota es asintóticamente ajustada en términos del peor caso. En el peor caso, el primer ejemplo presentado es completamente nuevo y dabits de información, pero cada ejemplo subsiguiente diferiría mínimamente de los ejemplos anteriores, y da 1 bit cada uno. Despuésejemplos, haybits de información, lo cual es suficiente para el perceptrón (confragmentos de información). [ 35 ]
Sin embargo, no es ajustado en términos de expectativa si los ejemplos se presentan uniformemente al azar, ya que el primero daríabits, el segundobits, y así sucesivamente, tomandoejemplos en total. [ 44 ]
Variantes
El algoritmo de bolsillo con trinquete (Gallant, 1990) resuelve el problema de estabilidad del aprendizaje del perceptrón al conservar la mejor solución encontrada hasta el momento. Este algoritmo devuelve la solución almacenada en el bolsillo, en lugar de la última solución. También puede utilizarse con conjuntos de datos no separables, donde el objetivo es encontrar un perceptrón con un número reducido de errores de clasificación. Sin embargo, estas soluciones aparecen de forma puramente estocástica, por lo que el algoritmo de bolsillo no las alcanza gradualmente durante el aprendizaje ni garantiza su aparición en un número determinado de pasos de aprendizaje.
El algoritmo Maxover (Wendemuth, 1995) es "robusto" en el sentido de que convergerá independientemente del conocimiento (previo) de la separabilidad lineal del conjunto de datos. [ 45 ] En el caso de separabilidad lineal, resolverá el problema de entrenamiento, si se desea, incluso con estabilidad óptima ( máximo margen entre las clases). Para conjuntos de datos no separables, devolverá una solución con un número pequeño y computable de clasificaciones erróneas. [ 46 ] En todos los casos, el algoritmo se aproxima gradualmente a la solución durante el aprendizaje, sin memorizar estados anteriores y sin saltos estocásticos. La convergencia es a la optimalidad global para conjuntos de datos separables y a la optimalidad local para conjuntos de datos no separables.
El perceptrón ponderado (Freund y Schapire, 1999) es una variante que utiliza múltiples perceptrones ponderados. El algoritmo inicia un nuevo perceptrón cada vez que un ejemplo se clasifica erróneamente, inicializando el vector de pesos con los pesos finales del perceptrón anterior. A cada perceptrón se le asigna además un peso adicional que corresponde a la cantidad de ejemplos que clasifica correctamente antes de clasificar erróneamente uno, y al final, el resultado es un voto ponderado sobre todos los perceptrones.
En problemas separables, el entrenamiento del perceptrón también puede apuntar a encontrar el margen de separación más grande entre las clases. El llamado perceptrón de estabilidad óptima puede determinarse mediante esquemas iterativos de entrenamiento y optimización, como el algoritmo Min-Over (Krauth y Mezard, 1987) [ 41 ] o el AdaTron (Anlauf y Biehl, 1989) [ 47 ] . AdaTron utiliza el hecho de que el problema de optimización cuadrática correspondiente es convexo. El perceptrón de estabilidad óptima, junto con el truco del kernel , son los fundamentos conceptuales de la máquina de vectores de soporte .
ElEl perceptrón empleó además una capa de preprocesamiento con pesos aleatorios fijos y unidades de salida umbralizadas. Esto le permitió clasificar patrones analógicos , proyectándolos en un espacio binario . De hecho, para un espacio de proyección de dimensión suficientemente alta, los patrones pueden volverse linealmente separables.
Otra forma de resolver problemas no lineales sin usar múltiples capas es mediante redes de orden superior (unidad sigma-pi). En este tipo de red, cada elemento del vector de entrada se amplía con cada combinación por pares de entradas multiplicadas (de segundo orden). Esto puede extenderse a una red de orden n .
Una generalización del modelo perceptrón es el Receptrón , que incorpora interacciones no lineales entre las entradas. Un único Receptrón es capaz de clasificar funciones booleanas no lineales.
Sin embargo, conviene tener en cuenta que el mejor clasificador no es necesariamente aquel que clasifica perfectamente todos los datos de entrenamiento. De hecho, si tuviéramos la restricción previa de que los datos provienen de distribuciones gaussianas equivariantes, la separación lineal en el espacio de entrada es óptima y la solución no lineal está sobreajustada .
Otros algoritmos de clasificación lineal incluyen Winnow , máquina de vectores de soporte y regresión logística .
perceptrón multiclase
Al igual que la mayoría de las demás técnicas para entrenar clasificadores lineales, el perceptrón se generaliza naturalmente a la clasificación multiclase . Aquí, la entraday la salidase extraen de conjuntos arbitrarios. Una función de representación de característicasasigna cada posible par de entrada/salida a un vector de características de valor real de dimensión finita. Como antes, el vector de características se multiplica por un vector de pesos., pero ahora la puntuación resultante se utiliza para elegir entre muchas posibles salidas:
El aprendizaje itera nuevamente sobre los ejemplos, prediciendo una salida para cada uno, dejando los pesos sin cambios cuando la salida predicha coincide con el objetivo y modificándolos cuando no coincide. La actualización queda así:
Esta formulación de retroalimentación multiclase se reduce al perceptrón original cuandoes un vector de valores reales,se elige de, y.
Para ciertos problemas, se pueden elegir representaciones y características de entrada/salida de manera quese puede encontrar de manera eficiente aunquese elige de un conjunto muy grande o incluso infinito.
Desde 2002, el entrenamiento de perceptrones se ha popularizado en el campo del procesamiento del lenguaje natural para tareas como el etiquetado de partes del discurso y el análisis sintáctico (Collins, 2002). También se ha aplicado a problemas de aprendizaje automático a gran escala en un entorno de computación distribuida . [ 48 ]
Referencias
- 1 2 Freund, Y. ; Schapire, RE (1999). "Clasificación de margen amplio utilizando el algoritmo perceptrón" (PDF) . Machine Learning . 37 (3): 277– 296. doi : 10.1023/A:1007662407062 . S2CID 5885617 .
- 1 2 Bishop, Christopher M. (2006). Reconocimiento de patrones y aprendizaje automático . Springer. ISBN 0-387-31073-8.
- ↑ Hecht-Nielsen, Robert (1991). Neurocomputing (Reimpresión con correcciones ). Reading (Massachusetts), Menlo Park (California), Nueva York [etc.]: Addison-Wesley. pág. 6, pie de figura 1.3. ISBN 978-0-201-09355-1.
- ↑ Block, HD (1962-01-01). "El perceptrón: un modelo para el funcionamiento del cerebro. I" . Reviews of Modern Physics . 34 (1): 123– 135. Bibcode : 1962RvMP...34..123B . doi : 10.1103/RevModPhys.34.123 . ISSN 0034-6861 .
- ↑ McCulloch, W; Pitts, W (1943). "Un cálculo lógico de ideas inmanentes en la actividad nerviosa" . Boletín de biofísica matemática . 5 (4): 115– 133. doi : 10.1007/BF02478259 .
- 1 2 Rosenblatt, Frank (1957). "El perceptrón: un autómata que percibe y reconoce" (PDF) . Informe 85-460-1 . Laboratorio Aeronáutico de Cornell.
- ↑ Rosenblatt, Frank (marzo de 1960). "Experimentos de simulación de perceptrón". Actas del IRE . 48 (3): 301– 309. doi : 10.1109/JRPROC.1960.287598 . ISSN 0096-8390 .
- 1 2 Jensen, GO; Dunning, DE (2026). "Ensamblaje y entrenamiento del perceptrón: un relato personal". IEEE Annals of the History of Computing . 48 (2): 62– 65. doi : 10.1109/MAHC.2026.3686038 .
- 1 2 Nilsson, Nils J. (2009). "4.2.1. Perceptrones". La búsqueda de la inteligencia artificial . Cambridge: Cambridge University Press. ISBN 978-0-521-11639-8.
- 1 2 O'Connor, Jack (2022-06-21). "Algoritmo encubierto: un capítulo secreto en la historia temprana de la inteligencia artificial y las imágenes satelitales" . Revista internacional de inteligencia y contrainteligencia : 1–15 . doi : 10.1080/08850607.2022.2073542 . ISSN 0885-0607 . S2CID 249946000 .
- ↑ Rosenblatt, F. (1958). "El perceptrón: un modelo probabilístico para el almacenamiento y la organización de la información en el cerebro" . Psychological Review . 65 (6): 386– 408. doi : 10.1037/h0042519 . ISSN 1939-1471 . PMID 13602029 .
- ↑ Frank Rosenblatt, ' Dos teoremas de separabilidad estadística en el perceptrón ', Simposio sobre la mecanización del pensamiento, Laboratorio Nacional de Física, Teddington, Reino Unido, noviembre de 1958, vol. 1, HM Stationery Office, Londres, 1959.
- ↑ Rosenblatt, Frank y CORNELL UNIV ITHACA NY. Programa de Investigación de Sistemas Cognitivos . Informe técnico, Universidad de Cornell, 72, 1971.
- ↑ Muerle, John Ludwig y CORNELL AERONAUTICAL LAB INC., Buffalo, NY. Proyecto Para, Autómatas de percepción y reconocimiento . Cornell Aeronautical Laboratory, Incorporated, 1963.
- ↑ Penn, Jonathan (11 de enero de 2021). Inventando la inteligencia: Sobre la historia del procesamiento de información compleja y la inteligencia artificial en los Estados Unidos a mediados del siglo XX (Tesis). [object Object]. doi : 10.17863/cam.63087 .
- ↑ Guice, Jon (1998). "Controversia y el Estado: Lord ARPA y la computación inteligente" . Estudios sociales de la ciencia . 28 (1): 103– 138. doi : 10.1177/030631298028001004 . ISSN 0306-3127 . JSTOR 285752. PMID 11619937 .
- 1 2 3 Hay, John Cameron (1960). Manual de operación del perceptrón Mark I (Proyecto PARA) / (PDF) . Buffalo: Laboratorio Aeronáutico de Cornell. Archivado del original (PDF) el 27 de octubre de 2023.
- ↑ "Perceptrón, Mark I" . Museo Nacional de Historia Americana . Consultado el 30 de octubre de 2023 .
- ↑ Anderson, James A.; Rosenfeld, Edward, eds. (2000). Talking Nets: An Oral History of Neural Networks . The MIT Press. doi : 10.7551/mitpress/6626.003.0004 . ISBN 978-0-262-26715-1.
- ↑ Olazaran, Mikel (1996). "Un estudio sociológico de la historia oficial de la controversia de los perceptrones". Estudios sociales de la ciencia . 26 (3): 611– 659. doi : 10.1177/030631296026003005 . JSTOR 285702. S2CID 16786738 .
- ↑ "Conceptos de percepción para la fotointerpretación" . www.cia.gov . Consultado el 14 de noviembre de 2024 .
- ↑ Irwin, Julia A. (11 de septiembre de 2024). "Mundos artificiales y objetos perceptrónicos: el reconocimiento automático de objetivos de la CIA a mediados de siglo" . Grey Room (97): 6–35 . doi : 10.1162/grey_a_00415 . ISSN 1526-3819 .
- ↑ Principios de neurodinámica: Perceptrones y la teoría de los mecanismos cerebrales , por Frank Rosenblatt, Informe número VG-1196-G-8, Laboratorio Aeronáutico de Cornell, publicado el 15 de marzo de 1961. El trabajo que se presenta en este volumen se ha llevado a cabo bajo el Contrato Nonr-2381 (00) (Proyecto PARA) en CAL y el Contrato Nonr-401(40) en la Universidad de Cornell.
- 1 2 Sejnowski, Terrence J. (2018). La revolución del aprendizaje profundo . MIT Press. pág. 47. ISBN 978-0-262-03803-4.
- ↑ Rosenblatt, Frank (1962). “ Una descripción del perceptrón de Tobermory ”. Programa de Investigación Cognitiva. Informe n.° 4. Documentos técnicos recopilados, vol. 2. Editado por Frank Rosenblatt. Ithaca, NY: Universidad de Cornell.
- 1 2 Nagy, George. 1963. Diseños de sistemas y circuitos para el perceptrón de Tobermory . Informe técnico número 5, Programa de Investigación de Sistemas Cognitivos, Universidad de Cornell, Ithaca, Nueva York.
- ↑ Nagy, George. "Redes neuronales: antes y ahora". IEEE Transactions on Neural Networks 2.2 (1991): 316-318.
- ↑ Barker, Trevor H. (14 de julio de 1966). Un programa informático para la simulación de perceptrones y redes neuronales similares: manual del usuario (informe técnico). NONR 401 (40) y NSF GK-250. Ithaca, NY: Universidad de Cornell (publicado en 1966).
- ↑ Nagy, George (marzo de 1991). "Redes neuronales: antes y ahora" (PDF) . IEEE Transactions on Neural Networks . 2 (2): 316– 318. doi : 10.1109/72.80343 . ISSN 1941-0093 . PMID 18276386 .
- ↑ Aizerman, MA; Braverman, EM; Rozonoer, LI (1964). "Fundamentos teóricos del método de la función potencial en el aprendizaje del reconocimiento de patrones". Automatización y control remoto . 25 : 821–837 .
- ↑ Mohri, Mehryar; Rostamizadeh, Afshin (2013). "Límites de error del perceptrón". arXiv : 1305.0208 [ cs.LG ].
- ↑Fundamentos del aprendizaje automático, MIT Press (Capítulo 8).
- ↑ Cash, Sydney; Yuste, Rafael (1999). "Suma lineal de entradas excitatorias por neuronas piramidales CA1" . Neuron . 22 (2): 383–394 . doi : 10.1016/S0896-6273(00)81098-3 . PMID 10069343 .
- ^ Liou, DR; Liou, J.-W.; Liou, C.-Y. (2013). Comportamientos de aprendizaje del perceptrón . Prensa iConcept. ISBN 978-1-477554-73-9.
- 1 2 MacKay, David (25 de septiembre de 2003). Teoría de la información, inferencia y algoritmos de aprendizaje . Cambridge University Press . pág. 483. ISBN 9780521642989.
- ↑ Cover, Thomas M. (junio de 1965). "Propiedades geométricas y estadísticas de sistemas de desigualdades lineales con aplicaciones en el reconocimiento de patrones". IEEE Transactions on Electronic Computers . EC-14 (3): 326–334 . doi : 10.1109/PGEC.1965.264137 . ISSN 0367-7508 .
- 1 2 Šíma, Jiří; Orponen, Pekka (2003-12-01). "General-Purpose Computation with Neural Networks: A Survey of Complexity Theoretic Results" . Neural Computation . 15 (12): 2727– 2778. doi : 10.1162/089976603322518731 . ISSN 0899-7667 . PMID 14629867 .
- ↑ "Introducción al aprendizaje automático, capítulo 3: perceptrón" . openlearninglibrary.mit.edu . Consultado el 27 de octubre de 2023 .
- ↑ Novikoff, Albert J. (1963). "Sobre las pruebas de convergencia para perceptrones". Oficina de Investigación Naval .
- ↑ Bishop, Christopher M (17 de agosto de 2006). «Capítulo 4. Modelos lineales para la clasificación». Reconocimiento de patrones y aprendizaje automático . Springer Science+Business Media, LLC. pág. 194. ISBN 978-0387-31073-2.
- 1 2 Krauth, W.; Mezard, M. (1987). "Aprendizaje de algoritmos con estabilidad óptima en redes neuronales". Journal of Physics A: Mathematical and General . 20 (11): L745– L752. Bibcode : 1987JPhA...20L.745K . doi : 10.1088/0305-4470/20/11/013 .
- ↑ Block, HD; Levin, SA (1970). "Sobre la acotación de un procedimiento iterativo para resolver un sistema de desigualdades lineales" . Actas de la Sociedad Matemática Americana . 26 (2): 229– 235. doi : 10.1090/S0002-9939-1970-0265383-5 . ISSN 0002-9939 .
- ↑ Efron, Bradley. "El procedimiento de corrección del perceptrón en situaciones no separables." Rome Air Dev. Center Tech. Doc. Rept (1964).
- 1 2 Simon, Herbert A.; Laird, John E. (13 de agosto de 2019). «Límites en la velocidad de adquisición de conceptos». The Sciences of the Artificial, reedición de la tercera edición con una nueva introducción de John Laird ( ed. de reedición). Cambridge, Massachusetts. Londres, Inglaterra: The MIT Press. ISBN 978-0-262-53753-7.
- ↑ Wendemuth, A. (1995). "Aprender lo inaprendible". Journal of Physics A: Mathematical and General . 28 (18): 5423– 5436. Bibcode : 1995JPhA...28.5423W . doi : 10.1088/0305-4470/28/18/030 .
- ↑ Wendemuth, A. (1995). "Rendimiento de algoritmos de entrenamiento robustos para redes neuronales". Journal of Physics A: Mathematical and General . 28 (19): 5485– 5493. Bibcode : 1995JPhA...28.5485W . doi : 10.1088/0305-4470/28/19/006 .
- ↑ Anlauf, JK; Biehl, M. (1989). "The AdaTron: an Adaptive Perceptron algorithm". Europhysics Letters . 10 (7): 687– 692. Bibcode : 1989EL.....10..687A . doi : 10.1209/0295-5075/10/7/014 . S2CID 250773895 .
- ↑ McDonald, R.; Hall, K.; Mann, G. (2010). "Estrategias de entrenamiento distribuido para el perceptrón estructurado" (PDF) . Tecnologías del lenguaje humano: Conferencia anual de 2010 del capítulo norteamericano de la ACL . Asociación de Lingüística Computacional. págs. 456–464 .
Lecturas adicionales
- Aizerman, MA y Braverman, EM y Lev I. Rozonoer. Fundamentos teóricos del método de la función potencial en el aprendizaje del reconocimiento de patrones. Automation and Remote Control, 25:821–837, 1964.
- Rosenblatt, Frank (1958), El perceptrón: un modelo probabilístico para el almacenamiento y la organización de la información en el cerebro, Laboratorio Aeronáutico de Cornell, Psychological Review, v65, No. 6, pp. 386–408. doi : 10.1037/h0042519 .
- Rosenblatt, Frank (1962), Principios de neurodinámica. Washington, DC: Spartan Books.
- Minsky, ML y Papert, SA 1969. Perceptrones . Cambridge, MA: MIT Press.
- Gallant, SI (1990). Algoritmos de aprendizaje basados en perceptrones. IEEE Transactions on Neural Networks, vol. 1, no. 2, pp. 179–191.
- Olazaran Rodríguez, José Miguel. Una sociología histórica de la investigación sobre redes neuronales . Tesis doctoral. Universidad de Edimburgo, 1991.
- Mohri, Mehryar y Rostamizadeh, Afshin (2013). Límites de error del perceptrón arXiv:1305.0208, 2013.
- Novikoff, AB (1962). Sobre las pruebas de convergencia en perceptrones. Simposio sobre la teoría matemática de los autómatas, 12, 615–622. Instituto Politécnico de Brooklyn.
- Widrow, B. , Lehr, MA, " 30 años de redes neuronales adaptativas: perceptrón, Madaline y retropropagación ", Proc. IEEE , vol. 78, n.º 9, págs. 1415–1442, (1990).
- Collins, M. 2002. Métodos de entrenamiento discriminativo para modelos ocultos de Markov: Teoría y experimentos con el algoritmo del perceptrón en Actas de la Conferencia sobre Métodos Empíricos en Procesamiento del Lenguaje Natural (EMNLP '02).
- Yin, Hongfeng (1996), Algoritmos y análisis basados en perceptrones, Biblioteca Spectrum, Universidad Concordia, Canadá
Enlaces externos
- Un perceptrón implementado en MATLAB para aprender la función NAND binaria. Archivado el 6 de noviembre de 2012 en Wayback Machine.
- Capítulo 3 Redes ponderadas: el perceptrón y capítulo 4 Aprendizaje del perceptrón de redes neuronales: una introducción sistemática por Raúl Rojas ( ISBN) 978-3-540-60505-8)
- Historia de los perceptrones
- Matemáticas de los perceptrones multicapa
- Aplicación de un modelo de perceptrón usando scikit-learn - https://scikit-learn.org/stable/modules/generated/sklearn.linear_model.Perceptron.html
- Algoritmos de clasificación
- Redes neuronales artificiales