Articulo de referencia

Condicionamiento operante

El condicionamiento operante , también llamado condicionamiento instrumental , es un proceso de aprendizaje en el que las conductas voluntarias se modifican mediante la asociaci...

El condicionamiento operante , también llamado condicionamiento instrumental , es un proceso de aprendizaje en el que las conductas voluntarias se modifican mediante la asociación con la adición (o eliminación) de recompensas o estímulos aversivos. La frecuencia o duración de la conducta puede aumentar mediante el refuerzo o disminuir mediante el castigo o la extinción .

Orígenes

El condicionamiento operante se originó con Edward Thorndike , cuya ley del efecto postulaba que las conductas surgen como resultado de consecuencias satisfactorias o desagradables. En el siglo XX, el condicionamiento operante fue estudiado por psicólogos conductistas , quienes creían que gran parte de la mente y la conducta se explica mediante el condicionamiento ambiental. Los refuerzos son estímulos ambientales que incrementan las conductas, mientras que los castigos son estímulos que las disminuyen. Ambos tipos de estímulos pueden clasificarse a su vez en positivos y negativos, que implican, respectivamente, la adición o eliminación de estímulos ambientales.

El condicionamiento operante difiere del condicionamiento clásico tanto en su mecanismo como en sus resultados. Mientras que el condicionamiento clásico asocia estímulos para producir conductas involuntarias y reflejas (como salivar ante la comida), el condicionamiento operante moldea las conductas voluntarias a través de sus consecuencias. Las acciones seguidas de recompensas tienden a repetirse, mientras que aquellas seguidas de resultados negativos disminuyen.

El estudio del aprendizaje animal en el siglo XX estuvo dominado por el análisis de estos dos tipos de aprendizaje, [ 1 ] y siguen siendo fundamentales para el análisis del comportamiento. También se han aplicado al estudio de la psicología social , ayudando a esclarecer ciertos fenómenos como el efecto de falso consenso . [ 2 ]

Historia

Edward Lee Thorndike en 1912

Ley del efecto de Thorndike

El condicionamiento operante, a veces llamado aprendizaje instrumental , fue estudiado extensamente por primera vez por Edward L. Thorndike (1874-1949), quien observó el comportamiento de gatos que intentaban escapar de cajas rompecabezas caseras. [ 3 ] Un gato podía escapar de la caja con una respuesta simple, como tirar de una cuerda o empujar un palo, pero al principio, cuando se veían confinados, los gatos tardaban mucho en salir. Con los ensayos repetidos, las respuestas ineficaces ocurrían con menos frecuencia y las respuestas exitosas con más frecuencia, por lo que los gatos escapaban cada vez más rápido. [ 3 ] Thorndike generalizó este hallazgo en su ley del efecto , que establece que los comportamientos seguidos de consecuencias satisfactorias tienden a repetirse y aquellos que producen consecuencias desagradables tienen menos probabilidades de repetirse. En resumen, algunas consecuencias fortalecen el comportamiento y otras lo debilitan . Al graficar el tiempo de escape en función del número de ensayo, Thorndike produjo las primeras curvas de aprendizaje animal conocidas mediante este procedimiento. [ 4 ]

Los seres humanos parecen aprender muchos comportamientos simples mediante el tipo de proceso estudiado por Thorndike, ahora llamado condicionamiento operante. Es decir, las respuestas se retienen cuando conducen a un resultado exitoso y se descartan cuando no lo hacen o cuando producen efectos aversivos. Esto suele ocurrir sin la intervención de ningún "maestro", pero el condicionamiento operante ha sido utilizado por los padres para educar a sus hijos durante miles de años. [ 5 ]

BF Skinner

BF Skinner en el Departamento de Psicología de Harvard, c. 1950

BF Skinner (1904–1990) es considerado el padre del condicionamiento operante, y su obra se cita frecuentemente en relación con este tema. Su libro de 1938, "El comportamiento de los organismos: un análisis experimental" [ 6 ] , dio inicio a su estudio de por vida sobre el condicionamiento operante y su aplicación al comportamiento humano y animal. Siguiendo las ideas de Ernst Mach , Skinner rechazó la referencia de Thorndike a estados mentales no observables como la satisfacción, basando su análisis en el comportamiento observable y sus consecuencias igualmente observables. [ 7 ]

Skinner creía que el condicionamiento clásico era demasiado simplista para describir algo tan complejo como el comportamiento humano. En su opinión, el condicionamiento operante describía mejor el comportamiento humano, ya que examinaba las causas y los efectos de la conducta intencional.

Para implementar su enfoque empírico, Skinner inventó la cámara de condicionamiento operante , o " caja de Skinner ", en la que sujetos como palomas y ratas eran aislados y expuestos a estímulos cuidadosamente controlados. A diferencia de la caja rompecabezas de Thorndike, este dispositivo permitía al sujeto realizar una o dos respuestas simples y repetibles, y la frecuencia de dichas respuestas se convirtió en la principal medida conductual de Skinner. [ 8 ] Otro invento, el registrador acumulativo, producía un registro gráfico a partir del cual se podían estimar estas frecuencias de respuesta. Estos registros fueron los datos primarios que Skinner y sus colegas utilizaron para explorar los efectos de diversos programas de refuerzo en la frecuencia de respuesta. [ 9 ] Un programa de refuerzo puede definirse como "cualquier procedimiento que proporciona refuerzo a un organismo según alguna regla bien definida". [ 10 ] Los efectos de los programas se convirtieron, a su vez, en los hallazgos básicos a partir de los cuales Skinner desarrolló su explicación del condicionamiento operante. También se basó en muchas observaciones menos formales del comportamiento humano y animal. [ 11 ]

Muchos de los escritos de Skinner están dedicados a la aplicación del condicionamiento operante al comportamiento humano. [ 12 ] En 1948 publicó Walden Two , un relato ficticio de una comunidad pacífica, feliz y productiva organizada en torno a sus principios de condicionamiento. [ 13 ] En 1957, Skinner publicó Comportamiento verbal , [ 14 ] que extendió los principios del condicionamiento operante al lenguaje, una forma de comportamiento humano que previamente había sido analizada de manera muy diferente por lingüistas y otros. Skinner definió nuevas relaciones funcionales como "mandos" y "tactos" para capturar algunos elementos esenciales del lenguaje, pero no introdujo nuevos principios, tratando el comportamiento verbal como cualquier otro comportamiento controlado por sus consecuencias, que incluían las reacciones de la audiencia del hablante.

Conceptos y procedimientos

Orígenes del comportamiento operante: variabilidad operante

Se dice que la conducta operante es "emitida"; es decir, inicialmente no es provocada por ningún estímulo en particular. Por lo tanto, cabe preguntarse por qué ocurre en primer lugar. La respuesta a esta pregunta es similar a la respuesta de Darwin a la pregunta sobre el origen de una "nueva" estructura corporal: variación y selección. De manera similar, la conducta de un individuo varía de un momento a otro en aspectos como los movimientos específicos involucrados, la cantidad de fuerza aplicada o el momento de la respuesta. Las variaciones que conducen al refuerzo se fortalecen, y si el refuerzo es constante, la conducta tiende a permanecer estable. Sin embargo, la variabilidad conductual puede modificarse mediante la manipulación de ciertas variables. [ 15 ]

Modificación de la conducta operante: refuerzo y castigo

El refuerzo y el castigo son las herramientas fundamentales mediante las cuales se modifica la conducta operante. Estos términos se definen por su efecto en la conducta. "Positivo" y "negativo" se refieren a si se añadió o se eliminó un estímulo, respectivamente. De manera similar, "refuerzo" y "castigo" se refieren a la frecuencia futura de la conducta. El refuerzo describe una consecuencia que hace que una conducta ocurra con mayor frecuencia en el futuro, mientras que el castigo es una consecuencia que hace que una conducta ocurra con menor frecuencia. [ 16 ]

Hay un total de cuatro consecuencias:

  1. El refuerzo positivo se produce cuando una conducta (respuesta) conlleva la adición de un estímulo deseado y aumenta la frecuencia de dicha conducta en el futuro. [ 17 ] Ejemplo : si una rata en una caja de Skinner recibe comida al presionar una palanca, su frecuencia de presión aumentará. Presionar la palanca fue reforzado positivamente.
  2. El refuerzo negativo (también conocido como escape) se produce cuando una conducta (respuesta) va seguida de la eliminación de unestímulo aversivo , lo que aumenta la frecuencia de la conducta original. Ejemplo : Un niño le tiene miedo a los ruidos fuertes de un espectáculo de fuegos artificiales. Se pone unos auriculares y ya no puede oír los fuegos artificiales. La próxima vez que el niño ve fuegos artificiales, se pone los auriculares. El hecho de ponerse los auriculares fue reforzado negativamente.
  3. El castigo positivo (también conocido como "castigo por estimulación contingente") se produce cuando una conducta (respuesta) va seguida de un estímulo aversivo que reduce la probabilidad de que dicha conducta se repita en el futuro. Ejemplo: Un niño toca una estufa caliente y se quema la mano. La próxima vez que ve una estufa, no la toca. Tocar la estufa fue castigado positivamente.
  4. El castigo negativo (también llamado "castigo por retirada contingente") se produce cuando una conducta (respuesta) va seguida de la eliminación de un estímulo, lo que reduce la probabilidad de que dicha conducta se repita en el futuro. Ejemplo : Cuando un empleado guarda su almuerzo en un refrigerador común, este es robado antes del descanso. La próxima vez que el empleado lleve su almuerzo al trabajo, no lo guarda en el refrigerador. Guardar el almuerzo en el refrigerador fue castigado negativamente.
  • La extinción es una estrategia de consecuencia que ocurre cuando una conducta previamente reforzada deja de recibir refuerzo, ya sea positivo o negativo. Durante la extinción, la conducta se vuelve menos probable. El refuerzo ocasional puede provocar un retraso aún mayor antes de la extinción de la conducta, debido al factor de aprendizaje que implica que se requieren instancias repetidas para obtener refuerzo, en comparación con el refuerzo administrado en cada oportunidad antes de la extinción. [ 18 ]

Un estudio sugiere que la retroalimentación táctil, como las vibraciones hápticas de los dispositivos móviles, puede funcionar como reforzadores secundarios (es decir, recompensas aprendidas que adquieren valor de refuerzo a través de la asociación), fortaleciendo comportamientos del consumidor como las compras en línea. [ 19 ]

Programas de refuerzo

Los programas de reforzamiento son reglas que controlan la administración del reforzamiento. Estas reglas especifican el momento en que se debe proporcionar el reforzamiento, el número de respuestas que se deben realizar, o ambas cosas. Existen muchas reglas posibles, pero las siguientes son las más básicas y de uso común [ 20 ] [ 9 ].

  • Programa de intervalo fijo: El refuerzo se produce tras la primera respuesta, después de que haya transcurrido un tiempo fijo desde el refuerzo anterior. Este programa genera un patrón de respuesta de "pausa-carrera"; es decir, tras el entrenamiento con este programa, el organismo suele hacer una pausa después del refuerzo y luego comienza a responder rápidamente a medida que se acerca el momento del siguiente refuerzo.
  • Programa de intervalo variable: El refuerzo se produce tras la primera respuesta, después de que haya transcurrido un tiempo variable desde el refuerzo anterior. Este programa suele generar una tasa de respuesta relativamente constante que varía según el tiempo promedio entre refuerzos.
  • Programa de razón fija: El refuerzo se produce después de que se haya emitido un número fijo de respuestas desde el refuerzo anterior. Un organismo entrenado con este programa suele hacer una pausa tras un refuerzo y luego responde con una frecuencia elevada. Si el requisito de respuesta es bajo, puede que no haya pausa; si es alto, el organismo puede dejar de responder por completo.
  • Programa de razón variable: El refuerzo se produce después de que se haya emitido un número variable de respuestas desde el refuerzo anterior. Este programa suele generar una tasa de respuesta muy alta y constante.
  • Refuerzo continuo: El refuerzo se produce después de cada respuesta. Los organismos suelen responder tan rápido como les es posible, teniendo en cuenta el tiempo necesario para obtener y consumir el refuerzo, hasta que se sacian.

Factores que alteran la eficacia del refuerzo y el castigo

La eficacia del refuerzo y del castigo puede modificarse.

  1. Saciedad/Privación : La efectividad de un estímulo positivo o "apetitivo" se reduce si el individuo ha recibido suficiente de dicho estímulo para satisfacer su apetito. El efecto contrario ocurre si el individuo se ve privado de ese estímulo: la efectividad de la consecuencia aumenta. Un sujeto con el estómago lleno no se siente tan motivado como uno hambriento. [ 21 ]
  2. Inmediatez : Una consecuencia inmediata es más efectiva que una tardía. Si se le da una golosina a un perro por sentarse en cinco segundos, aprenderá más rápido que si se le da después de treinta segundos. [ 22 ]
  3. Contingencia : Para ser más eficaz, el refuerzo debe producirse de forma constante después de las respuestas y no en otros momentos. El aprendizaje puede ser más lento si el refuerzo es intermitente, es decir, si solo se produce tras algunas instancias de la misma respuesta. Las respuestas reforzadas intermitentemente suelen tardar más en extinguirse que las que siempre se han reforzado. [ 21 ]
  4. Tamaño : El tamaño, o cantidad, de un estímulo suele afectar su potencia como reforzador. Tanto humanos como animales realizan análisis de costo-beneficio. Si al presionar una palanca se obtienen diez bolitas de comida, es posible que el aprendizaje de esta acción sea más rápido que si solo se obtiene una. Un montón de monedas de veinticinco centavos de una máquina tragamonedas puede mantener al jugador presionando la palanca durante más tiempo que una sola moneda.

La mayoría de estos factores cumplen funciones biológicas. Por ejemplo, el proceso de saciedad ayuda al organismo a mantener un ambiente interno estable ( homeostasis ). Cuando un organismo ha estado privado de azúcar, por ejemplo, el sabor del azúcar actúa como un reforzador eficaz. Cuando el nivel de azúcar en sangre del organismo alcanza o supera un nivel óptimo, el sabor del azúcar se vuelve menos efectivo o incluso aversivo.

Organización

El moldeamiento es un método de condicionamiento que se utiliza frecuentemente en el adiestramiento animal y en la enseñanza a personas no verbales. Se basa en la variabilidad operante y el reforzamiento, como se describió anteriormente. El adiestrador comienza identificando la conducta final deseada (o "objetivo"). A continuación, elige una conducta que el animal o la persona ya manifiesta con cierta probabilidad. La forma de esta conducta se modifica gradualmente a lo largo de ensayos sucesivos, reforzando conductas que se aproximan cada vez más a la conducta objetivo. Cuando finalmente se manifiesta la conducta objetivo, esta puede reforzarse y mantenerse mediante un programa de reforzamiento.

Refuerzo no contingente

El reforzamiento no contingente consiste en la administración de estímulos reforzantes independientemente del comportamiento del organismo. Este tipo de reforzamiento puede utilizarse para intentar reducir un comportamiento objetivo no deseado, reforzando múltiples respuestas alternativas mientras se extingue la respuesta objetivo. [ 23 ] Dado que no se identifica ningún comportamiento medido que se fortalezca, existe controversia en torno al uso del término "reforzamiento" no contingente. [ 24 ]

Control de estímulos del comportamiento operante

Aunque inicialmente la conducta operante se emite sin una referencia identificada a un estímulo particular, durante el condicionamiento operante las conductas operantes quedan bajo el control de estímulos que están presentes cuando la conducta es reforzada. Dichos estímulos se denominan "estímulos discriminativos". El resultado es una llamada " contingencia de tres términos ". Es decir, los estímulos discriminativos establecen la ocasión para las respuestas que producen recompensa o castigo. Ejemplo: una rata puede ser entrenada para presionar una palanca solo cuando se enciende una luz; un perro corre a la cocina cuando oye el ruido de su bolsa de comida; un niño extiende la mano para alcanzar un caramelo cuando lo ve en una mesa.

Discriminación, generalización y contexto

La mayor parte del comportamiento está bajo el control de estímulos. Se pueden distinguir varios aspectos de esto:

  • La discriminación suele producirse cuando una respuesta se refuerza únicamente en presencia de un estímulo específico. Por ejemplo, una paloma podría ser alimentada por picotear una luz roja y no una verde; en consecuencia, picotea la roja y deja de picotear la verde. Se han estudiado numerosas combinaciones complejas de estímulos y otras condiciones; por ejemplo, un organismo podría ser reforzado mediante un programa de intervalo en presencia de un estímulo y mediante un programa de razón en presencia de otro.
  • La generalización es la tendencia a responder a estímulos similares a un estímulo discriminativo previamente entrenado. Por ejemplo, una paloma que ha sido entrenada para picotear el color "rojo" también podría picotear el color "rosa", aunque generalmente con menos fuerza.
  • El contexto se refiere a los estímulos que están presentes de forma continua en una situación, como las paredes, mesas, sillas, etc., de una habitación, o el interior de una cámara de condicionamiento operante. Los estímulos contextuales pueden llegar a controlar la conducta, al igual que los estímulos discriminativos, aunque generalmente con menor intensidad. Las conductas aprendidas en un contexto pueden estar ausentes o alteradas en otro. Esto puede dificultar la terapia conductual, ya que las conductas aprendidas en el entorno terapéutico pueden no manifestarse en otras situaciones.

Secuencias conductuales: reforzamiento condicionado y encadenamiento

La mayoría de los comportamientos no pueden describirse fácilmente en términos de respuestas individuales reforzadas una a una. El alcance del análisis operante se amplía mediante la idea de cadenas conductuales, que son secuencias de respuestas unidas por las contingencias de tres términos definidas anteriormente. El encadenamiento se basa en el hecho, demostrado experimentalmente, de que un estímulo discriminativo no solo crea la ocasión para el comportamiento subsiguiente, sino que también puede reforzar el comportamiento que lo precede. Es decir, un estímulo discriminativo es también un "reforzador condicionado". Por ejemplo, la luz que crea la ocasión para presionar la palanca puede usarse para reforzar "darse la vuelta" en presencia de un ruido. Esto da como resultado la secuencia "ruido - darse la vuelta - luz - presionar la palanca - comida". Se pueden construir cadenas mucho más largas añadiendo más estímulos y respuestas.

Escape y evitación

En el aprendizaje de escape, una conducta elimina un estímulo (aversivo). Por ejemplo, protegerse los ojos de la luz solar elimina la estimulación (aversiva) de la luz brillante. (Este es un ejemplo de refuerzo negativo, definido anteriormente). La conducta que se mantiene al prevenir un estímulo se denomina "evitación", como, por ejemplo, ponerse gafas de sol antes de salir al aire libre. La conducta de evitación plantea la llamada "paradoja de la evitación", pues cabe preguntarse: ¿cómo puede la ausencia de un estímulo funcionar como reforzador? Esta cuestión se aborda en varias teorías de la evitación (véase más adelante).

Se suelen utilizar dos tipos de configuraciones experimentales: el aprendizaje de evitación discriminativa y el aprendizaje de evitación operante libre.

Aprendizaje de evitación discriminada

Un experimento de evitación discriminativa consiste en una serie de ensayos en los que un estímulo neutro, como una luz, es seguido por un estímulo aversivo, como una descarga eléctrica. Tras la aparición del estímulo neutro, una respuesta operante, como presionar una palanca, previene o elimina el estímulo aversivo. En los primeros ensayos, el sujeto no responde hasta que aparece el estímulo aversivo; por ello, estos primeros ensayos se denominan ensayos de "escape". A medida que avanza el aprendizaje, el sujeto comienza a responder durante la presencia del estímulo neutro, impidiendo así la aparición del estímulo aversivo. Estos ensayos se denominan "ensayos de evitación". Se dice que este experimento implica condicionamiento clásico porque un EC (estímulo condicionado) neutro se asocia con un EI (estímulo incondicionado) aversivo; esta idea subyace a la teoría bifactorial del aprendizaje de evitación que se describe a continuación.

Aprendizaje de evitación de operante libre

En la evitación operante libre, un sujeto recibe periódicamente un estímulo aversivo (a menudo una descarga eléctrica) a menos que realice una respuesta operante; dicha respuesta retrasa la aparición de la descarga. En esta situación, a diferencia de la evitación discriminada, ningún estímulo previo señala la descarga. Dos intervalos de tiempo cruciales determinan la velocidad del aprendizaje de evitación. El primero es el intervalo SS (descarga-descarga). Este es el tiempo entre descargas sucesivas en ausencia de respuesta. El segundo intervalo es el intervalo RS (respuesta-descarga). Este especifica el tiempo por el cual una respuesta operante retrasa la aparición de la siguiente descarga. Cada vez que el sujeto realiza la respuesta operante, el intervalo RS sin descarga comienza de nuevo.

Teoría de dos procesos de la evitación

Esta teoría se propuso originalmente para explicar el aprendizaje de evitación discriminativa, en el que un organismo aprende a evitar un estímulo aversivo escapando de una señal que lo representa. En ella intervienen dos procesos: el condicionamiento clásico de la señal, seguido del condicionamiento operante de la respuesta de escape.

a) Condicionamiento clásico del miedo. Inicialmente, el organismo experimenta el emparejamiento de un EC con un EI aversivo. La teoría supone que este emparejamiento crea una asociación entre el EC y el EI a través del condicionamiento clásico y, debido a la naturaleza aversiva del EI, el EC llega a provocar una reacción emocional condicionada (REC): "miedo". b) Refuerzo de la respuesta operante por reducción del miedo. Como resultado del primer proceso, el EC ahora señala miedo; esta reacción emocional desagradable sirve para motivar las respuestas operantes, y las respuestas que terminan con el EC se refuerzan por la terminación del miedo. La teoría no dice que el organismo "evite" el EI en el sentido de anticiparlo, sino más bien que el organismo "escapa" de un estado interno aversivo causado por el EC. Varios hallazgos experimentales parecen contradecir la teoría de los dos factores. Por ejemplo, la conducta de evitación a menudo se extingue muy lentamente incluso cuando el emparejamiento inicial EC-EI nunca vuelve a ocurrir, por lo que cabría esperar que la respuesta de miedo se extinguiera (véase Condicionamiento clásico ). Además, los animales que han aprendido a evitar a menudo muestran poca evidencia de miedo, lo que sugiere que escapar del miedo no es necesario para mantener el comportamiento de evitación. [ 25 ]

Teoría operante o de "un factor".

Algunos teóricos sugieren que la conducta de evitación podría ser simplemente un caso especial de conducta operante mantenida por sus consecuencias. Desde esta perspectiva, la idea de "consecuencias" se amplía para incluir la sensibilidad a un patrón de eventos. Así, en la evitación, la consecuencia de una respuesta es una reducción en la tasa de estimulación aversiva. De hecho, la evidencia experimental sugiere que una "descarga eléctrica omitida" se detecta como un estímulo y puede actuar como reforzador. Las teorías cognitivas de la evitación llevan esta idea un paso más allá. Por ejemplo, una rata llega a "esperar" una descarga eléctrica si no presiona una palanca y a "no esperar ninguna descarga" si la presiona, y la conducta de evitación se fortalece si estas expectativas se confirman. [ 25 ]

Acaparamiento operante

El acaparamiento operante se refiere a la observación de que las ratas reforzadas de cierta manera pueden permitir que las bolitas de comida se acumulen en una bandeja en lugar de recogerlas. En este procedimiento, la recogida de las bolitas siempre instauraba un período de extinción de un minuto durante el cual no había bolitas de comida adicionales disponibles, pero sí podían consumir las que se habían acumulado previamente. Este hallazgo parece contradecir la observación habitual de que las ratas se comportan impulsivamente en situaciones en las que tienen que elegir entre un alimento más pequeño de inmediato y uno más grande después de un tiempo. Véase Programas de refuerzo . [ 26 ]

Correlatos neurobiológicos

Los primeros estudios científicos que identificaron neuronas que respondían de maneras que sugerían que codificaban para estímulos condicionados fueron realizados por Mahlon deLong [ 27 ] [ 28 ] y por RT Richardson. [ 28 ] Demostraron que las neuronas del núcleo basal , que liberan acetilcolina ampliamente en toda la corteza cerebral , se activan poco después de un estímulo condicionado, o después de una recompensa primaria si no existe un estímulo condicionado. Estas neuronas son igualmente activas para reforzadores positivos y negativos, y se ha demostrado que están relacionadas con la neuroplasticidad en muchas regiones corticales . [ 29 ] También existe evidencia de que la dopamina se activa en momentos similares. [ 30 ] Hay evidencia considerable de que la dopamina participa tanto en el aprendizaje por refuerzo como en el aversivo. [ 31 ] Las vías dopaminérgicas se proyectan mucho más densamente en las regiones de la corteza frontal . Las proyecciones colinérgicas , en cambio, son densas incluso en las regiones corticales posteriores como la corteza visual primaria . Un estudio realizado en pacientes con enfermedad de Parkinson , una afección atribuida a la acción insuficiente de la dopamina, ilustra aún más el papel de la dopamina en el refuerzo positivo. [ 32 ] Este estudio demostró que, sin medicación, los pacientes aprendían con mayor facilidad mediante consecuencias aversivas que con refuerzo positivo. En cambio, en los pacientes que seguían con su medicación, se observó lo contrario: el refuerzo positivo demostró ser la forma de aprendizaje más eficaz cuando la actividad dopaminérgica es elevada.

Se ha sugerido que un proceso neuroquímico que involucra a la dopamina subyace al refuerzo. Cuando un organismo experimenta un estímulo reforzante, se activan las vías dopaminérgicas en el cerebro. Esta red de vías "libera un pulso corto de dopamina en muchas dendritas , transmitiendo así una señal de refuerzo global a las neuronas postsinápticas ". [ 33 ] Esto permite que las sinapsis recientemente activadas aumenten su sensibilidad a las señales eferentes (que conducen hacia afuera), incrementando así la probabilidad de ocurrencia de las respuestas recientes que precedieron al refuerzo. Estas respuestas son, estadísticamente, las que tienen más probabilidades de haber sido la conducta responsable de lograr el refuerzo con éxito. Pero cuando la aplicación del refuerzo es menos inmediata o menos contingente (menos consistente), la capacidad de la dopamina para actuar sobre las sinapsis apropiadas se reduce.

Preguntas sobre la ley del efecto

Varias observaciones parecen demostrar que el comportamiento operante puede establecerse sin refuerzo en el sentido definido anteriormente. El fenómeno más citado es el del automoldeado (a veces llamado "seguimiento de señales"), en el que un estímulo es seguido repetidamente por un refuerzo, y en consecuencia el animal comienza a responder al estímulo. Por ejemplo, se ilumina una tecla de respuesta y luego se presenta comida. Cuando esto se repite algunas veces, una paloma comienza a picotear la tecla aunque la comida se obtiene tanto si el ave picotea como si no. De manera similar, las ratas comienzan a manipular objetos pequeños, como una palanca, cuando se presenta comida cerca. [ 34 ] [ 35 ] Sorprendentemente, las palomas y las ratas persisten en este comportamiento incluso cuando picotear la tecla o presionar la palanca conduce a menos comida (entrenamiento por omisión). [ 36 ] [ 37 ] Otro comportamiento operante aparente que aparece sin refuerzo es la contrafreeloading .

Estas observaciones y otras parecen contradecir la ley del efecto , y han llevado a algunos investigadores a proponer nuevas conceptualizaciones del refuerzo operante (p. ej. [ 38 ] [ 39 ] [ 40 ] ). Una visión más general es que el autoaprendizaje es un caso de condicionamiento clásico ; de hecho, el procedimiento de autoaprendizaje se ha convertido en una de las formas más comunes de medir el condicionamiento clásico. Desde esta perspectiva, muchos comportamientos pueden verse influenciados tanto por contingencias clásicas (estímulo-respuesta) como por contingencias operantes (respuesta-refuerzo), y la tarea del experimentador consiste en determinar cómo interactúan. [ 41 ]

Aplicaciones

El refuerzo y el castigo son omnipresentes en las interacciones sociales humanas, y se han sugerido e implementado muchísimas aplicaciones de los principios del condicionamiento operante.

Base biológica

El condicionamiento operante tiende un puente entre la neurobiología y la psicología. Lo logra demostrando cómo los principios conductuales externos se corresponden con los procesos internos. Mientras que los psicólogos describen el aprendizaje en términos de comportamientos observables que pueden ser moldeados por las consecuencias, los neurobiólogos tienen una perspectiva diferente. Analizan cómo estos comportamientos están sustentados por circuitos neuronales.

Se ha demostrado que tanto el refuerzo positivo como el negativo activan un sistema de recompensa en el cerebro. Esto es posible gracias a la liberación de dopamina en áreas específicas como el núcleo accumbens. [ 42 ]

Herramientas

Herramientas como los sistemas de puntos, las tablas de comportamiento y las economías de fichas se basan en principios del condicionamiento operante. Estos sistemas funcionan como reforzadores condicionados, lo que significa que pueden intercambiarse por reforzadores primarios, como una recompensa tangible.

Adicción y dependencia

El refuerzo positivo y negativo desempeñan papeles centrales en el desarrollo y mantenimiento de la adicción y la dependencia de drogas . Una droga adictiva es intrínsecamente gratificante ; es decir, funciona como un reforzador positivo primario del consumo de drogas. El sistema de recompensa del cerebro le asigna saliencia de incentivo (es decir, es "deseada" o "deseada"), [ 43 ] [ 44 ] [ 45 ] de modo que, a medida que se desarrolla una adicción, la privación de la droga conduce al deseo compulsivo. Además, los estímulos asociados con el consumo de drogas  , por ejemplo, la visión de una jeringa y el lugar de consumo  , se asocian con el refuerzo intenso inducido por la droga. [ 43 ] [ 44 ] [ 45 ] Estos estímulos previamente neutros adquieren varias propiedades: su aparición puede inducir el deseo compulsivo y pueden convertirse en reforzadores positivos condicionados del consumo continuado. [ 43 ] [ 44 ] [ 45 ] Por lo tanto, si una persona adicta se encuentra con uno de estos estímulos relacionados con las drogas, puede reaparecer el deseo de consumir la droga asociada. Por ejemplo, las agencias antidrogas utilizaban anteriormente carteles con imágenes de parafernalia de drogas para mostrar los peligros del consumo. Sin embargo, estos carteles ya no se utilizan debido a los efectos de la saliencia del incentivo, que provocan recaídas al ver los estímulos ilustrados en ellos.

En individuos drogodependientes, el refuerzo negativo ocurre cuando se autoadministran una droga para aliviar o "escapar" de los síntomas de dependencia física (por ejemplo, temblores y sudoración) y/o dependencia psicológica (por ejemplo, anhedonia , inquietud, irritabilidad y ansiedad) que surgen durante el estado de abstinencia de la droga . [ 43 ]

Entrenamiento de animales

Los adiestradores de animales y los dueños de mascotas aplicaban los principios y prácticas del condicionamiento operante mucho antes de que estas ideas fueran nombradas y estudiadas, y el adiestramiento animal sigue proporcionando uno de los ejemplos más claros y convincentes de control operante. De los conceptos y procedimientos descritos en este artículo, algunos de los más destacados son los siguientes: (a) disponibilidad de refuerzo primario (p. ej., una bolsa de golosinas para perros); (b) uso de refuerzo secundario (p. ej., hacer sonar un clicker inmediatamente después de una respuesta deseada y luego dar golosinas); (c) contingencia, asegurar que el refuerzo (p. ej., el clicker) siga al comportamiento deseado y no a otra cosa; (d) moldeamiento, como lograr gradualmente que un perro salte cada vez más alto; (e) refuerzo intermitente, como reducir gradualmente la frecuencia del refuerzo para inducir un comportamiento persistente sin saciedad; (f) encadenamiento, donde un comportamiento complejo se construye gradualmente a partir de unidades más pequeñas. [ 46 ]

Análisis de la conducta aplicada

El análisis conductual aplicado (ABA) es la disciplina iniciada por B.F. Skinner que aplica los principios del condicionamiento a la modificación de conductas humanas socialmente significativas. Utiliza los conceptos básicos de la teoría del condicionamiento, incluyendo el estímulo condicionado (EC ) , el estímulo discriminativo ( ED ), la respuesta (R) y el estímulo reforzador (ER o ER para los reforzadores, a veces EA para los estímulos aversivos). [ 25 ]

Los profesionales del ABA aplican estos procedimientos, así como numerosas variaciones y desarrollos de los mismos, a una variedad de conductas y problemas socialmente relevantes. En muchos casos, utilizan técnicas operantes para desarrollar conductas constructivas y socialmente aceptables que reemplacen las conductas aberrantes. Las técnicas de ABA se han aplicado eficazmente a cosas como intervenciones conductuales intensivas tempranas para niños autistas , [ 47 ] investigación sobre los principios que influyen en la conducta delictiva , prevención del VIH, [ 48 ] conservación de los recursos naturales, [ 49 ] educación, [ 50 ] gerontología , [ 51 ] salud y ejercicio , [ 52 ] seguridad industrial , [ 53 ] adquisición del lenguaje , [ 54 ] basura, [ 55 ] procedimientos médicos , [ 56 ] crianza de los hijos, [ 57 ] psicoterapia , uso del cinturón de seguridad, [ 58 ] trastornos mentales graves , [ 59 ] deportes, [ 60 ] abuso de sustancias , fobias , trastornos de la alimentación pediátrica y gestión y cuidado de animales en zoológicos . [ 61 ] Algunas de estas aplicaciones se encuentran entre las que se describen a continuación.

Comportamiento infantil: formación para padres sobre el manejo de la conducta infantil.

Proporcionar refuerzo positivo a las conductas apropiadas de los niños es un aspecto fundamental de la formación en manejo parental. Por lo general, los padres aprenden a recompensar la conducta apropiada mediante recompensas sociales (como elogios, sonrisas y abrazos) y recompensas concretas (como pegatinas o puntos para una recompensa mayor, como parte de un sistema de incentivos creado en colaboración con el niño). [ 62 ] Además, los padres aprenden a seleccionar conductas sencillas como objetivo inicial y a recompensar cada uno de los pequeños pasos que su hijo logra para alcanzar una meta mayor (este concepto se denomina "aproximaciones sucesivas"). [ 62 ] [ 63 ]

Ciencias económicas

Tanto psicólogos como economistas se han interesado en aplicar conceptos y hallazgos del condicionamiento operante al comportamiento humano en el mercado. Un ejemplo es el análisis de la demanda del consumidor, medida por la cantidad de un bien que se compra. En economía, el grado en que el precio influye en el consumo se denomina "elasticidad precio de la demanda". Ciertos bienes son más elásticos que otros; por ejemplo, un cambio en el precio de ciertos alimentos puede tener un gran efecto en la cantidad comprada, mientras que la gasolina y otros productos de consumo diario pueden verse menos afectados por los cambios de precio. En términos de análisis operante, estos efectos pueden interpretarse en función de las motivaciones de los consumidores y el valor relativo de los bienes como reforzadores. [ 64 ]

Juegos de azar: programación de ratio variable

Como se mencionó anteriormente en este artículo, un programa de razón variable proporciona refuerzo tras la emisión de un número impredecible de respuestas. Este programa suele generar respuestas rápidas y persistentes. Las máquinas tragamonedas pagan según un programa de razón variable y producen precisamente este tipo de comportamiento persistente de accionar la palanca en los jugadores. El pago de razón variable de las máquinas tragamonedas y otras formas de juego se ha citado con frecuencia como un factor subyacente a la adicción al juego. [ 65 ]

Psicología militar

Los seres humanos poseen una resistencia innata a matar y son reacios a actuar de manera directa y agresiva contra miembros de su propia especie, incluso para salvar vidas. Esta resistencia a matar ha provocado que la infantería sea notablemente ineficiente a lo largo de la historia de la guerra. [ 66 ]

Este fenómeno no se comprendió hasta que SLA Marshall (general de brigada e historiador militar) realizó estudios de entrevistas a la infantería de la Segunda Guerra Mundial inmediatamente después de entrar en combate. El conocido y controvertido libro de Marshall, Hombres contra el fuego: El problema del mando en las guerras futuras , reveló que solo el 15 % de los soldados dispararon sus fusiles con el propósito de matar en combate. [ 67 ]

Tras la aceptación de la investigación de Marshall por parte del Ejército de los EE. UU. en 1946, la Oficina de Investigación de Recursos Humanos del Ejército de los EE. UU. comenzó a implementar nuevos protocolos de entrenamiento que se asemejan a los métodos de condicionamiento operante. Las aplicaciones posteriores de dichos métodos aumentaron el porcentaje de soldados capaces de matar a alrededor del 50 % en Corea y a más del 90 % en Vietnam. [ 66 ] Las revoluciones en el entrenamiento incluyeron el reemplazo de los campos de tiro tradicionales emergentes por blancos emergentes tridimensionales con forma humana que colapsaban al ser alcanzados. Esto proporcionó retroalimentación inmediata y actuó como refuerzo positivo para el comportamiento del soldado. [ 68 ] Otras mejoras en los métodos de entrenamiento militar han incluido el curso de tiro cronometrado; entrenamiento más realista; altas repeticiones; elogios de los superiores; recompensas por puntería; y reconocimiento grupal. El refuerzo negativo incluye la responsabilidad entre pares o la obligación de repetir los cursos.

El entrenamiento militar moderno condiciona la respuesta del cerebro medio a la presión del combate simulando fielmente el combate real, utilizando principalmente el condicionamiento clásico pavloviano y el condicionamiento operante skinneriano (ambas formas de conductismo ). [ 66 ]

El entrenamiento moderno de tiro es un ejemplo tan excelente de conductismo que se ha utilizado durante años en el curso introductorio de psicología que se imparte a todos los cadetes de la Academia Militar de West Point como un ejemplo clásico de condicionamiento operante. En la década de 1980, durante una visita a West Point, B.F. Skinner identificó el entrenamiento militar moderno de tiro como una aplicación casi perfecta del condicionamiento operante. [ 68 ]

El teniente coronel Dave Grossman afirma sobre el condicionamiento operante y el entrenamiento militar estadounidense lo siguiente:

Es totalmente posible que nadie se haya propuesto utilizar técnicas de condicionamiento operante o modificación de la conducta para entrenar a los soldados en esta área… Pero desde el punto de vista de un psicólogo que también es historiador y militar de carrera, se me ha hecho cada vez más evidente que esto es precisamente lo que se ha logrado. [ 66 ]

teoría del empujón

La teoría del empujón (o simplemente "nudge") es un concepto de la ciencia del comportamiento , la teoría política y la economía que sostiene que las sugerencias indirectas para intentar lograr un cumplimiento no forzado pueden influir en los motivos, los incentivos y la toma de decisiones de grupos e individuos, al menos con la misma eficacia, si no con mayor, que las instrucciones directas, la legislación o la aplicación de la ley.

Elogio

El concepto de elogio como medio de refuerzo conductual tiene sus raíces en el modelo de condicionamiento operante de BF Skinner. Desde esta perspectiva, el elogio se ha considerado un medio de refuerzo positivo, en el que se hace más probable que ocurra una conducta observada al elogiarla contingentemente. [ 69 ] Cientos de estudios han demostrado la eficacia del elogio para promover conductas positivas, especialmente en el estudio del uso del elogio por parte de maestros y padres en niños para promover una mejor conducta y rendimiento académico, [ 70 ] [ 71 ] pero también en el estudio del rendimiento laboral. [ 72 ] También se ha demostrado que el elogio refuerza conductas positivas en individuos adyacentes no elogiados (como un compañero de clase del receptor del elogio) a través del refuerzo vicario. [ 73 ] El elogio puede ser más o menos eficaz para cambiar la conducta dependiendo de su forma, contenido y manera de ser transmitido. Para que el elogio produzca un cambio de comportamiento positivo, debe estar supeditado al comportamiento positivo (es decir, solo debe administrarse después de que se haya realizado el comportamiento deseado), debe especificar los detalles del comportamiento que se va a reforzar y debe expresarse con sinceridad y credibilidad. [ 74 ]

Reconociendo el efecto del elogio como estrategia de refuerzo positivo, numerosas intervenciones conductuales y cognitivo-conductuales han incorporado el uso del elogio en sus protocolos. [ 75 ] [ 76 ] El uso estratégico del elogio se reconoce como una práctica basada en la evidencia tanto en la gestión del aula [ 75 ] como en las intervenciones de capacitación para padres, [ 71 ] aunque el elogio a menudo se subsume en la investigación de intervenciones dentro de una categoría más amplia de refuerzo positivo, que incluye estrategias como la atención estratégica y las recompensas conductuales.

Se han realizado diversos estudios sobre el efecto de la terapia cognitivo-conductual y la terapia operante en diferentes afecciones médicas. Cuando los pacientes desarrollaron técnicas cognitivas y conductuales que modificaron sus comportamientos, actitudes y emociones, la intensidad de su dolor disminuyó. Los resultados de estos estudios demostraron la influencia de las cogniciones en la percepción del dolor y explicaron la eficacia general de la terapia cognitivo-conductual (TCC) y la terapia operante (TOC).

Juegos de vídeo

La mayoría de los videojuegos están diseñados en torno a un ciclo compulsivo , añadiendo un tipo de refuerzo positivo mediante un programa de tasa variable para mantener al jugador enganchado. Esto puede conducir a la patología de la adicción a los videojuegos . [ 77 ]

Como parte de una tendencia en la monetización de videojuegos durante la década de 2010, algunos juegos ofrecían cajas de botín como recompensas o como artículos que se podían comprar con dinero real. Estas cajas contienen una selección aleatoria de objetos del juego. Esta práctica se ha vinculado a los mismos métodos que utilizan las máquinas tragamonedas y otros dispositivos de juego para repartir premios, ya que sigue un esquema de tasa variable. Si bien la percepción general es que las cajas de botín son una forma de juego, esta práctica solo se clasifica como tal en unos pocos países. Sin embargo, los métodos para usar estos objetos como moneda virtual para juegos de azar en línea o para intercambiarlos por dinero real han creado un mercado de apuestas con objetos virtuales que está siendo evaluado legalmente. [ 78 ]

Medicina defensiva

Una de las muchas razones propuestas para los elevados costos asociados a la atención médica es la práctica de la medicina defensiva. Prabhu revisa el artículo de Cole y analiza cómo las respuestas de dos grupos de neurocirujanos constituyen un comportamiento operante clásico. Un grupo ejerce en un estado con restricciones a las demandas médicas y el otro en un estado sin restricciones. Se consultó de forma anónima al grupo de neurocirujanos sobre sus patrones de práctica. Los médicos modificaron su práctica en respuesta a una retroalimentación negativa (miedo a las demandas) en el grupo que ejercía en un estado sin restricciones a las demandas médicas. [ 79 ]

Véase también

Referencias

  1. Jenkins, HM "Teoría del aprendizaje y el comportamiento animal" Cap. 5 en Hearst, E. "El primer siglo de la psicología experimental" Hillsdale, NJ, Earlbaum, 1979
  2. Tarantola, Tor; Kumaran, Dharshan; Dayan, Peters; De Martino, Benedetto (10 de octubre de 2017). "Las preferencias previas influyen beneficiosamente en el aprendizaje social y no social" . Nature Communications . 8 (1): 817. Bibcode : 2017NatCo...8..817T . doi : 10.1038/s41467-017-00826-8 . ISSN 2041-1723 . PMC 5635122. PMID 29018195 .   
  3. 1 2 Thorndike, EL (1901). "Inteligencia animal: Un estudio experimental de los procesos asociativos en animales". Psychological Review Monograph Supplement . 2 : 1– 109.
  4. Miltenberger, RG "Modificación de la conducta: principios y procedimientos". Thomson/Wadsworth , 2008, pág. 9.
  5. Miltenberger, RG, & Crosland, KA (2014). Crianza. El manual de Wiley-Blackwell sobre condicionamiento operante y clásico. (pp. 509–531) Wiley-Blackwell. doi : 10.1002/9781118468135.ch20
  6. Skinner, BF (1938). El comportamiento de los organismos: un análisis experimental . Nueva York: Appleton-Century-Crofts.
  7. Skinner, BF (1950). " ¿ Son necesarias las teorías del aprendizaje?". Psychological Review . 57 (4): 193– 216. doi : 10.1037/h0054367 . PMID 15440996. S2CID 17811847 .  
  8. Schacter, Daniel L., Daniel T. Gilbert y Daniel M. Wegner. «BF Skinner: El papel del refuerzo y el castigo», subsección en: Psicología; Segunda edición. Nueva York: Worth, Incorporated, 2011, 278–288.
  9. 1 2 Ferster, CB y Skinner, BF "Programas de refuerzo", 1957 Nueva York: Appleton-Century-Crofts
  10. Staddon, JE R; D. T Cerutti (febrero de 2003). " Condicionamiento operante" . Annual Review of Psychology . 54 (1): 115– 144. doi : 10.1146/annurev.psych.54.101601.145124 . PMC 1473025. PMID 12415075 .  
  11. Mecca Chiesa (2004) Conductismo radical: filosofía y ciencia
  12. Skinner, BF "Ciencia y comportamiento humano", 1953. Nueva York: MacMillan
  13. Skinner, BF (1948). Walden Dos. Indianápolis: Hackett
  14. Skinner, BF "Comportamiento verbal", 1957. Nueva York: Appleton-Century-Crofts
  15. Neuringer, A (2002). "Variabilidad operante: evidencia, funciones y teoría" . Psychonomic Bulletin & Review . 9 (4): 672– 705. doi : 10.3758/bf03196324 . PMID 12613672 . 
  16. Cooper, JO; Heron, TE; Heward, WL (2019). Análisis conductual aplicado (3.ª ed.). Pearson Education (EE. UU.). pág. 33. ISBN   978-0-13-475255-6.
  17. Schultz W (2015). "Señales neuronales de recompensa y decisión: de las teorías a los datos" . Physiological Reviews. 95 (3): 853– 951. doi: 10.1152/physrev.00023.2014. PMC 4491543. PMID 26109341. Las recompensas en el condicionamiento operante son reforzadores positivos . ... El comportamiento operante da una buena definición de recompensas. Cualquier cosa que haga que un individuo vuelva por más es un reforzador positivo y, por lo tanto, una recompensa. Aunque proporciona una buena definición, el refuerzo positivo es solo una de varias funciones de recompensa. ... Las recompensas son atractivas. Son motivadoras y nos hacen esforzarnos. ... Las recompensas inducen un comportamiento de aproximación, también llamado comportamiento apetitivo o preparatorio, y un comportamiento consumatorio. ... Por lo tanto, cualquier estímulo, objeto, evento, actividad o situación que tenga el potencial de hacernos acercarnos y consumirlo es, por definición, una recompensa.      
  18. Skinner, BF (2014). Ciencia y comportamiento humano (PDF) . Cambridge, MA: The BF Skinner Foundation. p. 70. Recuperado el 13 de marzo de 2019 . 
  19. Hampton, W., & Morrin, M. (2025). «Cuando el tacto impulsa la compra: las recompensas hápticas como reforzadores de las compras en línea». Journal of Consumer Research. https://doi.org/10.1093/jcr/ucaf025
  20. Schacter et al. 2011 Psicología, 2.ª ed., págs. 280-284. Referencia para la sección completa: Principios, versión 130317.
  21. 1 2 Miltenberger, RG "Modificación de la conducta: principios y procedimientos". Thomson/Wadsworth , 2008. pág. 84.
  22. Miltenberger, RG "Modificación de la conducta: principios y procedimientos". Thomson/Wadsworth , 2008, pág. 86.
  23. Tucker, M.; Sigafoos, J.; Bushell, H. (1998). "Uso del refuerzo no contingente en el tratamiento de conductas desafiantes". Modificación de la conducta . 22 (4): 529– 547. doi : 10.1177/01454455980224005 . PMID 9755650 . S2CID 21542125 .  
  24. Poling, A.; Normand, M. (1999). "Refuerzo no contingente: una descripción inapropiada de los programas basados ​​en el tiempo que reducen la conducta" . Journal of Applied Behavior Analysis . 32 (2): 237– 238. doi : 10.1901/jaba.1999.32-237 . PMC 1284187 . 
  25. 1 2 3 Pierce y Cheney (2004) Análisis del comportamiento y aprendizaje
  26. Cole, MR (1990). "Acumulación operante: un nuevo paradigma para el estudio del autocontrol" . Journal of the Experimental Analysis of Behavior . 53 (2): 247– 262. doi : 10.1901 / jeab.1990.53-247 . PMC 1323010. PMID 2324665 .  
  27. "Actividad de las neuronas palidales durante el movimiento" , MR DeLong, J. Neurophysiol. , 34:414–27, 1971
  28. 1 2 Richardson RT, DeLong MR (1991): Estudios electrofisiológicos de la función del núcleo basal en primates. En Napier TC, Kalivas P, Hamin I (eds), El prosencéfalo basal: de la anatomía a la función ( Avances en medicina y biología experimental ), vol. 295. Nueva York, Plenum, pp. 232–252
  29. PNAS 93:11219-24 1996, Science 279:1714–8 1998
  30. Rozenfeld, Eyal; Parnas, Moshe (6 de diciembre de 2024). "Mecanismos de circuitos neuronales de interacción competitiva entre el aprendizaje basado en acciones y el aprendizaje por coincidencia" . Science Advances . 10 (49) eadq3016. Bibcode : 2024SciA...10.3016R . doi : 10.1126/sciadv.adq3016 . PMC 11623277. PMID 39642217 .  
  31. Neuron 63:244–253, 2009, Frontiers in Behavioral Neuroscience, 3: Artículo 13, 2009
  32. Michael J. Frank, Lauren C. Seeberger y Randall C. O'Reilly (2004) "Por la zanahoria o por el palo: aprendizaje por refuerzo cognitivo en el parkinsonismo", Science 4, noviembre de 2004
  33. Schultz, Wolfram (1998). "Señal predictiva de recompensa de las neuronas dopaminérgicas" . The Journal of Neurophysiology . 80 (1): 1– 27. doi : 10.1152/jn.1998.80.1.1 . PMID 9658025. S2CID 52857162 .  
  34. Timberlake, W (1983). "Respuestas de ratas a un objeto en movimiento relacionado con comida o agua: un análisis de sistemas de comportamiento" . Animal Learning & Behavior . 11 (3): 309– 320. doi : 10.3758/bf03199781 .
  35. Neuringer, AJ (1969). "Los animales responden a la comida en presencia de comida libre". Science . 166 (3903): 399– 401. Bibcode : 1969Sci...166..399N . doi : 10.1126/science.166.3903.399 . PMID 5812041 . S2CID 35969740 .  
  36. Williams, DR; Williams, H. (1969). "Automantenimiento en la paloma: picoteo sostenido a pesar de la falta de refuerzo contingente" . Journal of the Experimental Analysis of Behavior . 12 (4): 511– 520. doi : 10.1901/jeab.1969.12-511 . PMC 1338642. PMID 16811370 .  
  37. Peden, BF; Brown, MP; Hearst, E. (1977). "Aproximaciones persistentes a una señal de comida a pesar de la omisión de comida para la aproximación". Journal of Experimental Psychology: Animal Behavior Processes . 3 (4): 377– 399. doi : 10.1037/0097-7403.3.4.377 .
  38. Gardner, RA; Gardner, BT (1988). "Feedforward vs feedbackward: Una alternativa etológica a la ley del efecto". Behavioral and Brain Sciences . 11 (3): 429– 447. doi : 10.1017/s0140525x00058258 . S2CID 143876403 . 
  39. Gardner, RA y Gardner BT (1998) La estructura del aprendizaje a partir de estímulos semánticos para el lenguaje de señas. Mahwah, NJ: Lawrence Erlbaum Associates.
  40. Baum, WM (2012). " Repensando el refuerzo: asignación, inducción y contingencia" . Journal of the Experimental Analysis of Behavior . 97 (1): 101– 124. doi : 10.1901/jeab.2012.97-101 . PMC 3266735. PMID 22287807 .  
  41. Locurto, CM, Terrace, HS y Gibbon, J. (1981) Autoformación y teoría del condicionamiento. Nueva York: Academic Press.
  42. Staddon, JER; Cerutti, DT (2003). " Condicionamiento operante" . Annual Review of Psychology . 54 : 115–144 . doi : 10.1146/annurev.psych.54.101601.145124 . ISSN 0066-4308 . PMC 1473025. PMID 12415075 .   
  43. 1 2 3 4 Edwards S (2016). "Principios de refuerzo para la medicina de las adicciones; del consumo recreativo de drogas al trastorno psiquiátrico". Neurociencia para la medicina de las adicciones: de la prevención a la rehabilitación - Constructos y fármacos . Progress in Brain Research. Vol. 223. pp. 63–76 . doi : 10.1016/bs.pbr.2015.07.005 . ISBN   978-0-444-63545-7. PMID 26806771 . Las sustancias de abuso (que van desde el alcohol hasta los psicoestimulantes) se ingieren inicialmente en ocasiones regulares según sus propiedades de refuerzo positivo. Es importante destacar que la exposición repetida a sustancias gratificantes desencadena una cadena de eventos de refuerzo secundario, por los cuales las señales y los contextos asociados con el consumo de drogas pueden volverse reforzadores y, por lo tanto, contribuir al uso continuado y al posible abuso de la(s) sustancia(s) de elección. ... Una dimensión importante del refuerzo altamente relevante para el proceso de adicción (y particularmente la recaída) es el refuerzo secundario (Stewart, 1992). Los reforzadores secundarios (en muchos casos también considerados reforzadores condicionados) probablemente impulsan la mayoría de los procesos de refuerzo en los humanos. En el caso específico de la adicción a las drogas, las señales y los contextos íntimamente y repetidamente asociados con el consumo de drogas a menudo se convierten en reforzadores ... Una pieza fundamental de la teoría de la sensibilización al incentivo de la adicción de Robinson y Berridge postula que el valor de incentivo o la naturaleza atractiva de tales procesos de refuerzo secundario, además de los reforzadores primarios en sí mismos, puede persistir e incluso sensibilizarse con el tiempo en conjunción con el desarrollo de la adicción a las drogas (Robinson y Berridge, 1993). ... El refuerzo negativo es una condición especial asociada con un fortalecimiento de las respuestas conductuales que terminan algún estímulo continuo (presumiblemente aversivo). En este caso, podemos definir un reforzador negativo como un estímulo motivacional que fortalece dicha respuesta de "escape". Históricamente, en relación con la adicción a las drogas, este fenómeno se ha observado consistentemente en humanos, donde las drogas de abuso se autoadministran para saciar una necesidad motivacional en el estado de abstinencia (Wikler, 1952).    {{cite book}}: |journal=ignorado ( ayuda )
  44. 1 2 3 Berridge KC (abril de 2012). " Del error de predicción a la saliencia del incentivo: computación mesolímbica de la motivación de recompensa" . Eur. J. Neurosci . 35 (7): 1124– 1143. doi : 10.1111/j.1460-9568.2012.07990.x . PMC 3325516. PMID 22487042. Cuando a un EC+ pavloviano se le atribuye saliencia de incentivo , no solo desencadena el "deseo" de su ECI, sino que a menudo la señal en sí misma se vuelve altamente atractiva, incluso hasta un grado irracional. Esta atracción de la señal es otra característica distintiva de la saliencia de incentivo. El EC se vuelve difícil de ignorar (Wiers y Stacy, 2006; Hickey et al., 2010a; Piech et al., 2010; Anderson et al., 2011). El EC incluso adquiere propiedades de incentivo similares a las de su EI. Un EC atractivo suele provocar una conducta motivada, y a veces un individuo puede incluso intentar "consumirlo" como si fuera su EI (por ejemplo, comer, beber, fumar, tener relaciones sexuales, tomar una droga). El "deseo" de un EC también puede convertir el estímulo previamente neutro en un reforzador condicionado instrumental, de modo que un individuo se esforzará por obtener la señal (sin embargo, también existen mecanismos psicológicos alternativos para el reforzamiento condicionado).  
  45. 1 2 3 Berridge KC, Kringelbach ML (mayo de 2015). "Sistemas de placer en el cerebro". Neuron. 86 (3): 646– 664. doi: 10.1016/j.neuron.2015.02.018. PMC 4425246. PMID 25950633. Un objetivo importante en el futuro para la neurociencia de la adicción es comprender cómo la motivación intensa se enfoca estrechamente en un objetivo particular. Se ha sugerido que la adicción se debe en parte a la excesiva saliencia de incentivo producida por sistemas de dopamina sensibilizados o hiperreactivos que producen un "deseo" intenso (Robinson y Berridge, 1993). Pero por qué un objetivo se vuelve más "deseado" que todos los demás no se ha explicado completamente. En adictos o pacientes estimulados por agonistas, la repetición de la estimulación dopaminérgica de la saliencia de incentivo se atribuye a búsquedas individualizadas particulares, como tomar la droga adictiva o las compulsiones particulares. En situaciones de recompensa pavloviana, algunas señales de recompensa se vuelven más "deseadas" que otras como poderosos imanes motivacionales, de maneras que difieren entre individuos (Robinson et al., 2014b; Saunders y Robinson, 2013). ... Sin embargo, los efectos hedónicos bien podrían cambiar con el tiempo. A medida que se tomaba una droga repetidamente, la sensibilización dopaminérgica mesolímbica podría ocurrir en consecuencia en individuos susceptibles para amplificar el "deseo" (Leyton y Vezina, 2013; Lodge y Grace, 2011; Wolf y Ferrario, 2010), incluso si los mecanismos hedónicos opioides sufrieron una regulación negativa debido a la estimulación continua de la droga, produciendo tolerancia al "placer". La sensibilización a los incentivos produciría adicción, al magnificar selectivamente el "deseo" desencadenado por señales para volver a tomar la droga, y por lo tanto causaría una poderosa motivación incluso si la droga se volviera menos placentera (Robinson y Berridge, 1993).   
  46. McGreevy, P. y Boakes, R. "Zanahorias y palos: Principios del adiestramiento animal". (Sídney: Sydney University Press, 2011)
  47. Dillenburger, K.; Keenan, M. (2009). "Ninguna de las A en ABA significa autismo: desmintiendo los mitos". J Intellect Dev Disabil . 34 (2): 193– 95. doi : 10.1080/13668250902845244 . PMID 19404840 . S2CID 1818966 .  
  48. DeVries, JE; Burnette, MM; Redmon, WK (1991). "Prevención del SIDA: Mejora del cumplimiento de las enfermeras con el uso de guantes mediante retroalimentación del desempeño" . Journal of Applied Behavior Analysis . 24 (4): 705– 11. doi : 10.1901/jaba.1991.24-705 . PMC 1279627. PMID 1797773 .  
  49. Brothers, KJ; Krantz, PJ; McClannahan, LE (1994). "Reciclaje de papel de oficina: una función de la proximidad del contenedor" . Journal of Applied Behavior Analysis . 27 (1): 153– 60. doi : 10.1901/jaba.1994.27-153 . PMC 1297784. PMID 16795821 .  
  50. Dardig, Jill C.; Heward, William L.; Heron, Timothy E.; Nancy A. Neef; Peterson, Stephanie; Diane M. Sainato; Cartledge, Gwendolyn; Gardner, Ralph; Peterson, Lloyd R.; Susan B. Hersh (2005). Enfoque en el análisis del comportamiento en la educación: logros, desafíos y oportunidades . Upper Saddle River, NJ: Pearson/Merrill/Prentice Hall. ISBN 978-0-13-111339-8.
  51. Gallagher, SM; Keenan M. (2000). "Uso independiente de materiales de actividad por parte de personas mayores en un entorno residencial" . Journal of Applied Behavior Analysis . 33 (3): 325– 28. doi : 10.1901/jaba.2000.33-325 . PMC 1284256. PMID 11051575 .  
  52. De Luca, RV; Holborn, SW (1992). "Efectos de un programa de refuerzo de razón variable con criterios cambiantes sobre el ejercicio en niños obesos y no obesos" . Journal of Applied Behavior Analysis . 25 (3): 671– 79. doi : 10.1901/jaba.1992.25-671 . PMC 1279749. PMID 1429319 .  
  53. Fox, DK; Hopkins, BL; Anger, WK (1987). "Los efectos a largo plazo de una economía de fichas en el desempeño de seguridad en la minería a cielo abierto" . Journal of Applied Behavior Analysis . 20 (3): 215– 24. doi : 10.1901/jaba.1987.20-215 . PMC 1286011. PMID 3667473 .  
  54. Drasgow, E.; Halle, JW; Ostrosky, MM (1998). "Efectos del refuerzo diferencial en la generalización de una petición sustitutiva en tres niños con retrasos graves en el lenguaje" . Journal of Applied Behavior Analysis . 31 (3): 357– 74. doi : 10.1901/jaba.1998.31-357 . PMC 1284128. PMID 9757580 .  
  55. Powers, RB; Osborne, JG; Anderson, EG (1973). "Refuerzo positivo de la eliminación de basura en el entorno natural" . Journal of Applied Behavior Analysis . 6 (4): 579– 86. doi : 10.1901/jaba.1973.6-579 . PMC 1310876. PMID 16795442 .  
  56. Hagopian, LP; Thompson, RH (1999). "Refuerzo del cumplimiento del tratamiento respiratorio en un niño con fibrosis quística" . Journal of Applied Behavior Analysis . 32 (2): 233– 36. doi : 10.1901/jaba.1999.32-233 . PMC 1284184. PMID 10396778 .  
  57. Kuhn, SAC; Lerman, DC; Vorndran, CM (2003). "Entrenamiento piramidal para familias de niños con problemas de conducta" . Journal of Applied Behavior Analysis . 36 (1): 77– 88. doi : 10.1901/jaba.2003.36-77 . PMC 1284418. PMID 12723868 .  
  58. Van Houten, R.; Malenfant, JEL; Austin, J.; Lebbon, A. (2005). Vollmer, Timothy (ed.). "Los efectos de una indicación de demora en el cambio de marchas y el uso del cinturón de seguridad por parte de los automovilistas que no lo usan regularmente" . Journal of Applied Behavior Analysis . 38 (2): 195– 203. doi : 10.1901/jaba.2005.48-04 . PMC 1226155. PMID 16033166 .  
  59. Wong, SE; Martinez-Diaz, JA; Massel, HK; Edelstein, BA; Wiegand, W.; Bowen, L.; Liberman, RP (1993). "Entrenamiento en habilidades conversacionales con pacientes esquizofrénicos hospitalizados: Un estudio de generalización en diferentes entornos y conversadores". Behavior Therapy . 24 (2): 285– 304. doi : 10.1016/S0005-7894(05)80270-9 .
  60. Brobst, B.; Ward, P. (2002). "Efectos de la publicación pública, el establecimiento de objetivos y la retroalimentación oral en las habilidades de las jugadoras de fútbol femenino" . Journal of Applied Behavior Analysis . 35 (3): 247– 57. doi : 10.1901/jaba.2002.35-247 . PMC 1284383. PMID 12365738 .  
  61. Forthman, DL; Ogden, JJ (1992). "El papel del análisis conductual aplicado en la gestión de zoológicos: hoy y mañana" . Journal of Applied Behavior Analysis . 25 (3): 647– 52. doi : 10.1901/jaba.1992.25-647 . PMC 1279745. PMID 16795790 .  
  62. 1 2 Kazdin AE (2010). Entrenamiento en habilidades de resolución de problemas y entrenamiento en manejo parental para el trastorno negativista desafiante y el trastorno de conducta. Psicoterapias basadas en la evidencia para niños y adolescentes (2.ª ed.), 211–226. Nueva York: Guilford Press.
  63. Forgatch MS, Patterson GR (2010). Entrenamiento para el manejo parental: modelo de Oregón: una intervención para el comportamiento antisocial en niños y adolescentes. Psicoterapias basadas en la evidencia para niños y adolescentes (2.ª ed.), 159-178. Nueva York: Guilford Press.
  64. Domjan, M. (2009). Los principios del aprendizaje y el comportamiento. Wadsworth Publishing Company. 6.ª edición. páginas 244–249.
  65. Bleda, Miguel Ángel Pérez; Nieto, José Héctor Lozano (2012). "Impulsividad, inteligencia y contingencias de refuerzo discriminatorias en un programa de razón fija 3". The Spanish Journal of Psychology . 3 (15): 922– 929. doi : 10.5209/rev_SJOP.2012.v15.n3.39384 . PMID 23156902 . S2CID 144193503 . ProQuest 1439791203 .   
  66. 1 2 3 4 Grossman, Dave (1995). Sobre matar: el costo psicológico de aprender a matar en la guerra y la sociedad . Boston: Little Brown. ISBN 978-0-316-04093-8.
  67. Marshall, SLA (1947). Hombres contra el fuego: el problema del mando en batalla en la guerra futura . Washington: Infantry Journal. ISBN 978-0-8061-3280-8.{{cite book}}: Incompatibilidad de ISBN/Fecha ( ayuda )
  68. 1 2 Murray KA, Grossman D, Kentridge RW (21 de octubre de 2018). "Psicología del comportamiento" . killology.com/behavioral-psychology .
  69. Kazdin, Alan (1978). Historia de la modificación de la conducta: Fundamentos experimentales de la investigación contemporánea . Baltimore: University Park Press. ISBN 978-0-8391-1205-1.
  70. Strain, Phillip S.; Lambert, Deborah L.; Kerr, Mary Margaret; Stagg, Vaughan; Lenkner, Donna A. (1983). " Evaluación naturalista del cumplimiento de los niños con las peticiones de los maestros y consecuencias del cumplimiento" . Journal of Applied Behavior Analysis . 16 (2): 243– 249. doi : 10.1901/jaba.1983.16-243 . PMC 1307879. PMID 16795665 .  
  71. 1 2 Garland, Ann F.; Hawley, Kristin M.; Brookman-Frazee, Lauren; Hurlburt, Michael S. (mayo de 2008). "Identificación de elementos comunes de tratamientos psicosociales basados ​​en la evidencia para problemas de conducta disruptiva en niños". Journal of the American Academy of Child & Adolescent Psychiatry . 47 (5): 505– 514. doi : 10.1097/CHI.0b013e31816765c2 . PMID 18356768 . 
  72. Crowell, Charles R.; Anderson, D. Chris; Abel, Dawn M.; Sergio, Joseph P. (1988). "Aclaración de tareas, retroalimentación del desempeño y elogios sociales: procedimientos para mejorar el servicio al cliente de los cajeros bancarios" . Journal of Applied Behavior Analysis . 21 (1): 65– 71. doi : 10.1901/jaba.1988.21-65 . PMC 1286094. PMID 16795713 .  
  73. Kazdin, Alan E. (1973). "El efecto del refuerzo vicario en el comportamiento atento en el aula" . Journal of Applied Behavior Analysis . 6 (1): 71– 78. doi : 10.1901/jaba.1973.6-71 . PMC 1310808. PMID 16795397 .  
  74. Brophy, Jere (1981). "Sobre elogiar eficazmente". The Elementary School Journal . 81 (5): 269– 278. doi : 10.1086/461229 . JSTOR 1001606. S2CID 144444174 .  
  75. 1 2 Simonsen, Brandi; Fairbanks, Sarah; Briesch, Amy; Myers, Diane; Sugai, George (2008). "Prácticas basadas en la evidencia en la gestión del aula: consideraciones para la investigación y la práctica". Educación y tratamiento de los niños . 31 (1): 351– 380. doi : 10.1353/etc.0.0007 . S2CID 145087451 . 
  76. Weisz, John R. ; Kazdin, Alan E. (2010). Psicoterapias basadas en la evidencia para niños y adolescentes . Guilford Press.
  77. John Hopson: Diseño de juegos conductuales , Gamasutra , 27 de abril de 2001
  78. Hood, Vic (12 de octubre de 2017). "¿Son las cajas de botín una forma de juego?" . Eurogamer . Consultado el 12 de octubre de 2017 .
  79. Condicionamiento operante y la práctica de la medicina defensiva. Vikram C. Prabhu. Neurocirugía Mundial, 1 de julio de 2016, volumen 91, páginas 603-605.
  • Artículo sobre condicionamiento operante en Scholarpedia.
  • Revista de Análisis de Comportamiento Aplicado
  • Revista de Análisis Experimental del Comportamiento
  • Refuerzo negativo
  • scienceofbehavior.com Archivado el 2 de octubre de 2011 en Wayback Machine