Articulo de referencia

Análisis de contenido en línea

El análisis de contenido en línea o análisis textual en línea se refiere a un conjunto de técnicas de investigación utilizadas para describir y extraer conclusiones sobre materi...

El análisis de contenido en línea o análisis textual en línea se refiere a un conjunto de técnicas de investigación utilizadas para describir y extraer conclusiones sobre material en línea mediante la codificación e interpretación sistemáticas. El análisis de contenido en línea es una forma de análisis de contenido aplicada a la comunicación basada en Internet.

Historia y definición

El análisis de contenido como examen e interpretación sistemática de la comunicación se remonta al menos al siglo XVII. Sin embargo, no fue hasta el auge del periódico a principios del siglo XX que la producción masiva de material impreso generó una demanda de análisis cuantitativo de las palabras impresas. [ 1 ]

La definición de Berelson (1952) proporciona una base subyacente para el análisis textual como una "técnica de investigación para la descripción objetiva, sistemática y cuantitativa del contenido manifiesto de la comunicación". [ 2 ] El análisis de contenido consiste en categorizar unidades de texto (es decir, oraciones, cuasi-oraciones, párrafos, documentos, páginas web, etc.) según sus características sustantivas para construir un conjunto de datos que permita al analista interpretar los textos y extraer inferencias. Si bien el análisis de contenido suele ser cuantitativo , los investigadores conceptualizan la técnica como un método inherentemente mixto porque la codificación textual requiere un alto grado de interpretación cualitativa . [ 3 ] Los científicos sociales han utilizado esta técnica para investigar cuestiones de investigación relacionadas con los medios de comunicación de masas , [ 1 ] los efectos de los medios [ 4 ] y el establecimiento de la agenda . [ 5 ]

Con el auge de la comunicación en línea, las técnicas de análisis de contenido se han adaptado y aplicado a la investigación en internet . Al igual que con el auge de los periódicos, la proliferación de contenido en línea ofrece una mayor oportunidad para los investigadores interesados ​​en el análisis de contenido. Si bien el uso de fuentes en línea presenta nuevos problemas y oportunidades de investigación, el procedimiento básico de análisis de contenido en línea descrito por McMillan (2000) es prácticamente indistinguible del análisis de contenido que utiliza fuentes fuera de línea.

  1. Formule una pregunta de investigación que se centre en identificar hipótesis comprobables que puedan conducir a avances teóricos.
  2. Defina un marco de muestreo del que se extraerá una muestra y construya una muestra (a menudo denominada "corpus") de contenido que se analizará.
  3. Desarrollar e implementar un esquema de codificación que permita categorizar el contenido para responder a la pregunta planteada en el paso 1. Esto requiere especificar un período de tiempo, una unidad de contexto en la que se inserta el contenido y una unidad de codificación que lo categorice.
  4. Capacitar a los codificadores para que implementen el esquema de codificación de forma consistente y verificar la fiabilidad entre ellos. Este es un paso clave para garantizar la replicabilidad del análisis.
  5. Analizar e interpretar los datos. Poner a prueba las hipótesis planteadas en el paso 1 y extraer conclusiones sobre el contenido representado en el conjunto de datos.

Análisis de contenido en la investigación en internet

Desde el auge de la comunicación en línea, los investigadores han debatido cómo adaptar las técnicas de análisis textual al estudio del contenido web. La naturaleza de las fuentes en línea exige especial atención en muchos de los pasos del análisis de contenido, en comparación con las fuentes fuera de línea.

Mientras que el contenido offline, como el texto impreso, permanece estático una vez producido, el contenido online puede cambiar con frecuencia. La naturaleza dinámica del material online, junto con el gran y creciente volumen de contenido online, puede dificultar la construcción de un marco de muestreo a partir del cual extraer una muestra aleatoria. El contenido de un sitio también puede variar entre usuarios, lo que requiere una especificación cuidadosa del marco de muestreo. Algunos investigadores han utilizado motores de búsqueda para construir marcos de muestreo. Esta técnica tiene desventajas porque los resultados de los motores de búsqueda no son sistemáticos ni aleatorios, lo que los hace poco fiables para obtener una muestra imparcial. El problema del marco de muestreo puede sortearse utilizando una población de interés completa, como los tweets de usuarios específicos de Twitter [ 6 ] o el contenido archivado online de ciertos periódicos como marco de muestreo. [ 7 ] Los cambios en el material online pueden dificultar la categorización del contenido (paso 3). Dado que el contenido online puede cambiar con frecuencia, es particularmente importante tener en cuenta el período de tiempo durante el cual se recopila la muestra. Un paso útil es archivar el contenido de la muestra para evitar que se realicen cambios.

El contenido en línea también es no lineal. El texto impreso tiene límites claramente definidos que pueden usarse para identificar unidades de contexto (por ejemplo, un artículo de periódico). Los límites del contenido en línea que se utilizará en una muestra son más difíciles de definir. Los primeros analistas de contenido en línea a menudo especificaban un "sitio web" como unidad de contexto, sin una definición clara de lo que querían decir. [ 2 ] Los investigadores recomiendan definir de forma clara y consistente en qué consiste una "página web", o reducir el tamaño de la unidad de contexto a una característica de un sitio web. [ 2 ] [ 3 ] Los investigadores también han utilizado unidades más discretas de comunicación en línea, como comentarios web [ 8 ] o tweets. [ 6 ]

King (2008) utilizó una ontología de términos entrenada a partir de miles de documentos preclasificados para analizar el tema de varios motores de búsqueda. [ 9 ]

Análisis automático de contenido

El auge del contenido en línea ha incrementado drásticamente la cantidad de texto digital que se puede utilizar en la investigación. La cantidad de texto disponible ha motivado innovaciones metodológicas para dar sentido a conjuntos de datos textuales que son demasiado grandes para ser codificados manualmente, como se hacía tradicionalmente. [ 3 ] [ 7 ] Los avances en metodología, junto con la creciente capacidad y la disminución del costo de la computación, han permitido a los investigadores utilizar técnicas que antes no estaban disponibles para analizar grandes conjuntos de contenido textual.

El análisis automático de contenido representa una ligera desviación del procedimiento de análisis de contenido en línea de McMillan, ya que los codificadores humanos se ven complementados por un método computacional, y algunos de estos métodos no requieren que las categorías se definan de antemano. Los modelos de análisis textual cuantitativo suelen emplear métodos de " bolsa de palabras " que eliminan el orden de las palabras, suprimen las palabras muy comunes y muy poco comunes, y simplifican las palabras mediante lematización o derivación, lo que reduce la dimensionalidad del texto al reducir las palabras complejas a su raíz. [ 10 ] Si bien estos métodos son fundamentalmente reduccionistas en la forma en que interpretan el texto, pueden ser muy útiles si se aplican y validan correctamente.

Grimmer y Stewart (2013) identifican dos categorías principales de análisis textual automático: métodos supervisados ​​y no supervisados . Los métodos supervisados ​​implican la creación de un esquema de codificación y la codificación manual de una submuestra de los documentos que el investigador desea analizar. Idealmente, la submuestra, denominada «conjunto de entrenamiento», es representativa de la muestra en su conjunto. El conjunto de entrenamiento codificado se utiliza para «enseñar» a un algoritmo cómo las palabras de los documentos se corresponden con cada categoría de codificación. El algoritmo puede aplicarse para analizar automáticamente el resto de los documentos del corpus. [ 10 ]

  • Métodos de diccionario: el investigador preselecciona un conjunto de palabras clave ( n-gramas ) para cada categoría. A continuación, la máquina utiliza estas palabras clave para clasificar cada unidad de texto en una categoría.
  • Métodos individuales: el investigador etiqueta previamente una muestra de textos y entrena un algoritmo de aprendizaje automático (por ejemplo, un algoritmo SVM ) utilizando esas etiquetas. La máquina etiqueta el resto de las observaciones extrapolando información del conjunto de entrenamiento.
  • Métodos de conjunto: en lugar de utilizar un único algoritmo de aprendizaje automático, el investigador entrena un conjunto de ellos y utiliza las múltiples etiquetas resultantes para etiquetar el resto de las observaciones (véase Collingwood y Wiklerson 2011 para más detalles). [ 11 ]
  • La escala ideológica supervisada (es decir, la puntuación de palabras) se utiliza para ubicar diferentes unidades de texto a lo largo de un continuo ideológico. El investigador selecciona dos conjuntos de textos que representan cada extremo ideológico, los cuales el algoritmo puede usar para identificar las palabras que pertenecen a cada extremo . El resto de los textos del corpus se escalan según la cantidad de palabras de cada referencia extrema que contienen. [ 12 ]

Los métodos no supervisados ​​pueden utilizarse cuando no es posible definir con precisión un conjunto de categorías para la codificación antes del análisis. A diferencia de los métodos supervisados, no se requiere la intervención de codificadores humanos para entrenar el algoritmo. Una decisión clave para los investigadores al aplicar métodos no supervisados ​​es seleccionar el número de categorías en las que se clasificarán los documentos, en lugar de definirlas de antemano.

  • Modelos de pertenencia única: estos modelos agrupan automáticamente los textos en diferentes categorías mutuamente excluyentes, y los documentos se codifican en una sola categoría. Como señalan Grimmer y Stewart (16), "cada algoritmo tiene tres componentes: (1) una definición de similitud o distancia entre documentos; (2) una función objetivo que operacionaliza una agrupación ideal; y (3) un algoritmo de optimización". [ 10 ]
  • Mixed membership models: According also to Grimmer and Stewart (17), mixed membership models "improve the output of single-membership models by including additional and problem-specific structure."[10] Mixed membership FAC models classifies individual words within each document into categories, allowing the document as a whole to be a part of multiple categories simultaneously. Topic models represent one example of mixed membership FAC that can be used to analyze changes in focus of political actors[6] or newspaper articles.[7] One of the most used topic modeling technique is LDA.
  • Unsupervised Ideological Scaling (i.e. wordsfish): algorithms that allocate text units into an ideological continuum depending on shared grammatical content. Contrary to supervised scaling methods such as wordscores, methods such as wordfish[13] do not require that the researcher provides samples of extreme ideological texts.

More recently, generative large language models (LLMs) have been used as zero-shot coders for online texts, where they are prompted to assign labels without task-specific training. Studies report that such models can match or exceed the accuracy of outsourced human coders on multiple annotation tasks, including structured extraction and detection of nuanced political criticism in long news articles.[14][15]

Validation

Results of supervised methods can be validated by drawing a distinct sub-sample of the corpus, called a 'validation set'. Documents in the validation set can be hand-coded and compared to the automatic coding output to evaluate how well the algorithm replicated human coding. This comparison can take the form of inter-coder reliability scores like those used to validate the consistency of human coders in traditional textual analysis.

Validation of unsupervised methods can be carried out in several ways.

  • Semantic (or internal) validity represents how well documents in each identified cluster represent a distinct, categorical unit. In a topic model, this would be the extent to which the documents in each cluster represent the same topic. This can be tested by creating a validation set that human coders use to manually validate topic choice or the relatedness of within-cluster documents compared to documents from different clusters.
  • Predictive (or external) validity is the extent to which shifts in the frequency of each cluster can be explained by external events. If clusters of topics are valid, the topics that are most prominent should respond across time in a predictable way as a result of outside events that occur.

Desafíos en el análisis textual en línea

A pesar de la continua evolución del análisis de textos en las ciencias sociales, aún existen algunas cuestiones metodológicas sin resolver. Esta es una lista (no exhaustiva) con algunas de estas cuestiones:

  • ¿Cuándo deberían los investigadores definir sus categorías? ¿Ex ante , mediante un proceso iterativo o ad hoc ? Algunos científicos sociales argumentan que los investigadores deberían construir su teoría, expectativas y métodos (en este caso, las categorías específicas que usarán para clasificar diferentes unidades de texto) antes de comenzar a recopilar y estudiar los datos [ 16 ], mientras que otros apoyan que definir un conjunto de categorías es un proceso iterativo. [ 17 ] [ 18 ]
  • Validación. Si bien la mayoría de los investigadores informan medidas de validación para sus métodos (es decir, confiabilidad entre codificadores, estimaciones de precisión y exhaustividad , matrices de confusión, etc.), algunos no lo hacen. En particular, un mayor número de académicos está preocupado por la dificultad de validar algunas técnicas de modelado de temas. [ 19 ]
  • Muestras aleatorias. Por un lado, es extremadamente difícil saber cuántas unidades de un tipo de texto (por ejemplo, entradas de blog) hay en Internet en un momento dado. Por lo tanto, dado que en la mayoría de los casos el universo es desconocido, ¿cómo puede un investigador seleccionar una muestra aleatoria? Si en algunos casos es casi imposible obtener una muestra aleatoria, ¿deberían los investigadores trabajar con muestras o intentar recopilar todas las unidades de texto que observan? Por otro lado, a veces los investigadores tienen que trabajar con muestras proporcionadas por algunos motores de búsqueda (por ejemplo, Google) y empresas en línea (por ejemplo, Twitter), pero no tienen acceso a cómo se generaron estas muestras ni a si son aleatorias o no. ¿Deberían los investigadores utilizar este tipo de muestras?

Véase también

Referencias

  1. 1 2 Krippendorff, Klaus (2012). Análisis de contenido: Una introducción a su metodología . Thousand Oaks, CA: Sage.
  2. 1 2 3 McMillan, Sally J. (marzo de 2000). "El microscopio y el objetivo en movimiento: el desafío de aplicar el análisis de contenido a la World Wide Web". Journalism and Mass Communication Quarterly . 77 (1): 80– 98. doi : 10.1177/107769900007700107 . S2CID 143760798 . 
  3. 1 2 3 van Selm, Martine; Jankowski, Nick (2005). Análisis de contenido de documentos basados ​​en Internet . Manuscrito inédito.
  4. Riffe, Daniel; Lacy, Stephen; Fico, Frederick (1998). Analyzing Media Messages: Using Quantitative Content Analysis in Research . Mahwah, Nueva Jersey, Londres: Lawrence Erlbaum.
  5. Baumgartner, Frank; Jones, Bryan (1993). Agendas e inestabilidad en la política estadounidense. Chicago . University of Chicago Press. ISBN 978-0-226-03953-4.
  6. 1 2 3 Barberá, Pablo; Bonneau, Richard; Egan, Patrick; Jost, John; Nagler, Jonathan; Tucker, Joshua (2014). "¿Líderes o seguidores? Midiendo la capacidad de respuesta política en el Congreso de los Estados Unidos utilizando datos de redes sociales". Preparado para su presentación en la Reunión Anual de la Asociación Estadounidense de Ciencia Política .
  7. 1 2 3 DiMaggio, Paul; Nag, Manish; Blei, David (diciembre de 2013). "Explotando las afinidades entre el modelado de temas y la perspectiva sociológica sobre la cultura: Aplicación a la cobertura periodística de la financiación gubernamental estadounidense para las artes". Poetics . 41 (6): 570– 606. doi : 10.1016/j.poetic.2013.08.004 .
  8. Mishne, Gilad; Glance, Natalie (2006). "Deja una respuesta: Un análisis de los comentarios en los blogs". Tercera Conferencia Anual sobre el Ecosistema de los Blogs .
  9. King, John D. (2008). Análisis de contenido de motores de búsqueda (doctorado). Universidad Tecnológica de Queensland.
  10. 1 2 3 4 Grimmer, Justin; Stewart, Brandon (2013). "Texto como datos: promesas y escollos de los métodos de análisis automático de contenido para textos políticos" . Análisis político . 21 (3): 267– 297. doi : 10.1093/pan/mps028 .
  11. Collingwood, Loren y John Wilkerson. (2011). Compensaciones en precisión y eficiencia en métodos de aprendizaje supervisado. Archivado el 30 de junio de 2016 en Wayback Machine , en The Journal of Information Technology and Politics, artículo 4.
  12. Gerber, Elisabeth; Lewis, Jeff (2004). "Más allá de la mediana: preferencias de los votantes, heterogeneidad de los distritos y representación política" (PDF) . Journal of Political Economy . 112 (6): 1364–83 . CiteSeerX 10.1.1.320.8707 . doi : 10.1086/424737 . S2CID 16695697. Archivado del original (PDF) el 1 de octubre de 2015.  
  13. Slapin, Jonathan y Sven-Oliver Proksch. 2008. Un modelo de escala para estimar las posiciones de los partidos en series temporales a partir de textos. American Journal of Political Science 52(3):705–22.
  14. Bermejo, Vicente J.; Gago, Andrés; Gálvez, Ramiro H.; Harari, Nicolás (2025). "Los LLM superan a los codificadores humanos subcontratados en análisis textuales complejos" . Informes científicos . 15 . Portafolio de naturaleza: 40122. doi : 10.1038/s41598-025-23798-y . PMC 12623721 . 
  15. Gilardi, Fabrizio; Alizadeh, Meysam; Kubli, Maël (2023). "ChatGPT supera a los trabajadores colaborativos en tareas de anotación de texto" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 120 (30) e2305016120. Academia Nacional de Ciencias. doi : 10.1073/pnas.2305016120 .
  16. King, Gary, Robert O. Keohane y Sidney Verba. (1994). Diseño de la investigación social: inferencia científica en la investigación cualitativa. Princeton: Prince University Press.
  17. Herring, Susan C. (2009). «Análisis de contenido web: ampliando el paradigma». En Hunsinger, Jeremy (ed.). Manual internacional de investigación en Internet . Springer Netherlands. pp. 233–249 . CiteSeerX 10.1.1.476.6090 . doi : 10.1007/978-1-4020-9789-8_14 . ISBN   978-1-4020-9788-1.
  18. Saldana Johnny. (2009). Manual de codificación para la investigación cualitativa. Londres: SAGE Publication Ltd.
  19. Chuang, Jason, John D. Wilkerson, Rebecca Weiss, Dustin Tingley, Brandon M. Stewart, Margaret E. Roberts, Forough Poursabzi-Sangdeh, Justin Grimmer, Leah Findlater , Jordan Boyd-Graber y Jeffrey Heer. (2014). Análisis de contenido asistido por computadora: modelos de temas para explorar múltiples interpretaciones subjetivas . Ponencia presentada en la Conferencia sobre Sistemas de Procesamiento de Información Neuronal (NIPS). Taller sobre Aprendizaje Automático Impulsado por Humanos. Montreal, Canadá.