El Corpus Enron es una base de datos de más de 600 000 correos electrónicos escritos por 158 empleados [ 1 ] de la Corporación Enron en los años previos al colapso de la empresa en diciembre de 2001. El corpus fue generado a partir de los servidores de correo electrónico de Enron por la Comisión Federal Reguladora de Energía (FERC) durante su investigación posterior. [ 2 ] Posteriormente , Andrew McCallum , un científico informático de la Universidad de Massachusetts Amherst , compró una copia de la base de datos de correo electrónico por 10 000 dólares . [ 3 ] Él entregó esta copia a investigadores, proporcionando un tesoro de datos que se ha utilizado para estudios sobre redes sociales y comunicación mediada por computadora .
Creación
En la investigación legal sobre el colapso de Enron, el proceso de descubrimiento requirió la recopilación y preservación de grandes cantidades de datos, para lo cual la FERC contrató a Aspen Systems (ahora parte de Lockheed Martin ). Los correos electrónicos fueron recopilados en la sede de Enron Corporation en Houston durante dos semanas en mayo de 2002 por Joe Bartling, [ 4 ] un contratista de Aspen para el apoyo a litigios y el análisis de datos. Además de los correos electrónicos de los empleados de Enron, todos los sistemas de bases de datos empresariales de Enron, [ 5 ] alojados en bases de datos Oracle en servidores de Sun Microsystems , fueron capturados y preservados, incluida su plataforma de comercio de energía en línea , EnronOnline.
Una vez recopilados, los correos electrónicos de Enron fueron procesados y alojados en plataformas de descubrimiento electrónico propietarias (primero Concordance, luego iCONECT) para su revisión por investigadores de la FERC, la Comisión de Comercio de Futuros de Productos Básicos y el Departamento de Justicia . Al concluir la investigación, y tras la publicación del informe del personal de la FERC, [ 6 ] los correos electrónicos y la información recopilada se consideraron de dominio público , para ser utilizados con fines académicos y de investigación histórica . El archivo de correo electrónico se puso a disposición del público y se pudo buscar a través de la web utilizando iCONECT 24/7, pero el enorme volumen de correo electrónico de más de 160 GB hizo que su uso fuera impracticable en ese momento. Se pusieron a disposición copias de los correos electrónicos y bases de datos recopilados en discos duros .
Jitesh Shetty y Jafar Adibi de la Universidad del Sur de California procesaron los datos en 2004 y publicaron una versión MySQL . [ 7 ] En 2010, EDRM.net publicó una versión 2 revisada y ampliada del corpus, [ 8 ] que contiene más de 1,7 millones de mensajes, que se ha puesto a disposición en Amazon S3 para facilitar el acceso a los investigadores.
Explotación

El corpus es valorado como una de las pocas colecciones masivas de correos electrónicos reales disponibles públicamente y fácilmente accesibles para el estudio; dichas colecciones suelen estar sujetas a numerosas restricciones legales y de privacidad que las hacen prohibitivamente difíciles de acceder, como acuerdos de confidencialidad y saneamiento de datos . [ 3 ] Shetty y Adibi, basándose en su versión MySQL, publicaron un análisis de enlaces sobre qué cuentas de usuario enviaron correos electrónicos a qué. [ 9 ] La comparación lingüística con corpus de correo electrónico más recientes muestra cambios en el registro de correo electrónico del inglés. También se utiliza como datos de prueba o entrenamiento para la investigación en procesamiento del lenguaje natural y aprendizaje automático . [ 10 ] El conjunto de datos Pile lo utiliza.
Véase también
Referencias
- ↑ Klimt, Bryan; Yiming Yang (2004). "El corpus de Enron: un nuevo conjunto de datos para la investigación de clasificación de correos electrónicos". pp. 217–226 . CiteSeerX 10.1.1.61.1645 .
- ↑ " El corpus de correos electrónicos de Enron archivado el 8 de marzo de 2011 en Wayback Machine " Consultado el 5 de marzo de 2011.
- 1 2 Markoff, John. " Ejércitos de abogados caros, reemplazados por software más barato ". New York Times, 5 de marzo de 2011, pág. A1.
- ↑ Bartling, Joe (3 de septiembre de 2015). "El conjunto de datos de Enron: ¿de dónde provino?" . Bartling Forensic and Advisory . Archivado del original el 15 de abril de 2016. Recuperado el 3 de septiembre de 2015 .
- ↑ "FERC: Industrias - Proceso de negocio y bases de datos de Enron para el comercio de energía" . www.ferc.gov . Archivado del original el 5 de enero de 2020. Consultado el 2 de septiembre de 2015 .
- ↑ Informe del personal de la FERC: Manipulación de precios en los mercados occidentales: Conclusiones de un vistazo. Archivado el 21/02/2006 en Wayback Machine (26/03/2003).
- ↑ " Base de datos procesada por Enron "
- ↑ Socha, George. "Conjunto de datos de correo electrónico de Enron v2 de EDRM ya disponible" . EDRM.net. Archivado del original el 4 de septiembre de 2011. Consultado el 3 de septiembre de 2012 .
- ↑ Shetty, Jitesh; Adibi, Jafar (2005). "Descubrimiento de nodos importantes mediante la entropía de grafos: el caso de la base de datos de correos electrónicos de Enron". Actas del 3er taller internacional sobre descubrimiento de enlaces - LinkKDD '05 . págs. 74–81 . doi : 10.1145/1134271.1134282 . ISBN 978-1595932150. S2CID 10122735 .
- ↑ Friginal, Eric; Hardy, Jack (2013). Sociolingüística basada en corpus: una guía para estudiantes . Routledge. pág. 167. ISBN 978-1-136-29277-4. Consultado el 29 de mayo de 2020 .
Enlaces externos
- Tutorial sobre modelado de datos con el corpus de Enron.
- Descarga del conjunto de datos de correos electrónicos de Enron de Shetty y Adibi en S3 (178 MB)
- Nathan Heller: Lo que los correos electrónicos de Enron revelan sobre nosotros. The New Yorker, 24 de julio de 2017.
- Base de datos de correos electrónicos de Enron con función de búsqueda (requiere registro)
- Enron
- Correo electrónico
- corpus en inglés
- Cuerpos