DBpedia (del latín "DB", que significa " base de datos ") es un proyecto que busca extraer contenido estructurado de la información creada en el proyecto Wikipedia . Esta información estructurada se pone a disposición en la World Wide Web mediante OpenLink Virtuoso . [ 1 ] [ 2 ] DBpedia permite a los usuarios consultar semánticamente las relaciones y propiedades de los recursos de Wikipedia, incluyendo enlaces a otros conjuntos de datos relacionados . [ 3 ]
El proyecto fue aclamado como "una de las piezas más famosas" del esfuerzo descentralizado de datos enlazados por Tim Berners-Lee , el inventor de la World Wide Web. [ 4 ] A junio de 2021, DBpedia contenía más de 850 millones de triples semánticos .
Fondo
El proyecto fue iniciado por personas de la Universidad Libre de Berlín y la Universidad de Leipzig [ 5 ] en colaboración con OpenLink Software, y ahora es mantenido por personas de la Universidad de Mannheim , la Universidad de Leipzig y la Universidad de Pensilvania . [ 6 ] [ 7 ] El primer conjunto de datos disponible públicamente se publicó en 2007. [ 5 ] Los datos se ponen a disposición bajo licencias libres ( CC BY-SA ), lo que permite a otros reutilizar el conjunto de datos; no utiliza una licencia de datos abiertos para renunciar a los derechos sui generis de la base de datos .
Los artículos de Wikipedia constan principalmente de texto libre, pero también incluyen información estructurada, como tablas de información (los paneles desplegables que aparecen en la esquina superior derecha de la vista predeterminada de muchos artículos de Wikipedia o al inicio de las versiones móviles ), información de categorización, imágenes, coordenadas geográficas y enlaces a páginas web externas . Esta información estructurada se extrae y se almacena en un conjunto de datos uniforme que permite realizar consultas.
Conjunto de datos
La versión de abril de 2016 del conjunto de datos de DBpedia describe 6 millones de entidades, de las cuales 5,2 millones están clasificadas en una ontología consistente , incluyendo 1,5 millones de personas, 810 000 lugares, 135 000 álbumes de música, 106 000 películas, 20 000 videojuegos, 275 000 organizaciones, 301 000 especies y 5000 enfermedades. [ 8 ] DBpedia utiliza el Marco de Descripción de Recursos (RDF) para representar la información extraída y consta de 9500 millones de triples RDF , de los cuales 1300 millones se extrajeron de la Wikipedia en inglés y 5000 millones de ediciones en otros idiomas. [ 8 ]
A partir de este conjunto de datos, se puede extraer información dispersa en varias páginas. Por ejemplo, se puede reconstruir la autoría de un libro a partir de las páginas que tratan sobre la obra o sobre el autor.
Uno de los desafíos al extraer información de Wikipedia es que los mismos conceptos pueden expresarse utilizando diferentes parámetros en las fichas informativas y otras plantillas, como y . Debido a esto, las consultas sobre el lugar de nacimiento de las personas tendrían que buscar ambas propiedades para obtener resultados más completos. Por consiguiente, se ha desarrollado el Lenguaje de Mapeo DBpedia para ayudar a mapear estas propiedades a una ontología, reduciendo al mismo tiempo el número de sinónimos. Debido a la gran diversidad de fichas informativas y propiedades utilizadas en Wikipedia, el proceso de desarrollo y mejora de estos mapeos se ha abierto a contribuciones públicas. [ 9 ]|birthplace=|placeofbirth=
La versión 2014 se publicó en septiembre de 2014. [ 10 ] Un cambio importante con respecto a las versiones anteriores fue la forma en que se extraían los resúmenes. En concreto, ejecutar una copia local de Wikipedia y recuperar los resúmenes generados a partir de ella hizo que los textos extraídos fueran considerablemente más limpios. Además, se introdujo un nuevo conjunto de datos extraído de Wikimedia Commons .
A junio de 2021, DBpedia contiene más de 850 millones de triples. [ 11 ]
Ejemplos
DBpedia extrae información objetiva de las páginas de Wikipedia, lo que permite a los usuarios encontrar respuestas a preguntas cuya información se encuentra dispersa en varios artículos de Wikipedia. Se accede a los datos mediante un lenguaje de consulta similar a SQL para RDF llamado SPARQL .
Por ejemplo, si alguien estuviera interesado en la serie de manga shōjo japonesa Tokyo Mew Mew y quisiera encontrar los géneros de otras obras escritas por su ilustradora, Mia Ikumi, DBpedia combina información de las entradas de Wikipedia sobre Tokyo Mew Mew , Mia Ikumi y sobre obras de esta autora como Super Doll Licca-chan y Koi Cupid . Dado que DBpedia normaliza la información en una sola base de datos, se puede realizar la siguiente consulta sin necesidad de saber exactamente qué entrada contiene cada fragmento de información, y se mostrarán los géneros relacionados:
PREFIJO dbprop : <http://dbpedia.org/ontology/> PREFIJO db : <http://dbpedia.org/resource/> SELECCIONAR ?who , ?WORK , ?genre DONDE { db : Tokyo_Mew_Mew dbprop : autor ?who . ?WORK dbprop : autor ?who . OPCIONAL { ?WORK dbprop : género ?genre } . }Casos de uso
DBpedia cuenta con un amplio abanico de entidades que abarcan diferentes áreas del conocimiento humano . Esto la convierte en un centro natural para la conexión de conjuntos de datos, donde conjuntos de datos externos pueden vincularse a sus conceptos. [ 12 ] El conjunto de datos de DBpedia está interconectado a nivel RDF con varios otros conjuntos de datos abiertos en la web. Esto permite que las aplicaciones enriquezcan los datos de DBpedia con datos de estos conjuntos de datos. A septiembre de 2013 , hay más de 45 millones de interconexiones entre DBpedia y conjuntos de datos externos, incluidos: Freebase , OpenCyc , UMBEL , GeoNames , MusicBrainz , CIA World Factbook , DBLP , Project Gutenberg , DBtune Jamendo , Eurostat , UniProt , Bio2RDF y datos del Censo de EE . UU. [ 13 ] [ 14 ] La iniciativa OpenCalais de Thomson Reuters , el proyecto Linked Open Data de The New York Times , la API de Zemanta [ 15 ] y DBpedia Spotlight también incluyen enlaces a DBpedia. [ 16 ] [ 17 ] [ 18 ] La BBC utiliza DBpedia para ayudar a organizar su contenido. [ 19 ] [ 20 ] Faviki utiliza DBpedia para el etiquetado semántico. [ 21 ] Samsung también incluye DBpedia en su "Plataforma de intercambio de conocimientos". [ 22 ]
Una fuente tan rica de conocimiento estructurado entre dominios constituye un terreno fértil para los sistemas de inteligencia artificial . DBpedia se utilizó como una de las fuentes de conocimiento en el sistema ganador de Jeopardy! de IBM Watson . [ 23 ]
Amazon proporciona un conjunto de datos públicos de DBpedia que se puede integrar en las aplicaciones de Amazon Web Services . [ 24 ]
Los datos sobre creadores de DBpedia pueden utilizarse para enriquecer las observaciones sobre las ventas de obras de arte. [ 25 ]
La empresa de software de crowdsourcing , Ushahidi , creó un prototipo de su software que utilizaba DBpedia para realizar anotaciones semánticas en informes generados por ciudadanos. El prototipo incorporaba el servicio "YODIE" (Yet another Open Data Information Extraction system) [ 26 ] desarrollado por la Universidad de Sheffield , que utiliza DBpedia para realizar las anotaciones. El objetivo de Ushahidi era mejorar la velocidad y la facilidad con la que se podían validar y gestionar los informes entrantes. [ 27 ]
DBpedia Spotlight
DBpedia Spotlight es una herramienta para anotar menciones de recursos de DBpedia en texto. Esto permite vincular fuentes de información no estructuradas a la nube de datos abiertos enlazados a través de DBpedia. DBpedia Spotlight realiza la extracción de entidades nombradas , incluyendo la detección de entidades y la resolución de nombres (es decir, la desambiguación). También se puede utilizar para el reconocimiento de entidades nombradas y otras tareas de extracción de información . DBpedia Spotlight busca ser personalizable para múltiples casos de uso. En lugar de centrarse en unos pocos tipos de entidades, el proyecto se esfuerza por admitir la anotación de los 3,5 millones de entidades y conceptos de más de 320 clases en DBpedia. El proyecto comenzó en junio de 2010 en el Grupo de Sistemas Basados en la Web de la Universidad Libre de Berlín.
DBpedia Spotlight está disponible públicamente como un servicio web para pruebas y una API Java / Scala con licencia Apache . La distribución de DBpedia Spotlight incluye un complemento jQuery que permite a los desarrolladores anotar páginas en cualquier lugar de la web añadiendo una línea a su página. [ 28 ] También hay clientes disponibles en Java o PHP . [ 29 ] La herramienta admite varios idiomas a través de su página de demostración [ 30 ] y servicios web. Se admite la internacionalización para cualquier idioma que tenga una edición de Wikipedia. [ 31 ]
base de datos de ontología de Archivo
Desde 2020, el proyecto DBpedia proporciona una base de datos actualizada periódicamente de ontologías accesibles a través de la web, escritas en el Lenguaje de Ontologías Web (OWL). [ 32 ] Archivo también proporciona un sistema de calificación de cuatro estrellas para las ontologías que extrae, basado en la accesibilidad, la calidad y criterios relacionados de idoneidad para el uso. Por ejemplo, se evalúa el cumplimiento de SHACL para datos basados en grafos cuando corresponde. Las ontologías también deben contener metadatos sobre sus características y especificar una licencia pública que describa sus términos de uso. [ 33 ] [ 34 ] A junio de 2021 La base de datos Archivo contiene 1368 entradas.
Historia
DBpedia fue iniciada en 2007 por Sören Auer, Christian Bizer, Georgi Kobilarov, Jens Lehmann , Richard Cyganiak y Zachary Ives . [ 5 ]
Véase también
Referencias
- ↑ Bizer, Christian; Lehmann, Jens; Kobilarov, Georgi; Auer, Soren; Becker, Christian; Cyganiak, Richard; Hellmann, Sebastian (septiembre de 2009). "DBpedia: un punto de cristalización para la Web de Datos" (PDF) . Web Semantics: Science, Services and Agents on the World Wide Web . 7 (3): 154– 165. CiteSeerX 10.1.1.150.4898 . doi : 10.1016/j.websem.2009.07.002 . ISSN 1570-8268 . Archivado del original (PDF) el 10 de agosto de 2017. Recuperado el 11 de diciembre de 2015 .
- ↑ "Acerca de DBpedia" . DBpedia . Consultado el 14 de enero de 2024 .
- ↑ "Komplett verlinkt — Linked Data" (en alemán). 3sat . 19 de junio de 2009. Consultado el 10 de noviembre de 2009 .
{{cite web}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - ↑ "Sir Tim Berners-Lee conversa con Talis sobre la Web Semántica" . Talis. 7 de febrero de 2008. Archivado del original el 10 de mayo de 2013.
- 1 2 3 DBpedia: Un núcleo para una red de datos abiertos , disponible en,, o
- ↑ "Créditos" . DBpedia. Archivado del original el 21 de septiembre de 2014. Consultado el 9 de septiembre de 2014 .
- ↑ "Inicio" . Marzo de 2024.
- 1 2 "¡SÍ! Lo hicimos de nuevo ;) – Nueva publicación de DBpedia 2016-04" . DBpedia. 19 de octubre de 2016. Consultado el 9 de enero de 2019 .
- ↑ "Mapeos de DBpedia" . mappings.dbpedia.org . Consultado el 3 de abril de 2010 .
- ↑ "Registro de cambios" . DBpedia. Septiembre de 2014. Consultado el 9 de septiembre de 2014 .
- ↑ Holze, Julia (23 de julio de 2021). "Anuncio: Lanzamiento de DBpedia Snapshot 2021-06" . DBpedia Association . Recuperado el 28 de julio de 2021 .
- ↑ E. Curry, A. Freitas y S. O'Riáin, "El papel de la curación de datos impulsada por la comunidad para las empresas" , archivado el 23 de enero de 2012 en Wayback Machine en Linking Enterprise Data, D. Wood, Ed. Boston, MA: Springer US, 2010, pp. 25-47.
- ↑ "Estadísticas sobre vínculos entre conjuntos de datos" . Proyecto comunitario SWEO: Vinculación de datos abiertos en la web semántica . W3C . Consultado el 24 de noviembre de 2009 .
- ↑ "Estadísticas sobre conjuntos de datos" . Proyecto comunitario SWEO: Vinculación de datos abiertos en la web semántica . W3C . Consultado el 24 de noviembre de 2009 .
- ↑ "Zemanta API" . dev.zemanta.com . Consultado el 26 de julio de 2021 .
- ↑ Sandhaus, Evan; Larson, Rob (29 de octubre de 2009). "Se publican las primeras 5000 etiquetas en la nube de datos enlazados" . Blogs de The New York Times . Consultado el 10 de noviembre de 2009 .
- ↑ "La vida en la nube de datos enlazados" . opencalais.com. Archivado del original el 24 de noviembre de 2009. Consultado el 10 de noviembre de 2009.
Wikipedia tiene una versión en la nube de datos enlazados llamada DBpedia. DBpedia tiene la misma información estructurada que Wikipedia, pero traducida a un formato legible por máquina.
- ↑ "Zemanta habla sobre Linked Data con SDK y API comercial" . ZDNet. Archivado del original el 28 de febrero de 2010. Recuperado el 10 de noviembre de 2009.
Zemanta apoya plenamente la iniciativa Linking Open Data. Es la primera API que devuelve entidades desambiguadas vinculadas a dbPedia, Freebase, MusicBrainz y Semantic Crunchbase.
- ↑ "Conferencia Europea sobre la Web Semántica 2009 - Georgi Kobilarov, Tom Scott, Yves Raimond, Silver Oliver, Chris Sizemore, Michael Smethurst, Christian Bizer y Robert Lee. Los medios de comunicación se encuentran con la Web Semántica: cómo la BBC utiliza DBpedia y datos enlazados para establecer conexiones" . eswc2009.org. Archivado del original el 8 de junio de 2009. Consultado el 10 de noviembre de 2009 .
- ↑ "BBC Learning - Open Lab - Reference" . BBC. Archivado del original el 25 de agosto de 2009. Consultado el 10 de noviembre de 2009.
DBpedia es una versión de Wikipedia en formato de base de datos. Se utiliza en muchos proyectos por diversas razones. En la BBC la utilizamos para etiquetar contenido.
- ↑ "Etiquetado semántico con Faviki" . readwriteweb.com. Archivado del original el 29 de enero de 2010.
- ↑ "Samsung/Plataforma para compartir conocimientos: K# - Plataforma para compartir conocimientos" . Samsung – vía GitHub .
- ↑ David Ferrucci, Eric Brown, Jennifer Chu-Carroll, James Fan, David Gondek, Aditya A. Kalyanpur, Adam Lally, J. William Murdock, Eric Nyberg, John Prager, Nico Schlaefer y Chris Welty "Construyendo Watson: Una descripción general del proyecto DeepQA". Archivado el 6 de noviembre de 2020 en Wayback Machine. En AI Magazine Otoño de 2010. Asociación para el Avance de la Inteligencia Artificial (AAAI).
- ↑ "Comunidad de desarrolladores de Amazon Web Services : DBpedia" . developer.amazonwebservices.com. Archivado del original el 13 de febrero de 2010. Consultado el 10 de noviembre de 2009 .
- ↑ Filipiak, Dominik; Filipowska, Agata (2 de diciembre de 2015). «DBpedia en el mercado del arte». Talleres de sistemas de información empresarial . Notas de clase sobre procesamiento de información empresarial. Vol. 228. págs. 321–331 . doi : 10.1007/978-3-319-26762-3_28 . ISBN 978-3-319-26761-6.
- ↑ "GATE.ac.uk - applications/yodie.html" . gate.ac.uk . Consultado el 11 de mayo de 2020 .
- ^ "ushahidi/plataforma-camaradas" . GitHub . 30 de junio de 2019 . Consultado el 9 de marzo de 2020 .
- ↑ Mendes, Pablo. "DBpedia Spotlight jQuery Plugin" . Complementos jQuery . Archivado del original el 3 de abril de 2011. Consultado el 15 de septiembre de 2011 .
- ↑ DiCiuccio, Rob (25 de septiembre de 2016). "Cliente PHP para DBpedia Spotlight" . GitHub .
- ↑ "Demostración de DBpedia Spotlight" . Consultado el 8 de septiembre de 2013 .
- ↑ "Internacionalización de DBpedia Spotlight" . GitHub . Consultado el 8 de septiembre de 2013 .
- ↑ «DBpedia Archivo» . Consultado el 8 de julio de 2021 .
- ↑ Frey, Johannes; Streitmatter, Denis; Götz, Fabian; Hellmann, Sebastian; Arndt, Natanael (27 de octubre de 2020). «DBpedia Archivo: una interfaz a escala web para el archivado de ontologías desde una perspectiva orientada al consumidor». En Sure-Vetter, York; Sack, Harald; Cudré-Mauroux, Philippe; Maleshkova, Maria; Pellegrini, Tassilo; Acosta, Maribel (eds.). Sistemas semánticos: el poder de la IA y los grafos de conocimiento . Cham, Suiza: Springer. doi : 10.1007/978-3-030-59833-4_2 . ISBN 978-3-030-59832-7. S2CID 219939266 . Descargar como PDF o ePUB.

- ↑ Frey, Johannes; Streitmatter, Denis; Götz, Fabián; Hellmann, Sebastián; Arndt, Natanael (10 de septiembre de 2020). DBpedia Archivo: una interfaz a escala web para el archivo de ontologías bajo aspectos orientados al consumidor . Leipzig, Alemania: Institut für Angewandte Informatik (InfAI) . Consultado el 8 de julio de 2021 . Vídeo de YouTube 00:10:38.