La recuperación de información jurídica es la ciencia de la recuperación de información aplicada a textos legales, incluyendo legislación , jurisprudencia y obras académicas. [ 1 ] La recuperación precisa de información jurídica es importante para brindar acceso a la ley tanto a legos como a profesionales del derecho. Su importancia ha aumentado debido a la gran cantidad de documentos legales disponibles por medios electrónicos, que crece rápidamente. [ 2 ] La recuperación de información jurídica forma parte del creciente campo de la informática jurídica .
En un contexto legal, suele ser importante recuperar toda la información relacionada con una consulta específica. Sin embargo, se ha demostrado que los métodos de búsqueda booleana de uso común (coincidencias exactas de términos específicos) en documentos legales de texto completo tienen una tasa de recuperación promedio tan baja como el 20 por ciento, [ 3 ] lo que significa que solo se recupera 1 de cada 5 documentos relevantes. En ese caso, los investigadores creían haber recuperado más del 75% de los documentos relevantes. [ 3 ] Esto puede resultar en la omisión de casos importantes o precedentes . En algunas jurisdicciones, esto puede ser especialmente problemático, ya que los profesionales del derecho tienen la obligación ética de estar razonablemente informados sobre los documentos legales relevantes. [ 4 ]
La recuperación de información jurídica busca aumentar la eficacia de las búsquedas legales incrementando el número de documentos relevantes (lo que proporciona una alta tasa de recuperación ) y reduciendo el número de documentos irrelevantes (una alta tasa de precisión ). Esta es una tarea difícil, ya que el ámbito jurídico es propenso a la jerga , [ 5 ] la polisemia [ 6 ] (palabras que tienen diferentes significados cuando se usan en un contexto legal) y el cambio constante.
Las técnicas utilizadas para lograr estos objetivos generalmente se dividen en tres categorías: recuperación booleana , clasificación manual de textos legales y procesamiento del lenguaje natural de textos legales.
Problemas
La aplicación de técnicas estándar de recuperación de información a textos jurídicos puede resultar más difícil que en otras materias. Un problema clave es que el derecho rara vez posee una taxonomía inherente . [ 7 ] En cambio, el derecho suele estar repleto de términos abiertos, que pueden cambiar con el tiempo. [ 7 ] Esto puede ser especialmente cierto en países de derecho anglosajón , donde cada caso resuelto puede modificar sutilmente el significado de una palabra o frase determinada. [ 8 ]
Los sistemas de información jurídica también deben programarse para manejar palabras y frases específicas del derecho. Si bien esto es menos problemático en el contexto de palabras que existen únicamente en el derecho, los textos jurídicos también suelen usar polisemas; las palabras pueden tener diferentes significados cuando se usan de manera jurídica o en el lenguaje común, potencialmente en ambos casos dentro del mismo documento. Los significados jurídicos pueden depender del área del derecho en la que se apliquen. Por ejemplo, en el contexto de la legislación de la Unión Europea, el término "trabajador" tiene cuatro significados diferentes: [ 9 ]
- Todo trabajador, según se define en el artículo 3(a) de la Directiva 89/391/CEE, que utilice habitualmente equipos con pantalla como parte significativa de su trabajo habitual.
- Toda persona empleada por un empleador, incluidos los aprendices y becarios, pero excluidos los empleados domésticos;
- Toda persona que desempeñe una ocupación a bordo de un buque, incluidos los aprendices y becarios, pero excluyendo a los prácticos de puerto y al personal de tierra que realice trabajos a bordo de un buque en el muelle;
- Toda persona que, en el Estado miembro de que se trate, esté protegida como empleado en virtud de la legislación laboral nacional y de conformidad con la práctica nacional;
También tiene el significado común:
- Una persona que trabaja en una ocupación específica. [ 9 ]
Aunque los términos puedan ser similares, la recuperación correcta de información debe diferenciar entre el uso previsto y los usos irrelevantes para devolver los resultados correctos.
Aunque un sistema supere los problemas lingüísticos inherentes al derecho, aún debe determinar la relevancia de cada resultado. En el contexto de las decisiones judiciales, esto requiere determinar el valor precedente del caso. [ 10 ] Las decisiones de los tribunales superiores pueden ser más relevantes que las de los tribunales inferiores , incluso cuando la decisión del tribunal inferior contiene una discusión más extensa de los hechos relevantes. [ 10 ] Sin embargo, puede ocurrir lo contrario si el tribunal superior solo aborda el tema de forma superficial (por ejemplo, si se trata de una consideración secundaria en el caso). [ 10 ] Un sistema de recuperación de información también debe tener en cuenta la autoridad de la jurisdicción. Un caso de una autoridad vinculante probablemente tenga más valor que uno de una autoridad no vinculante.
Además, las intenciones del usuario pueden determinar qué casos considera valiosos. Por ejemplo, cuando un profesional del derecho intenta argumentar una interpretación específica de la ley, podría considerar más valiosa la decisión de un tribunal menor que apoye su postura que la de un tribunal superior que no la apoye. [ 10 ] También podría valorar posturas similares de diferentes áreas del derecho, distintas jurisdicciones u opiniones disidentes. [ 10 ]
Superar estos problemas puede resultar más difícil debido a la gran cantidad de casos disponibles. El número de casos legales disponibles por medios electrónicos aumenta constantemente (en 2003, los tribunales de apelación de EE. UU. emitieron aproximadamente 500 casos nuevos por día [ 2 ] ), lo que significa que un sistema preciso de recuperación de información legal debe incorporar métodos tanto para clasificar datos anteriores como para gestionar datos nuevos. [ 2 ] [ 11 ]
Técnicas
Búsquedas booleanas
Las búsquedas booleanas , en las que el usuario puede especificar términos como el uso de palabras clave o sentencias de un tribunal concreto, son el tipo de búsqueda más común disponible en los sistemas de recuperación de información jurídica. Si bien están ampliamente implementadas, no resuelven muchos de los problemas mencionados anteriormente.
The recall and precision rates of these searches vary depending on the implementation and searches analyzed. One study found a basic boolean search's recall rate to be roughly 20%, and its precision rate to be roughly 79%.[3] Another study implemented a generic search (that is, not designed for legal uses) and found a recall rate of 56% and a precision rate of 72% among legal professionals. Both numbers increased when searches were run by non-legal professionals, to a 68% recall rate and 77% precision rate. This is likely explained because of the use of complex legal terms by the legal professionals.[12]
Manual classification
In order to overcome the limits of basic boolean searches, information systems have attempted to classify case laws and statutes into more computer friendly structures. Usually, this results in the creation of an ontology to classify the texts, based on the way a legal professional might think about them.[13] These attempt to link texts on the basis of their type, their value, and/or their topic areas. Most major legal search providers now implement some sort of classification search, such as Westlaw's “Natural Language”[14] or LexisNexis' Headnote[15] searches. Additionally, both of these services allow browsing of their classifications, via Westlaw's West Key Numbers[14] or Lexis' Headnotes.[15] Though these two search algorithms are proprietary and secret, it is known that they employ manual classification of text (though this may be computer-assisted).[13]
These systems can help overcome the majority of problems inherent in legal information retrieval systems, in that manual classification has the greatest chances of identifying landmark cases and understanding the issues that arise in the text.[16] In one study, ontological searching resulted in a precision rate of 82% and a recall rate of 97% among legal professionals.[17] The legal texts included, however, were carefully controlled to just a few areas of law in a specific jurisdiction.[18]
The major drawback to this approach is the requirement of using highly skilled legal professionals and large amounts of time to classify texts.[16][19] As the amount of text available continues to increase, some have stated their belief that manual classification is unsustainable.[20]
Natural language processing
In order to reduce the reliance on legal professionals and the amount of time needed, efforts have been made to create a system to automatically classify legal text and queries.[2][21][22] Adequate translation of both would allow accurate information retrieval without the high cost of human classification. These automatic systems generally employ Natural Language Processing (NLP) techniques that are adapted to the legal domain, and also require the creation of a legal ontology. Though multiple systems have been postulated,[2][21][22] few have reported results. One system, “SMILE,” which attempted to automatically extract classifications from case texts, resulted in an f-measure (which is a calculation of both recall rate and precision) of under 0.3 (compared to perfect f-measure of 1.0).[23] This is probably much lower than an acceptable rate for general usage.[23][24]
Despite the limited results, many theorists predict that the evolution of such systems will eventually replace manual classification systems.[25][26]
Citation-Based ranking
In the mid-90s the Room 5 case law retrieval project used citation mining for summaries and ranked its search results based on citation type and count. This slightly pre-dated the PageRank algorithm at Stanford which was also a citation-based ranking. Ranking of results was based as much on jurisdiction as on number of references.[27]
Notes
- ↑Maxwell, K.T., and Schafer, B. 2009, p. 1
- 12345Jackson et al., p. 60
- 123Blair, D.C., and Maron, M.E., 1985, p.293
- ↑American Bar Association, Model Rules of Professional Conduct Rule 1.1, http://www.abanet.org/cpr/mrpc/rule_1_1.html
- ↑Peters, W. et al. 2007, p. 118
- ↑Peters, W. et al. 2007, p. 130
- 12Peters, W. et al. 2007, p. 120
- ^ Saravanan, M. y col. 2009, pág. 101
- 1 2 Peters, W. et al. 2007, pág. 131
- 1 2 3 4 5 Maxwell, KT y Schafer, B. 2008, pág. 8
- ↑ Maxwell, KT y Schafer, B. 2007, pág. 1
- ^ Saravanan M., et al. 2009, pág. 116
- 1 2 Maxwell, KT y Schafer, B. 2008, pág. 2
- 1 2 Investigación de Westlaw, http://www.westlaw.com
- 1 2 Lexis Research, http://www.lexisnexis.com
- 1 2 Maxwell, KT y Schafer, B. 2008, pág. 3
- ^ Saravanan, M. y col. 2009, pág. 116
- ^ Saravanan, M. y col. 2009, pág. 103
- ↑ Schweighofer, E. y Liebwald, D. 2008, p. 108
- ↑ Maxwell, KT y Schafer, B. 2008, pág. 4
- 1 2 Ashley, KD y Bruninghaus, S. 2009, pág. 125
- 1 2 Gelbart, D. y Smith, JC 1993, pág. 142
- 1 2 Ashley, KD y Bruninghaus, S. 2009, pág. 159
- ↑ Maxwell, KT y Schafer, B. 2009, pág. 3
- ↑ Maxwell, KT y Schafer, B. 2009, pág. 9
- ↑ Ashley, KD y Bruninghaus, S. 2009, pág. 126
- ↑ Loui, RP, Norman, J., Altepeter, J., Pinkard, D., Craven, D., Linsday, J., & Foltz, M. (1997, junio). Avances en la Sala 5: Un banco de pruebas para la argumentación jurídica semiformal interactiva pública. En Actas de la 6.ª conferencia internacional sobre inteligencia artificial y derecho (págs. 207-214). ACM.
Referencias
- Maxwell, KT; Schafer, B. (2008). "Concepto y contexto en la recuperación de información legal" . Frontiers in Artificial Intelligence and Applications . 189 : 63–72 . Recuperado el 7 de noviembre de 2009 .
- Jackson, P.; et al. (1998). «Extracción de información de la jurisprudencia y recuperación de casos anteriores mediante análisis parcial y generación de consultas» . Actas de la séptima conferencia internacional sobre gestión de la información y el conocimiento . Cikm '98. ACM. pp. 60–67 . doi : 10.1145/288627.288642 . ISBN 978-1581130614. S2CID 1268465 . Consultado el 07-11-2009 .
- Blair, DC; Maron, ME (1985). "Una evaluación de la efectividad de la recuperación para la recuperación de documentos de texto completo". Communications of the ACM . 28 (3): 289– 299. doi : 10.1145/3166.3197 . hdl : 2027.42/35415 . S2CID 5144091 .
- Peters, W.; et al. (2007). "La estructuración del conocimiento jurídico en LOIS". Inteligencia Artificial y Derecho . 15 (2): 117– 135. CiteSeerX 10.1.1.104.7469 . doi : 10.1007/s10506-007-9034-4 . S2CID 2355864 .
- Saravanan, M.; et al. (2007). "Mejora de la recuperación de información legal mediante un marco ontológico". Inteligencia Artificial y Derecho . 17 (2): 101– 124. doi : 10.1007/s10506-009-9075-y . S2CID 8853001 .
- Schweighofer, E.; Liebwald, D. (2007). "Ontologías léxicas avanzadas y sistemas híbridos basados en el conocimiento: primeros pasos hacia un comentario electrónico jurídico dinámico". Inteligencia Artificial y Derecho . 15 (2): 103– 115. doi : 10.1007/s10506-007-9029-1 . S2CID 80124 .
- Gelbart, D.; Smith, JC (1993). «Flexicon». Actas de la cuarta conferencia internacional sobre inteligencia artificial y derecho - ICAIL '93 . ACM. págs. 142–151 . doi : 10.1145/158976.158994 . ISBN 978-0897916066. S2CID 18952317 .
- Ashley, KD; Bruninghaus, S. (2009). "Clasificación automática de textos de casos y predicción de resultados". Inteligencia Artificial y Derecho . 17 (2): 125– 165. doi : 10.1007/s10506-009-9077-9 . S2CID 31791294 .
Véase también
- Géneros de recuperación de información
- Procesamiento del lenguaje natural
- Investigación jurídica
- bases de datos jurídicas en línea