La recuperación de información jurídica es la ciencia de la recuperación de información aplicada a textos legales, incluyendo legislación , jurisprudencia y obras académicas. [ 1 ] La recuperación precisa de información jurídica es importante para brindar acceso a la ley tanto a legos como a profesionales del derecho. Su importancia ha aumentado debido a la gran cantidad de documentos legales disponibles por medios electrónicos, que crece rápidamente. [ 2 ] La recuperación de información jurídica forma parte del creciente campo de la informática jurídica .
En un contexto legal, suele ser importante recuperar toda la información relacionada con una consulta específica. Sin embargo, se ha demostrado que los métodos de búsqueda booleana de uso común (coincidencias exactas de términos específicos) en documentos legales de texto completo tienen una tasa de recuperación promedio tan baja como el 20 por ciento, [ 3 ] lo que significa que solo se recupera 1 de cada 5 documentos relevantes. En ese caso, los investigadores creían haber recuperado más del 75% de los documentos relevantes. [ 3 ] Esto puede resultar en la omisión de casos importantes o precedentes . En algunas jurisdicciones, esto puede ser especialmente problemático, ya que los profesionales del derecho tienen la obligación ética de estar razonablemente informados sobre los documentos legales relevantes. [ 4 ]
La recuperación de información jurídica busca aumentar la eficacia de las búsquedas legales incrementando el número de documentos relevantes (lo que proporciona una alta tasa de recuperación ) y reduciendo el número de documentos irrelevantes (una alta tasa de precisión ). Esta es una tarea difícil, ya que el ámbito jurídico es propenso a la jerga , [ 5 ] la polisemia [ 6 ] (palabras que tienen diferentes significados cuando se usan en un contexto legal) y el cambio constante.
Las técnicas utilizadas para lograr estos objetivos generalmente se dividen en tres categorías: recuperación booleana , clasificación manual de textos legales y procesamiento del lenguaje natural de textos legales.
Problemas
La aplicación de técnicas estándar de recuperación de información a textos jurídicos puede resultar más difícil que en otras materias. Un problema clave es que el derecho rara vez posee una taxonomía inherente . [ 7 ] En cambio, el derecho suele estar repleto de términos abiertos, que pueden cambiar con el tiempo. [ 7 ] Esto puede ser especialmente cierto en países de derecho anglosajón , donde cada caso resuelto puede modificar sutilmente el significado de una palabra o frase determinada. [ 8 ]
Los sistemas de información jurídica también deben programarse para manejar palabras y frases específicas del derecho. Si bien esto es menos problemático en el contexto de palabras que existen únicamente en el derecho, los textos jurídicos también suelen usar polisemas; las palabras pueden tener diferentes significados cuando se usan de manera jurídica o en el lenguaje común, potencialmente en ambos casos dentro del mismo documento. Los significados jurídicos pueden depender del área del derecho en la que se apliquen. Por ejemplo, en el contexto de la legislación de la Unión Europea, el término "trabajador" tiene cuatro significados diferentes: [ 9 ]
- Cualquier trabajador, según se define en el artículo 3(a) de la Directiva 89/391/CEE, que utilice habitualmente equipos con pantalla como parte significativa de su trabajo habitual.
- Toda persona empleada por un empleador, incluidos los aprendices y becarios, pero excluidos los empleados domésticos;
- Toda persona que desempeñe una ocupación a bordo de un buque, incluidos los aprendices y becarios, pero excluyendo a los prácticos de puerto y al personal de tierra que realice trabajos a bordo de un buque en el muelle;
- Toda persona que, en el Estado miembro de que se trate, esté protegida como empleado en virtud de la legislación laboral nacional y de conformidad con la práctica nacional;
También tiene el significado común:
- Una persona que trabaja en una ocupación específica. [ 9 ]
Aunque los términos puedan ser similares, la recuperación correcta de información debe diferenciar entre el uso previsto y los usos irrelevantes para devolver los resultados correctos.
Aunque un sistema supere los problemas lingüísticos inherentes al derecho, aún debe determinar la relevancia de cada resultado. En el contexto de las decisiones judiciales, esto requiere determinar el valor precedente del caso. [ 10 ] Las decisiones de los tribunales superiores pueden ser más relevantes que las de los tribunales inferiores , incluso cuando la decisión del tribunal inferior contiene una discusión más extensa de los hechos relevantes. [ 10 ] Sin embargo, puede ocurrir lo contrario si el tribunal superior solo aborda el tema de forma superficial (por ejemplo, si se trata de una consideración secundaria en el caso). [ 10 ] Un sistema de recuperación de información también debe tener en cuenta la autoridad de la jurisdicción. Un caso de una autoridad vinculante probablemente tenga más valor que uno de una autoridad no vinculante.
Además, las intenciones del usuario pueden determinar qué casos considera valiosos. Por ejemplo, cuando un profesional del derecho intenta argumentar una interpretación específica de la ley, podría considerar más valiosa la decisión de un tribunal menor que apoye su postura que la de un tribunal superior que no la apoye. [ 10 ] También podría valorar posturas similares de diferentes áreas del derecho, distintas jurisdicciones u opiniones disidentes. [ 10 ]
Superar estos problemas puede resultar más difícil debido a la gran cantidad de casos disponibles. El número de casos legales disponibles por medios electrónicos aumenta constantemente (en 2003, los tribunales de apelación de EE. UU. emitieron aproximadamente 500 casos nuevos por día [ 2 ] ), lo que significa que un sistema preciso de recuperación de información legal debe incorporar métodos tanto para clasificar datos anteriores como para gestionar datos nuevos. [ 2 ] [ 11 ]
Técnicas
Búsquedas booleanas
Las búsquedas booleanas , en las que el usuario puede especificar términos como el uso de palabras clave o sentencias de un tribunal concreto, son el tipo de búsqueda más común disponible en los sistemas de recuperación de información jurídica. Si bien están ampliamente implementadas, no resuelven muchos de los problemas mencionados anteriormente.
Las tasas de recuperación y precisión de estas búsquedas varían según la implementación y las búsquedas analizadas. Un estudio encontró que la tasa de recuperación de una búsqueda booleana básica era de aproximadamente el 20%, y su tasa de precisión de aproximadamente el 79%. [ 3 ] Otro estudio implementó una búsqueda genérica (es decir, no diseñada para usos legales) y encontró una tasa de recuperación del 56% y una tasa de precisión del 72% entre profesionales del derecho. Ambos valores aumentaron cuando las búsquedas fueron realizadas por personas ajenas al ámbito legal, alcanzando una tasa de recuperación del 68% y una tasa de precisión del 77%. Esto probablemente se deba al uso de términos legales complejos por parte de los profesionales del derecho. [ 12 ]
Clasificación manual
Para superar las limitaciones de las búsquedas booleanas básicas, los sistemas de información han intentado clasificar la jurisprudencia y las leyes en estructuras más fáciles de procesar por ordenador. Normalmente, esto da como resultado la creación de una ontología para clasificar los textos, basándose en la forma en que un profesional del derecho podría pensar en ellos. [ 13 ] Estas intentan vincular los textos en función de su tipo, su valor y/o sus áreas temáticas. La mayoría de los principales proveedores de búsqueda jurídica implementan ahora algún tipo de búsqueda por clasificación, como la búsqueda en "Lenguaje Natural" de Westlaw [ 14 ] o las búsquedas Headnote de LexisNexis [ 15 ] . Además, ambos servicios permiten explorar sus clasificaciones, a través de los números clave de Westlaw [ 14 ] o las Headnotes de Lexis. [ 15 ] Aunque estos dos algoritmos de búsqueda son de propiedad exclusiva y secretos, se sabe que emplean la clasificación manual del texto (aunque puede estar asistida por ordenador). [ 13 ]
Estos sistemas pueden ayudar a superar la mayoría de los problemas inherentes a los sistemas de recuperación de información jurídica, ya que la clasificación manual tiene las mayores probabilidades de identificar casos emblemáticos y comprender los problemas que surgen en el texto. [ 16 ] En un estudio, la búsqueda ontológica resultó en una tasa de precisión del 82 % y una tasa de recuperación del 97 % entre profesionales del derecho. [ 17 ] Sin embargo, los textos jurídicos incluidos se controlaron cuidadosamente para limitarse a unas pocas áreas del derecho en una jurisdicción específica. [ 18 ]
El principal inconveniente de este enfoque es la necesidad de emplear profesionales jurídicos altamente cualificados y dedicar mucho tiempo a clasificar los textos. [ 16 ] [ 19 ] A medida que aumenta la cantidad de texto disponible, algunos han manifestado su opinión de que la clasificación manual es insostenible. [ 20 ]
Procesamiento del lenguaje natural
Para reducir la dependencia de los profesionales del derecho y el tiempo necesario, se han realizado esfuerzos para crear un sistema que clasifique automáticamente textos y consultas legales. [ 2 ] [ 21 ] [ 22 ] Una traducción adecuada de ambos permitiría una recuperación precisa de la información sin el alto costo de la clasificación humana. Estos sistemas automáticos generalmente emplean técnicas de procesamiento del lenguaje natural (PLN) adaptadas al dominio legal y también requieren la creación de una ontología legal . Aunque se han postulado múltiples sistemas, [ 2 ] [ 21 ] [ 22 ] pocos han reportado resultados. Un sistema, “SMILE”, que intentó extraer automáticamente clasificaciones de textos de casos, resultó en una medida F (que es un cálculo tanto de la tasa de recuperación como de la precisión) de menos de 0,3 (en comparación con una medida F perfecta de 1,0). [ 23 ] Esto es probablemente mucho menor que una tasa aceptable para el uso general. [ 23 ] [ 24 ]
A pesar de los resultados limitados, muchos teóricos predicen que la evolución de estos sistemas acabará reemplazando a los sistemas de clasificación manual. [ 25 ] [ 26 ]
Clasificación basada en citas
A mediados de los 90, el proyecto de recuperación de jurisprudencia Room 5 utilizó minería de citas para elaborar resúmenes y clasificó los resultados de búsqueda según el tipo y la cantidad de citas. Esto precedió ligeramente al algoritmo PageRank de Stanford, que también se basaba en la clasificación por citas. La clasificación de los resultados se basaba tanto en la jurisdicción como en el número de referencias. [ 27 ]
Notas
- ↑ Maxwell, KT y Schafer, B. 2009, pág. 1
- 1 2 3 4 5 Jackson et al., pág. 60
- 1 2 3 Blair, DC y Maron, ME, 1985, pág. 293
- ↑ Asociación de Abogados de Estados Unidos, Regla Modelo de Conducta Profesional, Regla 1.1, http://www.abanet.org/cpr/mrpc/rule_1_1.html
- ↑ Peters, W. et al. 2007, pág. 118
- ↑ Peters, W. et al. 2007, pág. 130
- 1 2 Peters, W. et al. 2007, pág. 120
- ^ Saravanan, M. y col. 2009, pág. 101
- 1 2 Peters, W. et al. 2007, pág. 131
- 1 2 3 4 5 Maxwell, KT y Schafer, B. 2008, pág. 8
- ↑ Maxwell, KT y Schafer, B. 2007, pág. 1
- ^ Saravanan M., et al. 2009, pág. 116
- 1 2 Maxwell, KT y Schafer, B. 2008, pág. 2
- 1 2 Investigación de Westlaw, http://www.westlaw.com
- 1 2 Lexis Research, http://www.lexisnexis.com
- 1 2 Maxwell, KT y Schafer, B. 2008, pág. 3
- ^ Saravanan, M. y col. 2009, pág. 116
- ^ Saravanan, M. y col. 2009, pág. 103
- ↑ Schweighofer, E. y Liebwald, D. 2008, p. 108
- ↑ Maxwell, KT y Schafer, B. 2008, pág. 4
- 1 2 Ashley, KD y Bruninghaus, S. 2009, pág. 125
- 1 2 Gelbart, D. y Smith, JC 1993, pág. 142
- 1 2 Ashley, KD y Bruninghaus, S. 2009, pág. 159
- ↑ Maxwell, KT y Schafer, B. 2009, pág. 3
- ↑ Maxwell, KT y Schafer, B. 2009, pág. 9
- ↑ Ashley, KD y Bruninghaus, S. 2009, pág. 126
- ↑ Loui, RP, Norman, J., Altepeter, J., Pinkard, D., Craven, D., Linsday, J., & Foltz, M. (1997, junio). Avances en la Sala 5: Un banco de pruebas para la argumentación jurídica semiformal interactiva pública. En Actas de la 6.ª conferencia internacional sobre inteligencia artificial y derecho (págs. 207-214). ACM.
Referencias
- Maxwell, KT; Schafer, B. (2008). "Concepto y contexto en la recuperación de información legal" . Frontiers in Artificial Intelligence and Applications . 189 : 63–72 . Recuperado el 7 de noviembre de 2009 .
- Jackson, P.; et al. (1998). «Extracción de información de la jurisprudencia y recuperación de casos anteriores mediante análisis parcial y generación de consultas» . Actas de la séptima conferencia internacional sobre gestión de la información y el conocimiento . Cikm '98. ACM. pp. 60–67 . doi : 10.1145/288627.288642 . ISBN 978-1581130614. S2CID 1268465 . Consultado el 07-11-2009 .
- Blair, DC; Maron, ME (1985). "Una evaluación de la efectividad de la recuperación para la recuperación de documentos de texto completo". Communications of the ACM . 28 (3): 289– 299. doi : 10.1145/3166.3197 . hdl : 2027.42/35415 . S2CID 5144091 .
- Peters, W.; et al. (2007). "La estructuración del conocimiento jurídico en LOIS". Inteligencia Artificial y Derecho . 15 (2): 117– 135. CiteSeerX 10.1.1.104.7469 . doi : 10.1007/s10506-007-9034-4 . S2CID 2355864 .
- Saravanan, M.; et al. (2007). "Mejora de la recuperación de información legal mediante un marco ontológico". Inteligencia Artificial y Derecho . 17 (2): 101– 124. doi : 10.1007/s10506-009-9075-y . S2CID 8853001 .
- Schweighofer, E.; Liebwald, D. (2007). "Ontologías léxicas avanzadas y sistemas híbridos basados en el conocimiento: primeros pasos hacia un comentario electrónico jurídico dinámico". Inteligencia Artificial y Derecho . 15 (2): 103– 115. doi : 10.1007/s10506-007-9029-1 . S2CID 80124 .
- Gelbart, D.; Smith, JC (1993). «Flexicon». Actas de la cuarta conferencia internacional sobre inteligencia artificial y derecho - ICAIL '93 . ACM. págs. 142–151 . doi : 10.1145/158976.158994 . ISBN 978-0897916066. S2CID 18952317 .
- Ashley, KD; Bruninghaus, S. (2009). "Clasificación automática de textos de casos y predicción de resultados". Inteligencia Artificial y Derecho . 17 (2): 125– 165. doi : 10.1007/s10506-009-9077-9 . S2CID 31791294 .
Véase también
- Géneros de recuperación de información
- Procesamiento del lenguaje natural
- Investigación jurídica
- bases de datos jurídicas en línea