El Corpus de Aceptabilidad Lingüística (CoLA) es un conjunto de datos cuyo propósito principal es servir como referencia para evaluar la capacidad de las redes neuronales artificiales, incluidos los grandes modelos de lenguaje , para juzgar la corrección gramatical de las oraciones. Consta de 10.657 oraciones en inglés procedentes de literatura lingüística publicada que fueron etiquetadas manualmente como gramaticales o agramaticales. [ 1 ]
Versión pública
La versión pública de CoLA contiene 9.594 oraciones que pertenecen a los conjuntos de entrenamiento y desarrollo. Excluye 1.063 oraciones reservadas para un conjunto de prueba independiente.
Enlaces externos
- Warstadt, Alex. "CoLA - El Corpus de Aceptabilidad Lingüística" .
Referencias
- Procesamiento del lenguaje natural
- Stubs de procesamiento del lenguaje natural