Articulo de referencia

Prueba ABX

Una prueba ABX es un método para comparar dos estímulos sensoriales e identificar diferencias perceptibles entre ellos. Se presentan al sujeto dos muestras conocidas (muestra A ...

Una prueba ABX es un método para comparar dos estímulos sensoriales e identificar diferencias perceptibles entre ellos. Se presentan al sujeto dos muestras conocidas (muestra A , la primera referencia, y muestra B , la segunda referencia), seguidas de una muestra desconocida X, seleccionada aleatoriamente entre A y B. El sujeto debe identificar X como A o B. Si X no puede identificarse de forma fiable con un valor p bajo en un número predeterminado de ensayos, no se puede rechazar la hipótesis nula y no se puede demostrar que exista una diferencia perceptible entre A y B.

Las pruebas ABX se pueden realizar fácilmente como ensayos doble ciego , eliminando cualquier posible influencia inconsciente del investigador o del supervisor. Dado que las muestras A y B se proporcionan justo antes de la muestra X, no es necesario discernir la diferencia mediante la memoria a largo plazo ni la experiencia previa. Por lo tanto, la prueba ABX responde si, en las circunstancias de la prueba, se puede encontrar o no una diferencia perceptiva.

Las pruebas ABX se utilizan habitualmente para evaluar métodos de compresión de datos de audio digital . La muestra A suele ser una muestra sin comprimir, y la muestra B es una versión comprimida de A. Mediante pruebas posteriores, se pueden identificar artefactos de compresión audibles que indican deficiencias en el algoritmo de compresión. Las pruebas ABX también permiten comparar los diferentes grados de pérdida de fidelidad entre dos formatos de audio distintos a una tasa de bits determinada .

Las pruebas ABX se pueden utilizar para evaluar los componentes de entrada, procesamiento y salida, así como el cableado: prácticamente cualquier producto de audio o prototipo de diseño.

Historia

La historia de las pruebas y la denominación ABX se remonta a 1950 en un artículo publicado por dos investigadores de Bell Labs , WA Munson y Mark B. Gardner, titulado Estandarización de las pruebas auditivas . [ 1 ]

El propósito de este artículo es describir un procedimiento de prueba que ha demostrado ser prometedor en este sentido y proporcionar descripciones de equipos que han resultado útiles para minimizar la variabilidad de los resultados de la prueba. El procedimiento, que hemos denominado prueba "ABX", es una modificación del método de comparaciones pareadas. A un observador se le presenta una secuencia temporal de tres señales para cada juicio que se le pide que emita. Durante el primer intervalo de tiempo escucha la señal A, durante el segundo, la señal B, y finalmente la señal X. Su tarea consiste en indicar si el sonido escuchado durante el intervalo X se parecía más al del intervalo A o al del intervalo B. Para una prueba de umbral, el intervalo A es silencioso, el intervalo B es señal, y el intervalo X puede ser silencioso o señal.

La prueba ha evolucionado hacia otras variantes, como el control del sujeto sobre la duración y la secuencia de las pruebas. Un ejemplo de ello fue el comparador ABX de hardware en 1977, construido por la empresa ABX en Troy, Michigan, y documentado por uno de sus fundadores, David Clark. [ 2 ]

Mejoras en la prueba A/B

La primera experiencia del autor con las pruebas de audibilidad a doble ciego fue como miembro del Club de Audio SMWTMS a principios de 1977. Se proporcionó un botón que seleccionaba aleatoriamente el componente A o B. Identificar uno de estos, el componente X, se vio muy dificultado por no tener disponibles los componentes A y B conocidos como referencia.

Esto se corrigió utilizando tres pulsadores interconectados: A, B y X. Una vez seleccionada la X, permanecía seleccionada esa A o B en particular hasta que se decidiera pasar a otra selección aleatoria.

Sin embargo, otro problema pronto se hizo evidente. Siempre había un retardo audible en la transición del relé al cambiar de A a B. Al cambiar de A a X, sin embargo, el retardo no aparecía si X era realmente A y sí aparecía si X era realmente B. Esta señal adicional se eliminó insertando un tiempo de interrupción fijo cada vez que se producía un cambio. Se seleccionó un tiempo de interrupción de 50 ms, lo que produce un ligero clic constante a la vez que permite una comparación subjetivamente instantánea.

La empresa ABX ya no existe y, en general, los comparadores de hardware como productos comerciales han desaparecido. Existen numerosas herramientas de software, como el complemento Foobar ABX para realizar comparaciones de archivos. Sin embargo, las pruebas de hardware requieren la creación de implementaciones personalizadas.

Pruebas de hardware

Dos comparadores QSC ABX en un rack de transporte

Los equipos de prueba ABX que utilizan relés para conmutar entre dos rutas de hardware diferentes pueden ayudar a determinar si existen diferencias perceptibles en cables y componentes. Se pueden comparar las rutas de transmisión de vídeo, audio y digital. Si la conmutación está controlada por un microprocesador, es posible realizar pruebas a doble ciego.

Las comparaciones de audio a nivel de altavoz y a nivel de línea podían realizarse con un dispositivo de prueba ABX que QSC Audio Products comercializó como ABX Comparator entre 1998 y 2004. Otras soluciones de hardware fueron fabricadas de forma privada por particulares u organizaciones para pruebas internas.

Confianza

Si solo se realizara una prueba ABX, adivinar al azar implicaría una probabilidad del 50 % de elegir la respuesta correcta, igual que lanzar una moneda. Para hacer una afirmación con cierto grado de confianza , se deben realizar muchas pruebas. Al aumentar el número de pruebas, aumenta la probabilidad de afirmar estadísticamente la capacidad de una persona para distinguir A y B para un nivel de confianza dado. Un nivel de confianza del 95 % se considera comúnmente estadísticamente significativo . [ 2 ] La empresa QSC, en el manual de usuario del ABX Comparator, recomendó un mínimo de diez pruebas de escucha en cada ronda de pruebas. [ 3 ]

QSC recomendó que no se realizaran más de 25 ensayos, ya que la fatiga del sujeto puede aparecer, lo que hace que la prueba sea menos sensible (menos probable que revele la capacidad real de discernir la diferencia entre A y B). [ 3 ] Sin embargo, se puede obtener una prueba más sensible agrupando los resultados de varias pruebas de este tipo utilizando individuos separados o pruebas del mismo sujeto realizadas entre descansos. Para un gran número total de ensayos N, se puede afirmar un resultado significativo (uno con un 95 % de confianza) si el número de respuestas correctas superanorte/2+norte{\displaystyle N/2+{\sqrt {N}}}Las decisiones importantes normalmente se basan en un mayor nivel de confianza, ya que un resultado significativo erróneo se obtendría simplemente por casualidad en una de cada 20 pruebas de este tipo.

Pruebas de software

Los reproductores de audio foobar2000 y Amarok admiten pruebas ABX basadas en software, este último mediante un script de terceros. Lacinato ABX es una herramienta de prueba de audio multiplataforma para Linux, Windows y Mac de 64 bits. Lacinato WebABX es una herramienta ABX de audio basada en web y compatible con varios navegadores. El software de código abierto aveX se desarrolló principalmente para Linux y también permite la monitorización de pruebas desde un ordenador remoto. ABX patcher es una implementación de ABX para Max/MSP . Puede encontrar más software ABX en el sitio web archivado de PCABX.

Pruebas de escucha del códec

Una prueba de escucha de códecs es un estudio científico diseñado para comparar dos o más códecs de audio con pérdida , generalmente con respecto a la fidelidad percibida o la eficiencia de compresión.

Posibles fallos

ABX es un tipo de prueba de elección forzada . Las elecciones de un sujeto pueden basarse en el mérito, es decir, el sujeto intentó honestamente identificar si X parecía más cercano a A o a B. Sin embargo, los sujetos desinteresados ​​o cansados ​​podrían elegir al azar sin siquiera intentarlo. Si no se detecta, esto puede diluir los resultados de otros sujetos que realizaron la prueba con atención y someter el resultado a la paradoja de Simpson , lo que resulta en resultados resumidos falsos. Simplemente observar el total de resultados de la prueba ( m de n respuestas correctas) no permite detectar casos de este problema.

Este problema se agrava si las diferencias son pequeñas. El usuario puede frustrarse y simplemente intentar terminar la prueba votando al azar. En este sentido, las pruebas de elección forzada, como ABX, tienden a favorecer los resultados negativos cuando las diferencias son pequeñas si no se utilizan protocolos adecuados para prevenir este problema.

Las mejores prácticas exigen tanto la inclusión de controles como la selección de sujetos: [ 5 ]

Un aspecto fundamental es la inclusión de condiciones de control adecuadas. Por lo general, estas condiciones incluyen la presentación de material de audio sin alteraciones, introducido de forma impredecible para los sujetos. Son las diferencias entre la evaluación de estos estímulos de control y los potencialmente alterados las que permiten concluir que las calificaciones reflejan fielmente las alteraciones.

3.2.2 Evaluación posterior de los sujetos

Los métodos de post-cribado pueden dividirse, a grandes rasgos, en al menos dos clases: una basada en inconsistencias respecto al resultado medio y otra que se basa en la capacidad del sujeto para realizar identificaciones correctas. La primera clase nunca está justificada. Siempre que se realice una prueba de audición subjetiva con el método de prueba aquí recomendado, la información necesaria para la segunda clase de post-cribado estará disponible automáticamente. En el Anexo 1 se describe un método estadístico sugerido para ello.

Estos métodos se utilizan principalmente para descartar a los sujetos que no pueden realizar las discriminaciones adecuadas. La aplicación de un método posterior al cribado puede aclarar las tendencias en el resultado de una prueba. Sin embargo, teniendo en cuenta la variabilidad de la sensibilidad de los sujetos a diferentes artefactos, se debe actuar con precaución.

Otras deficiencias incluyen la falta de capacitación del personal y de familiarización con la prueba y el contenido seleccionado:

4.1 Fase de familiarización o formación

Antes de la evaluación formal, los participantes deben familiarizarse completamente con las instalaciones, el entorno, el proceso de evaluación, las escalas de calificación y su uso. Asimismo, deben familiarizarse con los objetos que se estudian. Para las pruebas más sensibles, deben tener acceso a todo el material que evaluarán posteriormente en las sesiones de evaluación formal. Durante la familiarización o el entrenamiento, es preferible que los participantes trabajen en grupos (por ejemplo, de tres personas) para que puedan interactuar libremente y comentar los objetos que detectan.

Otros problemas podrían surgir del propio equipo ABX, como lo describe Clark, [ 2 ] donde el equipo proporciona una señal que permite al sujeto identificar la fuente. La falta de transparencia del dispositivo ABX crea problemas similares.

Dado que las pruebas auditivas y muchas otras pruebas sensoriales dependen de la memoria a corto plazo , que dura solo unos segundos, es fundamental que el dispositivo de prueba permita al sujeto identificar segmentos cortos que puedan compararse rápidamente. Asimismo, deben eliminarse los chasquidos y fallos en el aparato de conmutación, ya que pueden enmascarar o interferir con los estímulos que se están evaluando y con lo que se almacena en la memoria a corto plazo del sujeto.

Alternativas

Evaluación de compresión de audio algorítmica

Dado que las pruebas ABX requieren la intervención humana para la evaluación de códecs de audio con pérdidas, resultan laboriosas y costosas. Por ello, se han desarrollado métodos más económicos, como PEAQ , que es una implementación de ODG .

MUSHRA

En MUSHRA , al sujeto se le presenta la referencia (identificada como tal), una cierta cantidad de muestras de prueba, una versión oculta de la referencia y uno o más anclajes. Una escala de calificación de 0 a 100 permite calificar diferencias muy pequeñas, y la versión oculta aún proporciona comprobaciones de discriminación.

Pruebas de discriminación

En las pruebas de discriminación se utilizan métodos generales alternativos , como la comparación por pares, la prueba dúo-trío y la prueba triangular . De estos, la prueba dúo-trío y la prueba triangular son particularmente similares a la prueba ABX. Esquematicamente:

Dúo-trío
AXY – una conocida, dos desconocidas (una es igual a A, la otra es igual a B), la prueba es cuál desconocida es la conocida: X = A (y Y = B), o Y = A (y X = B).
Triángulo
XXY – tres incógnitas (dos son A y una es B o una es A y dos son B), prueba cuál es la diferente : Y = 1, Y = 2 o Y = 3.

En este contexto, la prueba ABX también se conoce como "dúo-trío" en modo de "referencia balanceada": ambos conocidos se presentan como referencias, en lugar de uno solo. [ 6 ]

Véase también

Referencias

  1. Munson, WA; Gardner, Mark B. (1950). "Estandarización de las pruebas auditivas" . The Journal of the Acoustical Society of America . 22 (5). Acoustical Society of America (ASA): 675. Bibcode : 1950ASAJ...22Q.675M . doi : 10.1121/1.1917190 . ISSN 0001-4966 . 
  2. 1 2 3 Clark, David (1 de mayo de 1982). "Pruebas subjetivas de alta resolución utilizando un comparador doble ciego" . Journal of the Audio Engineering Society . 30 (5): 330– 338. Recuperado el 8 de octubre de 2016 .
  3. 1 2 Manual de usuario del comparador QSC ABX. (1998) pág. 10
  4. David Carlstrom. "Probabilidad de que el resultado experimental sea el mismo que el de conjeturas aleatorias" . Página web de ABX . Consultado el 14 de diciembre de 2011 .] en
  5. "Recomendación ITU-R BS.1116-2" (PDF) . Consultado el 8 de octubre de 2016 .
  6. Meilgaard, Morten; Gail Vance Civille; B. Thomas Carr (1999). Técnicas de evaluación sensorial (3.ª ed.). CRC Press. págs. 68–70 . ISBN   0-8493-0276-5.