
El método NM o método de Naszodi-Mendonca es la operación que se puede aplicar en estadística, econometría , economía, sociología y demografía para construir tablas de contingencia contrafactuales . El método encuentra la matriz() que es "más cercano" a matriz(llamada tabla semilla) en el sentido de que se clasifican igual pero con los totales de filas y columnas de una matriz objetivo.Mientras que los totales de filas y los totales de columnas deson conocidos, matrizPuede que no se conozca en sí mismo.
Dado que la solución para la matrizes único, el método NM es una función:, dóndees un vector fila de unos de tamaño, mientrases un vector columna de unos de tamaño.
El método NM fue desarrollado por Naszodi y Mendonca (2023) [ 1 ] (y aplicado por primera vez por Naszodi y Mendonca (2019) [ 2 ] para resolver matricesen problemas, donde matrizno es una muestra de la población caracterizada por los totales de fila y totales de columna de la matrizpero representa a otra población.
Su aplicación tenía como objetivo cuantificar los cambios intergeneracionales en la intensidad de la homofilia educativa y, por lo tanto, medir el cambio histórico en la desigualdad social entre diferentes grupos educativos en los EE. UU. entre 1980 y 2010. Se observó que la tendencia de la desigualdad tenía forma de U, lo que respalda la idea de que con políticas sociales y económicas adecuadas se puede reducir la desigualdad.
Definición de clasificación matricial
La proximidad entre dos matrices del mismo tamaño se puede definir de varias maneras. La distancia euclidiana y la divergencia de Kullback-Leibler son dos ejemplos bien conocidos.
El método NM es consistente con una definición basada en el índice ordinal de Liu-Lu [ 3 ] , que es la versión ligeramente modificada del índice de Coleman definido por la ecuación (15) en James Coleman (1958). [ 4 ] Según esta definición, matrizes "más cercano" a la matriz, si sus valores Liu-Lu son iguales. En otras palabras, si están clasificados de la misma manera por el índice ordinal Liu-Lu.
Sies una matriz de 2×2 , suEl índice escalar de Liu-Lu se define como
, dónde ; ; ; ; .
Siguiendo a James Coleman (1958), [ 4 ] este índice se interpreta como el “valor real menos el valor esperado dividido entre el valor máximo menos el valor mínimo”, dondees el valor real de laentrada de la matriz de semillas;es su valor esperado ( entero ) bajo los supuestos contrafactuales de que el total de fila y columna correspondientes deestán predeterminados, mientras que su interior es aleatorio. Además,es su valor mínimo si la asociación entre la variable de fila y la variable de columna dees no negativo. Finalmente,es el valor máximo de() para el total de fila dadoy total de la columna.
Para matrizde tamaño n×m (,), el índice de Liu-Lu fue generalizado por Naszodi y Mendonca (2023) [ 1 ] a un índice con valores matriciales. Uno de losLas condiciones previas para la generalización son que la variable de fila y la variable de columna de la matrizdeben ser ordenados. Igualando el índice generalizado de Liu-Lu con valores matriciales decon el de matrizes equivalente a dicotomizar su variable de fila ordenada y su variable de columna ordenada.enformas explotando la naturaleza ordenada de las variables de fila y columna. Luego, igualando los índices Liu-Lu escalares originales de las matrices 2×2 obtenidas con las dicotomizaciones. Es decir, para cualquier par de(, y) la restricciónse impone, dondees elmatrizcon su primer bloque de tamañoy su segundo bloque es de tamaño. Similarmente,es elmatriz dada por la transpuesta decon su primer bloque de tamañoy su segundo bloque es de tamaño.
Restricciones en los totales de filas y columnas
Matrizdebe satisfacer no solopero también el par de restricciones sobre los totales de sus filas y totales de columnas:y.
Solución
Suponiendo quepara todos los pares de(dónde, y), la solución paraes único, determinista y viene dado por una fórmula de forma cerrada. [ 1 ]
Para matricesyde tamaño, elLa solución es
.
Las otras 3 células deSe determinan de forma única por los totales de filas y columnas. Así es como funciona el método NM para tablas semilla de 2×2.
Para, ymatrices de tamaño(,), la solución se obtiene dicotomizando su variable de fila ordenada y su variable de columna ordenada de todas las formas significativas posibles antes de resolvernúmero de problemas de forma 2×2. Cada problema se define para unpar (y) cony los totales de filas y columnas objetivo:, y, respectivamente. Cada problema se resolverá por separado mediante la fórmula paraEl conjunto de soluciones determinanúmero de entradas de la matriz. Su restoLos elementos se determinan de forma unívoca mediante los totales de fila y columna de destino.
A continuación, veamos cómo funciona el método NM si la matrizes tal que la segunda condición previa deno se cumple.
Sipara todos los pares de, la solución paraTambién es único, determinista y viene dado por una fórmula de forma cerrada. Sin embargo, el concepto correspondiente de clasificación de matrices es ligeramente diferente al discutido anteriormente . Liu y Lu (2006) [ 3 ] lo definen como, dónde;es el entero más pequeño que sea mayor o igual que.
Finalmente, ni el método NM nise define siemparejar de tal manera que, mientras que para otro par de.
Un ejemplo numérico
Considere la siguiente matrizcomplementado con sus totales de fila y totales de columna y los objetivos, es decir, los totales de fila y totales de columna de la matriz:
Como primer paso del método NM, matrizse multiplica por el, ymatrices para cada par de(, y). Produce las siguientes 9 matrices de tamaño 2×2 con sus totales de filas y columnas objetivo:
El siguiente paso es calcular el índice generalizado de Liu-Lu con valores matriciales., (dónde) aplicando la fórmula del índice escalar original de Liu-Lu a cada una de las 9 matrices:
Aparentemente, matrizes positivo. Por lo tanto, el método NM está definido. Resolver cada uno de los 9 problemas de la forma 2×2 produce 9 entradas de lamatriz. Sus otras 7 entradas están determinadas de forma única por los totales de fila y columna objetivo. La solución paraes:
Otro ejemplo numérico tomado de Abbott et al. (2019)
Considere la siguiente matrizcomplementado con sus totales de fila y totales de columna y los objetivos,es decir, los totales de filas y los totales de columnas de la matriz:
Como primer paso del método NM, matrizse multiplica por el, ymatrices para cada par de(, y). Produce las siguientes 4 matrices de tamaño 2×2 con sus totales de filas y totales de columnas objetivo:
El siguiente paso es calcular el índice generalizado de Liu-Lu con valores matriciales., (dónde) aplicando la fórmula del índice escalar original de Liu-Lu a cada una de las 4 matrices:
Aparentemente, matrizes positivo. Por lo tanto, el método NM está definido. Resolver cada uno de los 4 problemas de la forma 2×2 produce 4 entradas de lamatriz. Sus otras 5 entradas están determinadas de forma única por los totales de fila y columna de destino.La solución paraes:
Implementación
El método NM está implementado en Excel, [ 5 ] Visual Basic, [ 5 ] R, [ 5 ] y también en Stata . [ 6 ]
Aplicaciones
El método NM se puede aplicar para estudiar diversos fenómenos, entre ellos el apareamiento selectivo , la movilidad intergeneracional como un tipo de movilidad social , [ 7 ] la segregación residencial , el reclutamiento y la gestión del talento .
En todas estas aplicaciones, matrices,, yrepresentan distribuciones conjuntas de entidades emparejadas uno a uno (por ejemplo, maridos y mujeres, o primogénitos y madres, o viviendas y arrendatarios principales, o directores ejecutivos y empresas, o instructores de ajedrez y sus alumnos más talentosos) caracterizadas por una variable categórica dicotómica (por ejemplo, tomando valores vegetariano/no vegetariano, Gran Maestro/o no), o una variable categórica multinomial ordenada (por ejemplo, nivel de logro educativo final, nivel de habilidad de los esquiadores, rango de ingresos , categoría de tarifa de alquiler, calificación crediticia , títulos FIDE ). Aunque el método NM tiene un amplio rango de aplicabilidad, todos los ejemplos que se presentarán a continuación tratan sobre el emparejamiento selectivo a lo largo del nivel educativo. En estas aplicaciones, no se discute que se cumplan las dos condiciones previas (de variable de rasgo ordenada y emparejamiento selectivo positivo en todos los grupos educativos).
Supongamos quematrizcaracteriza la distribución educativa conjunta de maridos y esposas en Zimbabue, mientras que la matrizcaracteriza lo mismo en Yemen. MatrizLa construcción mediante el método NM nos indica cuál sería la distribución educativa conjunta de las parejas en Zimbabue, si las distribuciones educativas de maridos y esposas fueran las mismas que en Yemen, mientras que el deseo general de homogamia (también llamado preferencias matrimoniales agregadas en economía, o normas sociales de compatibilidad matrimonial /barreras sociales en sociología) permaneciera inalterado.
En unsegunda aplicación, matricesyCaracterizar el mismo país en dos años diferentes. Matrizes la distribución educativa conjunta de los recién casados estadounidenses en 2040, donde los maridos pertenecen a la Generación Z y son adultos jóvenes al momento de la observación. Matrizes lo mismo pero para la Generación Y observada en el año 2024. Al construir la matrizEn el futuro se podría estudiar cuál sería la distribución educativa entre las parejas jóvenes estadounidenses recién casadas si se casaran de la misma manera que los hombres de la Generación Z y sus parejas, pero con el mismo nivel educativo que los hombres de la Generación Y y sus parejas.
En untercera aplicación, matricesycaracterizar nuevamente al mismo país en dos años diferentes. En esta aplicación, matrizes la distribución educativa conjunta de las parejas jóvenes portuguesas (donde la edad del miembro masculino está entre 30 y 34 años) en 2011.es lo mismo pero se observa en el año 1981. Se puede intentar construir una matrizcon el fin de estudiar cuál habría sido la distribución educativa de las parejas jóvenes portuguesas si se hubieran casado como lo hicieron sus pares en 2011, mientras que sus distribuciones educativas por género hubieran sido las mismas que en 1981.
En cada una de las dos primeras aplicaciones, matrizrepresenta una distribución conjunta contrafactual. Puede utilizarse para cuantificar ciertos efectos ceteris paribus . Más precisamente, para cuantificar en una escala cardinal la diferencia entre el grado directamente inobservable de selección matrimonial en Zimbabue y Yemen, o en la Generación Z y la Generación Y con una descomposición contrafactual. Para la descomposición, la tabla contrafactualse utiliza para calcular la contribución de cada una de las fuerzas impulsoras (es decir, la disponibilidad estructural observada de parejas potenciales con diversos niveles educativos que determinan las oportunidades a nivel de población; y los impulsores no estructurales no observables, por ejemplo, preferencias de emparejamiento agregadas, deseos, normas, barreras) y la de su interacción (es decir, el efecto de los cambios en las preferencias/deseos/normas/barreras agregadas debido a cambios en la disponibilidad estructural) a una estadística cardinal observable escalada (por ejemplo, la proporción de parejas educativamente homogéneas ).
La tercera aplicación fue utilizada por Naszodi y Mendonca (2023) [ 1 ] como ejemplo de un contrafactual sin sentido: el nivel educativo ha cambiado tan drásticamente en Portugal durante las tres décadas estudiadas que este contrafactual es imposible de obtener. Sorprendentemente, un método que se utilizaba comúnmente en la literatura sobre apareamiento selectivo hasta hace poco, proponía una solución para el contrafactual imposible del tercer ejemplo, mientras que el método NM se negaba a construirla.
Algunas características del método NM
En primer lugar, el método NM no produce una solución significativa si alcanza el límite de su aplicabilidad. [ 1 ] Por ejemplo, en la tercera aplicación , el método NM señala con una entrada negativa en la matrizque el contrafactual es imposible (véase: AlternativeMethod_US_1980s_2010s_age3035_main.xls Hoja PT_A1981_P2011_Not_meaningful). [ 5 ] En este sentido, el método NM es similar al modelo de probabilidad lineal que señala lo mismo con una probabilidad predicha fuera del intervalo unitario..
Segundo, el método NM conmuta con la fusión de categorías vecinas de la variable de fila y la de la variable de columna: [ 1 ], dóndees la matriz de fusión de filas de tamaño; y, dóndees la matriz de fusión de columnas de tamaño.
En tercer lugar, el método NM funciona incluso si hay entradas cero en la matriz.. [ 1 ]
Comparación con la FPI
El procedimiento de ajuste proporcional iterativo (IPF) también es una función: [ 8 ] [ 9 ] [ 10 ] [ 11 ]Es la operación de encontrar la matriz ajustada() que cumple un conjunto de condiciones similares a las que cumple la matrizconstruido con el método NM. Por ejemplo, matrizes lo más cercano a la matrizpero con los totales de filas y columnas de la matriz objetivo.
Sin embargo, existen diferencias entre el IPF y el método NM. El IPF define la proximidad de matrices del mismo tamaño mediante la entropía cruzada o la divergencia de Kullback-Leibler . [ 12 ] En consecuencia, el concepto de distancia compatible con el IPF entre las matrices de 2×2yes cero, si sus razones de producto cruzado [ 11 ] (también conocida como razón de probabilidades ) son las mismas:. [ 13 ] Para recordar, la condición del método NM para la clasificación igual de matricesyes.
El siguiente ejemplo numérico pone de manifiesto que el método IPF y el método NM no son idénticos:. Consideremos la matrizcon sus objetivos :
El método NM produce la siguiente matriz.:
Mientras que la solución para la matrizEl resultado obtenido con el IPF es:
El IPF es equivalente al estimador de máxima verosimilitud [ 10 ] de una distribución de población conjunta, donde matriz(la estimación para la distribución conjunta de la población) se calcula a partir de la matriz, la distribución conjunta observada en una muestra aleatoria tomada de la población caracterizada por los totales de fila y totales de columna de la matriz. En contraste con el problema resuelto por el IPF, matrizno se muestrea de esta población en el problema que el método NM fue desarrollado para resolver. De hecho, en el problema NM, las matricesycaracterizar dos poblaciones diferentes (ya sea observadas simultáneamente como en la aplicación para Zimbabue y Yemen , u observadas en dos momentos diferentes como en su aplicación para las poblaciones de la Generación Z y la Generación Y ). Esta diferencia facilita la elección entre el método NM y el IPF en aplicaciones empíricas. [ 13 ]
Deming y Stephan (1940), [ 14 ] los inventores del IPF, ilustraron la aplicación de su método en un problema clásico de estimación de máxima verosimilitud, donde matrizse muestreó de la población caracterizada por los totales de fila y los totales de columna de la matrizEran conscientes de que, en general, el IPF no es adecuado para predicciones contrafactuales: advirtieron explícitamente que su algoritmo “no es útil por sí mismo para la predicción” (véase Stephan y Deming 1940, pág. 444). [ 14 ] [ 13 ]
Además, los dominios para los que el método IPF y el método NM proporcionan soluciones son diferentes. En primer lugar, a diferencia del método NM, el método IPF no proporciona una solución para todas las tablas de semillas.con entradas cero (Csiszár (1975) [ 15 ] encontró condiciones necesarias y suficientes para aplicar el IPF con tablas generales que tienen entradas cero). Segundo, la condición previa del método NM (de cualquiera de laso) no es una condición previa para la aplicabilidad del IPF.En tercer lugar, a diferencia del NM, el IPF proporciona una solución aparentemente significativa para pares de matrices.ydefiniendo contrafactuales imposibles, como el par de matrices en nuestro tercer ejemplo numérico con Portugal (Naszodi 2025 [ 16 ] ).
Finalmente, a diferencia del NM, el IPF no conmuta con la operación de fusionar categorías vecinas de la variable de fila y la de la variable de columna, como se ilustra con un ejemplo numérico en Naszodi (2023) (véase la página 10). [ 17 ] Por esta razón, la tabla transformada obtenida con el IPF puede ser sensible a la elección del número de categorías de rasgos.
Kenneth Macdonald (2023) [ 18 ] está de acuerdo con la conclusión de Naszodi (2023) [ 19 ] de que la IPF es adecuada para tareas de corrección de muestreo, pero no para la generación de contrafactuales. De manera similar a Naszodi, Macdonald también cuestiona si las transformaciones proporcionales de filas y columnas de la IPF preservan la estructura de asociación dentro de una tabla de contingencia que nos permita estudiar la movilidad social.
Comparación con el método de distancia euclidiana mínima
El Enfoque de Distancia Euclidiana Mínima (MEDA) (definido por Abbott et al., 2019 siguiendo a Fernández y Rogerson, 2001) también es una función: [ 20 ] [ 21 ].
Primero, MEDA asigna un escalar a la matriz.: es el peso utilizado para construir la combinación convexa de dos casos extremos (emparejamiento aleatorio y perfectamente asociativo con el par de marginales)) minimizando la distancia euclidiana conPor ejemplo, este escalar esen el ejemplo numérico tomado de Abbott et al. (2019) . [ 20 ] Segundo, para cualquier par de distribuciones marginales contrafactuales () el MEDA construye la combinación convexa de los dos casos extremos (coincidencias aleatorias y perfectamente asociativas con el par de marginales ()).
Diferencias entre el NM y el MEDA: mientras que el NM mantiene la asortatividad sin cambios al conservar el índice generalizado de Liu-Lu con valores matriciales.fijo, el MEDA hace lo mismo manteniendo el escalarfijo. Para, ymatrices de tamañoLos dos métodos producen la misma tabla transformada proporcionada.clasifica las tablas de contingencia de la misma manera que lo hace el índice escalar de Liu-Lu. [ 22 ] Sin embargo, paraPara matrices mayores que 2×2, el índice generalizado de Liu-Lu es de valor matricial, por lo que es diferente del de valor escalar.Por lo tanto, la tabla transformada mediante NM también es diferente de la tabla transformada mediante MEDA.
Por ejemplo, en el ejemplo numérico tomado de Abbott et al. (2019) , la tabla contrafactual construida por MEDA es la matriz:
La diferencia entre matrizy matrizno es insignificante. Por ejemplo, la proporción de parejas homogéneas es 2 puntos porcentuales menor en la matriz contrafactual construida por MEDA.que en la matriz observada, mientras que es 3,4 puntos porcentuales menor en la matriz contrafactual construida por NM.relativo a.
Dado que el ejemplo de Abbott no es ficticio, sino que se basa en la distribución educativa empírica de las parejas estadounidenses, la diferencia entre 2 puntos porcentuales y 3,4 puntos porcentuales puede interpretarse como que el MEDA cuantifica los cambios en la desigualdad de una generación a otra de manera significativamente menor en comparación con el NM.
Véase también
Enlaces externos
- Método generalizado de Naszodi-Mendonca (método GNM) Naszodi, A.; Mendonca, F. (2021). "Un nuevo método para identificar qué está haciendo la mano invisible de Cupido. ¿Está propagando el daltonismo mientras nos vuelve más "exigentes" con respecto a la educación conyugal?". arXiv : 2103.06991 [ econ.GN ].
Referencias
- 1 2 3 4 5 6 7 Naszodi, A.; Mendonca, F. (2023). "Un nuevo método para identificar el papel de las preferencias matrimoniales en la configuración de los patrones matrimoniales" . Journal of Demographic Economics . 1 (1): 1– 27. doi : 10.1017/dem.2021.1 .
- ↑ Naszodi, A.; Mendonca, F. (2019). "Lo semejante atrae a lo semejante" . Serie de informes sobre políticas de equidad . Archivado del original (PDF) el 30 de marzo de 2023.
- 1 2 Liu, H.; Lu, J. (2006). "Medición del grado de apareamiento selectivo" . Economics Letters . 92 (3): 317– 322. doi : 10.1016/j.econlet.2006.03.010 .
- 1 2 Coleman, J. (1958). "Análisis relacional: El estudio de las organizaciones sociales con métodos de encuesta". Human Organization . 17 (4): 28– 36. doi : 10.17730/humo.17.4.q5604m676260q8n7 .
- 1 2 3 4 Naszodi, Anna; Mendonca, Francisco (2021). "Código para un nuevo método" . 2 . Mendeley. doi : 10.17632/x2ry7bcm95.2 .
{{cite journal}}: Para citar una revista se requiere|journal=( ayuda ) - ↑ Naszodi, Anna; Mendonca, Francisco (2023). "Assortative Mating" . Código para "Un nuevo método para identificar lo que hace la mano invisible de Cupido. ¿Está propagando el daltonismo mientras nos vuelve más "exigentes" con la educación conyugal?" . Vol. 2. Mendeley. doi : 10.17632/95k6mmrxvg .
- ↑ Naszodi, A.; Cuccu, L. (2024). "¿Son los títulos de bachillerato y los diplomas universitarios igualmente heredables en EE. UU.? Una nueva medida de movilidad intergeneracional relativa". Journal of Applied Economics . 28 (3) 2432803. doi : 10.1080/15140326.2024.2432803 .
- ↑ Sinkhorn, Richard (1964). “Una relación entre matrices positivas arbitrarias y matrices doblemente estocásticas”. En: Annals of Mathematical Statistics 35.2, pp. 876–879.
- ↑ Bacharach, Michael (1965). “Estimación de matrices no negativas a partir de datos marginales”. En: International Economic Review 6.3, pp. 294–310.
- 1 2 Bishop, YMM (1967). "Tablas de contingencia multidimensionales: estimaciones de celdas". Tesis doctoral. Universidad de Harvard .
- 1 2 Fienberg, SE (1970). " Un procedimiento iterativo para la estimación en tablas de contingencia" . Annals of Mathematical Statistics . 41 (3): 907– 917. doi : 10.1214/aoms/1177696968 . JSTOR 2239244. MR 0266394. Zbl 0198.23401 .
- ↑ Kullback S. y Leibler RA (1951) Sobre información y suficiencia, Annals of Mathematics and Statistics, 22 (1951) 79-86.
- 1 2 3 Naszodi, A. (2023). "El algoritmo de ajuste proporcional iterativo y el método NM: soluciones para dos conjuntos diferentes de problemas". arXiv : 2303.05515 [ econ.GN ].
- 1 2 Deming, WE ; Stephan, FF (1940). "Sobre un ajuste por mínimos cuadrados de una tabla de frecuencias muestreada cuando se conocen los totales marginales esperados" . Annals of Mathematical Statistics . 11 (4): 427– 444. doi : 10.1214/aoms/1177731829 . MR 0003527 .
- ↑ Csiszár, I. (1975). " I -Divergencia de distribuciones de probabilidad y problemas de minimización" . Annals of Probability . 3 (1): 146– 158. doi : 10.1214/aop/1176996454 . JSTOR 2959270 . MR 0365798 . Zbl 0318.60013 .
- ↑ Naszodi, A. (2025). Nuevos métodos para medir la desigualdad mediante el análisis del apareamiento selectivo . Serie Springer sobre métodos demográficos y análisis de poblaciones. Springer Cham. ISBN 978-3-031-98276-7.
- ↑ Naszodi, A. (2023). "¿Qué dicen las encuestas sobre la tendencia histórica de la desigualdad y la aplicabilidad de dos métodos de transformación de tablas?". arXiv : 2303.05895 [ econ.GN ].
- ↑ Macdonald, K. (2023). "El ajuste marginal de las tablas de movilidad, una revisión" . OSF : 1–19 .
- ↑ Naszodi, A. (2023). "El algoritmo de ajuste proporcional iterativo y el método NM: soluciones para dos conjuntos diferentes de problemas". arXiv : 2303.05515 [ econ.GN ].
- 1 2 Abbott, B.; Gallipoli, G.; Meghir, C.; Violante, GL (2019). "Política educativa y transferencias intergeneracionales en equilibrio" . Journal of Political Economy . 127 (6): 2569– 2624. doi : 10.1086/702241 . hdl : 10419/173937 . S2CID 14693929 .
- ↑ Fernández, R.; Rogerson, R. (2001). "Sorting and long-run inequality" (PDF) . The Quarterly Journal of Economics . 116 (4): 1305– 1341. doi : 10.1162/003355301753265589 .
- ↑ Chiappori, PA.; Costa-Dias, M.; Meghir, C. (2021). "La medición de la selectividad en el matrimonio: un comentario". Cowles Foundation Discussion Paper NO. 2316 .
- Tabla de contingencia