Articulo de referencia

Análisis de supervivencia

El análisis de supervivencia es una rama de la estadística que analiza la duración esperada del tiempo hasta que ocurre un evento, como la muerte en organismos biológicos y la f...

El análisis de supervivencia es una rama de la estadística que analiza la duración esperada del tiempo hasta que ocurre un evento, como la muerte en organismos biológicos y la falla en sistemas mecánicos. [ 1 ] Este tema se denomina teoría de la confiabilidad , análisis de confiabilidad o ingeniería de confiabilidad en ingeniería , análisis de duración o modelado de duración en economía , y análisis de historia de eventos en sociología . El análisis de supervivencia intenta responder ciertas preguntas, tales como ¿cuál es la proporción de una población que sobrevivirá más allá de un cierto tiempo? De los que sobreviven, ¿a qué tasa morirán o fallarán? ¿Se pueden considerar múltiples causas de muerte o falla? ¿Cómo aumentan o disminuyen las circunstancias o características particulares la probabilidad de supervivencia ?

Para responder a estas preguntas, es necesario definir el término "vida útil". En el caso de la supervivencia biológica, la muerte es inequívoca, pero en la fiabilidad mecánica, el fallo puede no estar bien definido, ya que pueden existir sistemas mecánicos en los que el fallo sea parcial, de grado variable o no localizado en el tiempo . Incluso en problemas biológicos, algunos eventos (por ejemplo, un infarto u otro fallo orgánico) pueden presentar la misma ambigüedad. La teoría que se describe a continuación presupone eventos bien definidos en momentos específicos; otros casos podrían abordarse mejor con modelos que tengan en cuenta explícitamente los eventos ambiguos.

En términos más generales, el análisis de supervivencia implica el modelado de datos de tiempo hasta el evento; en este contexto, la muerte o el fallo se consideran un "evento" en la literatura sobre análisis de supervivencia. Tradicionalmente, solo ocurre un único evento por sujeto, tras el cual el organismo o mecanismo muere o se avería. [ 2 ] Los modelos de eventos recurrentes o repetidos flexibilizan esta suposición. El estudio de los eventos recurrentes es relevante en la fiabilidad de los sistemas y en muchas áreas de las ciencias sociales y la investigación médica.

Introducción al análisis de supervivencia

El análisis de supervivencia se utiliza de varias maneras:

Definiciones de términos comunes en el análisis de supervivencia

Los siguientes términos se utilizan comúnmente en los análisis de supervivencia: [ 3 ]

  • Evento: Muerte, aparición de enfermedad, recurrencia de la enfermedad, recuperación u otra experiencia de interés.
  • Tiempo: El tiempo desde el inicio de un período de observación (como una cirugía o el inicio del tratamiento) hasta (i) un evento, o (ii) el final del estudio, o (iii) la pérdida de contacto o el retiro del estudio.
  • Censura / Observación censurada: La censura se produce cuando disponemos de información sobre el tiempo de supervivencia de un individuo, pero desconocemos dicho tiempo con exactitud. El sujeto queda censurado en el sentido de que no se observa ni se conoce nada sobre él después del momento de la censura. Un sujeto censurado puede o no experimentar algún evento tras finalizar el periodo de observación.
  • Función de supervivencia S(t): La probabilidad de que un sujeto sobreviva más tiempo que t.

Ejemplo: Datos de supervivencia de la leucemia mielógena aguda

Este ejemplo utiliza el conjunto de datos de supervivencia de leucemia mielógena aguda "aml" del paquete "survival" en R. El conjunto de datos es de Miller (1997) [ 4 ] y la pregunta es si el curso estándar de quimioterapia debe extenderse ("mantenerse") para ciclos adicionales.

En el recuadro se muestra el conjunto de datos aml ordenado por tiempo de supervivencia.

  • El tiempo se indica mediante la variable "tiempo", que es el tiempo de supervivencia o de censura.
  • El evento (recurrencia del cáncer de leucemia mieloide aguda) se indica mediante la variable "estado". 0  = sin evento (censurado), 1  = evento (recurrencia).
  • Grupo de tratamiento: la variable "x" indica si se administró quimioterapia de mantenimiento.

La última observación (11), a las 161 semanas, está censurada. La censura indica que el paciente no tuvo un evento (sin recurrencia del cáncer de LMA). Otro sujeto, la observación 3, fue censurado a las 13 semanas (indicado por status=0). Este sujeto estuvo en el estudio solo durante 13 semanas, y el cáncer de LMA no recurrió durante ese período. Es posible que este paciente se haya inscrito cerca del final del estudio, por lo que solo se le pudo observar durante 13 semanas. También es posible que el paciente se haya inscrito al principio del estudio, pero se haya perdido el seguimiento o se haya retirado del estudio. La tabla muestra que otros sujetos fueron censurados a las 16, 28 y 45 semanas (observaciones 17, 6 y  9 con status=0). Todos los sujetos restantes experimentaron eventos (recurrencia del cáncer de LMA) mientras estaban en el estudio. La pregunta de interés es si la recurrencia ocurre más tarde en los pacientes que recibieron mantenimiento que en los que no lo recibieron.

Gráfico de Kaplan-Meier para los datos de AML

La función de supervivencia S ( t ) es la probabilidad de que un sujeto sobreviva más tiempo que t . S ( t ) es teóricamente una curva suave, pero generalmente se estima utilizando la curva de Kaplan-Meier (KM). [ 5 ] El gráfico muestra la gráfica de KM para los datos aml y se puede interpretar de la siguiente manera:

  • El eje x representa el tiempo, desde el momento cero (cuando comenzó la observación) hasta el último punto temporal observado.
  • El eje Y representa la proporción de sujetos que sobreviven. En el momento cero, el 100% de los sujetos están vivos sin que se haya producido ningún evento.
  • La línea continua (similar a una escalera) muestra la progresión de los sucesos.
  • Una caída vertical indica un evento. En la tabla aml mostrada arriba, dos sujetos presentaron eventos a las cinco semanas, dos a las ocho semanas, uno a las nueve semanas, y así sucesivamente. Estos eventos a las cinco, ocho semanas, etc., se indican mediante las caídas verticales en el gráfico KM en esos momentos.
  • En el extremo derecho del gráfico de Kaplan-Meier hay una marca en la semana 161. Esta marca vertical indica que un paciente fue censurado en ese momento. En la tabla de datos de leucemia mieloide aguda (LMA), cinco sujetos fueron censurados a las 13, 16, 28, 45 y 161 semanas. En el gráfico de Kaplan-Meier hay cinco marcas que corresponden a estas observaciones censuradas.

Tabla de vida para los datos aml

Una tabla de vida resume los datos de supervivencia en términos del número de eventos y la proporción de individuos que sobreviven en cada momento. A continuación,  se muestra la tabla de vida para los datos aml, creada con el software R.

La tabla de vida resume los eventos y la proporción de supervivientes en cada momento. Las columnas de la tabla de vida tienen la siguiente interpretación:

  • El tiempo indica los momentos en que ocurren los eventos.
  • n.riesgo es el número de sujetos en riesgo inmediatamente antes del punto temporal t. Estar "en riesgo" significa que el sujeto no ha tenido un evento antes del tiempo t y no está censurado antes o en el tiempo t.
  • n.evento es el número de sujetos que tienen eventos en el tiempo t.
  • La supervivencia es la proporción de individuos que sobreviven, determinada mediante la estimación del producto límite de Kaplan-Meier.
  • std.err es el error estándar de la supervivencia estimada. El error estándar de la estimación del producto límite de Kaplan-Meier se calcula utilizando la fórmula de Greenwood y depende del número de individuos en riesgo (n.risk en la tabla), el número de fallecimientos (n.event en la tabla) y la proporción de supervivientes (survival en la tabla).
  • El IC inferior del 95 % y el IC superior del 95 % son los límites de confianza inferior y superior del 95 % para la proporción de supervivientes.

Prueba de log-rank: Prueba de diferencias en la supervivencia en los datos de leucemia mieloide aguda (LMA).

La prueba de log-rank compara los tiempos de supervivencia de dos o más grupos. [ 6 ] Este ejemplo utiliza una prueba de log-rank para detectar diferencias en la supervivencia entre los grupos de tratamiento con y sin mantenimiento en los datos de aml. El gráfico muestra diagramas de Kaplan-Meier para los datos de aml desglosados ​​por grupo de tratamiento, indicado por la variable "x" en los datos.

Gráfico de Kaplan-Meier por grupo de tratamiento en aml

La hipótesis nula para una prueba de log-rank es que los grupos tienen la misma supervivencia. El número esperado de sujetos que sobreviven en cada punto temporal en cada grupo se ajusta según el número de sujetos en riesgo en los grupos en cada momento del evento. La prueba de log-rank determina si el número observado de eventos en cada grupo es significativamente diferente del número esperado. [ 7 ] La prueba formal se basa en un estadístico chi-cuadrado. Cuando el estadístico de log-rank es grande, es evidencia de una diferencia en los tiempos de supervivencia entre los grupos. El estadístico de log-rank tiene aproximadamente una distribución chi-cuadrado con un grado de libertad, y el valor p se calcula utilizando la prueba chi-cuadrado .

Para los datos de ejemplo, la prueba de log-rank para la diferencia en la supervivencia arroja un valor p de p=0,0653, lo que indica que los grupos de tratamiento no difieren significativamente en la supervivencia, asumiendo un nivel alfa de 0,05. El tamaño de la muestra de 23 sujetos es modesto, por lo que hay poca potencia para detectar diferencias entre los grupos de tratamiento. La prueba de chi-cuadrado se basa en una aproximación asintótica, por lo que el valor p debe interpretarse con precaución para tamaños de muestra pequeños . [ 8 ]

Análisis de regresión de riesgos proporcionales de Cox (PH)

Las curvas de Kaplan-Meier y las pruebas de log-rank son más útiles cuando la variable predictora es categórica (p. ej., fármaco vs. placebo) o toma un número pequeño de valores (p. ej., dosis de fármaco de 0, 20, 50 y 100  mg/día) que pueden tratarse como categóricos. [ 9 ] La prueba de log-rank y las curvas KM no funcionan fácilmente con predictores cuantitativos como la expresión génica, el recuento de glóbulos blancos o la edad. Para variables predictoras cuantitativas, un método alternativo es el análisis de regresión de riesgos proporcionales de Cox . Los modelos de riesgos proporcionales de Cox también funcionan con variables predictoras categóricas, que se codifican como variables indicadoras o ficticias {0,1}. La prueba de log-rank es un caso especial de un análisis de riesgos proporcionales de Cox y puede realizarse utilizando el software de riesgos proporcionales de Cox.

Ejemplo: Análisis de regresión de riesgos proporcionales de Cox para el melanoma

Este ejemplo utiliza el conjunto de datos de melanoma del capítulo 14 de Dalgaard. [ 10 ]

Los datos se encuentran en el paquete ISwR de R. La regresión de riesgos proporcionales de Cox, realizada con  R, proporciona los resultados que se muestran en el recuadro.

Resultados de la regresión de riesgos proporcionales de Cox para datos de melanoma. La variable predictora es sexo: 1: femenino, 2: masculino.

Los resultados de la regresión de Cox se interpretan de la siguiente manera.

  • El sexo se codifica como un vector numérico (1: mujer, 2: hombre). El  resumen de R para el modelo de Cox proporciona la razón de riesgo (HR) para el segundo grupo en relación con el primero, es decir, hombres frente a mujeres.
  • coef = 0,662 es el logaritmo estimado de la razón de riesgo para hombres versus mujeres.
  • exp(coef) = 1,94 = exp(0,662) - El logaritmo del cociente de riesgos (coef = 0,662) se transforma en el cociente de riesgos mediante exp(coef). El resumen del modelo de Cox proporciona el cociente de riesgos para el segundo grupo en relación con el primero, es decir, hombres frente a mujeres. El cociente de riesgos estimado de 1,94 indica que los hombres tienen un mayor riesgo de muerte (menores tasas de supervivencia) que las mujeres, según estos datos.
  • se(coef) = 0,265 es el error estándar del logaritmo del cociente de riesgos.
  • z = 2,5 = coef/se(coef) = 0,662/0,265. Dividiendo el coeficiente por su error estándar se obtiene la puntuación z.
  • p=0,013. El valor p correspondiente a z=2,5 para el sexo es p=0,013, lo que indica que existe una diferencia significativa en la supervivencia en función del sexo.

El resumen de resultados también proporciona intervalos de confianza del 95% superior e inferior para la razón de riesgo: límite inferior del 95% = 1,15; límite superior del 95% = 3,26.

Finalmente, el resultado proporciona valores p para tres pruebas alternativas de significancia general del modelo:

  • Prueba de razón de verosimilitud = 6,15 con 1 grado de libertad, p = 0,0131
  • Prueba de Wald = 6,24 en 1 grado de libertad, p = 0,0125
  • Puntuación (prueba de log-rank) = 6,47 en 1 gl, p=0,0110

Estas tres pruebas son asintóticamente equivalentes. Para un N suficientemente grande, arrojarán resultados similares. Para un N pequeño, pueden diferir ligeramente. La última fila, "Prueba de puntuación (logrank)", muestra el resultado de la prueba log-rank, con p=0,011, el mismo resultado que la prueba log-rank, ya que esta última es un caso especial de una regresión de riesgos proporcionales de Cox. La prueba de razón de verosimilitud presenta un mejor comportamiento para tamaños de muestra pequeños, por lo que generalmente se prefiere.

Modelo de Cox utilizando una covariable en los datos de melanoma

El modelo de Cox extiende la prueba de log-rank al permitir la inclusión de covariables adicionales. [ 11 ] Este ejemplo utiliza el conjunto de datos de melanoma donde las variables predictoras incluyen una covariable continua, el grosor del tumor (nombre de la variable = "thick").

Histogramas del espesor del tumor de melanoma

En los histogramas, los valores de espesor presentan asimetría positiva y no siguen una distribución de probabilidad simétrica tipo Gaussiana . Los modelos de regresión, incluido el modelo de Cox, generalmente ofrecen resultados más fiables con variables que siguen una distribución normal. Para este ejemplo, podemos utilizar una transformación logarítmica . El logaritmo del espesor del tumor parece seguir una distribución más normal, por lo que los modelos de Cox utilizarán el logaritmo del espesor. El análisis de riesgos proporcionales de Cox mediante R proporciona los resultados que se muestran a continuación.

biblioteca ( ISwR ) # CRAN v2.0-11 biblioteca ( supervivencia ) # CRAN v3.8-3# Ejecutar análisis de riesgos proporcionales de Cox para el conjunto de datos de melanoma con la covariable logaritmo del grosor del tumor f <- coxph ( Surv ( days , status == 1 ) ~ sex + log ( thick ), data = melanom )# Mostrar resumen de salida de Cox PH ( f ) # Llamada: # coxph(formula = Surv(days, status == 1) ~ sex + log(thick), data = melanom) # # n= 205, número de eventos= 57 # # coef exp(coef) se(coef) z Pr(>|z|) # sex 0.4580 1.5809 0.2687 1.705 0.0883 . # log(thick) 0.7809 2.1834 0.1573 4.963 6.94e-07 *** # --- # Códigos de significancia: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1 # # exp(coef) exp(-coef) inferior .95 superior .95 # sexo 1.581 0.6326 0.9337 2.677 # log(grosor) 2.183 0.4580 1.6040 2.972 # # Concordancia = 0.749 (se = 0.033 ) # Prueba de razón de verosimilitud = 33.45 en 2 gl, p=5e-08 # Prueba de Wald = 31 en 2 gl, p=2e-07 # Prueba de puntuación (logrank) = 32.52 en 2 gl, p=9e-08

El valor p para las tres pruebas generales (verosimilitud, Wald y puntuación) es significativo, lo que indica que el modelo es significativo. El valor p pararegistro(grueso){\displaystyle \log({\text{grueso}})}es6,94 × 10 −7 , con una razón de riesgoHR=exp(coeficiente)=2.183{\displaystyle HR=\exp({\text{coef}})=2.183}, lo que indica una fuerte relación entre el grosor del tumor y un mayor riesgo de muerte.

Por el contrario, el valor p parasexo{\displaystyle {\text{sexo}}}ahora espag=0,088{\displaystyle p=0.088}. El índice de riesgoHR=exp(coeficiente)=1.581{\displaystyle HR=\exp({\text{coef}})=1.581}, con un intervalo de confianza del 95% de 0,9337 a 2,677. Debido a que el intervalo de confianza para HR incluye 1, estos resultados indican que el sexo contribuye en menor medida a la diferencia en el HR después de controlar el grosor del tumor. Examen de los gráficos delogramo(grueso){\displaystyle log({\text{grueso}})}por sexo y una prueba t delogramo(grueso){\displaystyle log({\text{grueso}})}Según el sexo, ambos indican que existe una diferencia significativa entre hombres y mujeres en el grosor del tumor cuando acuden por primera vez al médico.

El modelo de Cox asume que los riesgos son proporcionales. Esta suposición de riesgos proporcionales puede comprobarse mediante la  función cox.zph()`survival` del paquete R. Un valor p inferior a 0,05 indica que los riesgos no son proporcionales.

cox.zph ( f ) # chisq df p # sexo 1.33 1 0.248 # log(grueso) 6.23 1 0.013 # GLOBAL 6.70 2 0.035

Para los datos de melanoma, obtenemospag=0,248{\displaystyle p=0.248}para el sexo. Por lo tanto, no podemos rechazar la hipótesis nula de que los riesgos del sexo sean proporcionales.

Extensiones a los modelos de Cox

Los modelos de Cox pueden extenderse para abordar variaciones del análisis simple.

  • Estratificación. Los sujetos se pueden dividir en estratos, donde se espera que los sujetos dentro de un estrato sean relativamente más similares entre sí que a sujetos elegidos aleatoriamente de otros estratos. Se supone que los parámetros de regresión son los mismos en todos los estratos, pero puede existir un riesgo basal diferente para cada estrato. La estratificación es útil para análisis con sujetos emparejados, para trabajar con subconjuntos de pacientes, como diferentes clínicas, y para abordar violaciones del supuesto de riesgos proporcionales.
  • Covariables que varían con el tiempo. Algunas variables, como el sexo y el grupo de tratamiento, generalmente permanecen constantes en un ensayo clínico. Otras variables clínicas, como los niveles de proteínas séricas o la dosis de medicamentos concomitantes, pueden cambiar a lo largo del estudio. Los modelos de Cox pueden ampliarse para incluir estas covariables que varían con el tiempo.

Modelos de supervivencia con estructura de árbol

El modelo de regresión de riesgos proporcionales de Cox es un modelo lineal. Es similar a la regresión lineal y a la regresión logística. Específicamente, estos métodos asumen que una sola línea, curva, plano o superficie es suficiente para separar grupos (vivos, muertos) o para estimar una respuesta cuantitativa (tiempo de supervivencia).

En algunos casos, las particiones alternativas proporcionan una clasificación o estimaciones cuantitativas más precisas. Un conjunto de métodos alternativos son los modelos de supervivencia con estructura de árbol, [ 12 ] [ 13 ] [ 14 ] incluyendo bosques aleatorios de supervivencia. [ 15 ] Los modelos de supervivencia con estructura de árbol pueden ofrecer predicciones más precisas que los modelos de Cox. Examinar ambos tipos de modelos para un conjunto de datos determinado es una estrategia razonable.

Ejemplo de análisis de árbol de supervivencia

Este ejemplo de análisis de árbol de supervivencia utiliza el  paquete "rpart" de R. [ 16 ] El ejemplo se basa en 146  pacientes con cáncer de próstata en estadio C del conjunto de datos stagec en rpart. Rpart y el ejemplo stagec se describen en Atkinson y Therneau (1997), [ 17 ] que también se distribuye como una viñeta del paquete rpart. [ 16 ]

Las variables en las etapas son:

  • pgtime : tiempo hasta la progresión o último seguimiento sin progresión.
  • pgstat : estado en el último seguimiento (1=progresó, 0=censurado)
  • edad : edad al momento del diagnóstico
  • eet : terapia endocrina temprana (1=no, 0=sí)
  • ploidía : patrón de ADN diploide/tetraploide/aneuploide
  • g2 :  % de células en fase G2
  • grado : grado del tumor (1-4)
  • Gleason : Grado de Gleason (3-10)

El árbol de supervivencia generado por el análisis se muestra en la figura.

Árbol de supervivencia para el conjunto de datos de cáncer de próstata

Cada rama del árbol indica una división según el valor de una variable. Por ejemplo, la raíz del árbol divide a los sujetos con una calificación inferior a 2,5 frente a los sujetos con una calificación igual o superior a 2,5. Los nodos terminales indican el número de sujetos en el nodo, el número de sujetos que presentan eventos y la tasa relativa de eventos en comparación con la raíz. En el nodo de la izquierda, los valores 1/33 indican que uno de los 33 sujetos del nodo presentó un evento y que la tasa relativa de eventos es de 0,122. En el nodo inferior derecho, los valores 11/15 indican que 11 de los 15 sujetos del nodo presentaron un evento y que la tasa relativa de eventos es de 2,7.

bosques aleatorios de supervivencia

Una alternativa a la construcción de un único árbol de supervivencia es construir muchos árboles de supervivencia, donde cada árbol se construye utilizando una muestra de los datos y se promedian los árboles para predecir la supervivencia. [ 15 ] Este es el método subyacente a los modelos de bosques aleatorios de supervivencia. El análisis de bosques aleatorios de supervivencia está disponible en el  paquete de R "randomForestSRC". [ 18 ]

El paquete randomForestSRC incluye un ejemplo de análisis de supervivencia mediante bosques aleatorios utilizando el conjunto de datos pbc. Estos datos provienen del ensayo clínico de la Clínica Mayo sobre cirrosis biliar primaria (CBP) hepática, realizado entre 1974 y 1984. En el ejemplo, el modelo de supervivencia de bosques aleatorios ofrece predicciones de supervivencia más precisas que el modelo de riesgos proporcionales de Cox. Los errores de predicción se estiman mediante remuestreo bootstrap .

Modelos de supervivencia de aprendizaje profundo

Los avances recientes en el aprendizaje de representación profunda se han extendido a la estimación de supervivencia. El modelo DeepSurv [ 19 ] propone reemplazar la parametrización log-lineal del modelo CoxPH con un perceptrón multicapa. Otras extensiones, como Deep Survival Machines [ 20 ] y Deep Cox Mixtures [ 21 ], implican el uso de modelos de mezcla de variables latentes para modelar la distribución del tiempo hasta el evento como una mezcla de distribuciones paramétricas o semiparamétricas, mientras se aprenden conjuntamente representaciones de las covariables de entrada. Los enfoques de aprendizaje profundo han demostrado un rendimiento superior, especialmente en modalidades de datos de entrada complejas, como imágenes y series temporales clínicas.

Formulación general

Función de supervivencia

El objeto de interés primordial es la función de supervivencia , convencionalmente denotada S , que se define comoS(t)=Pr(T>t){\displaystyle S(t)=\Pr(T>t)} donde t es un tiempo, T es una variable aleatoria que denota el tiempo de muerte, o más generalmente cualquier evento, y "Pr" significa probabilidad . Es decir, la función de supervivencia es la probabilidad de observar un tiempo de evento mayor que un tiempo t especificado . [ 7 ] La ​​función de supervivencia también se llama función de supervivencia o función de supervivencia en problemas de supervivencia biológica, y función de confiabilidad en problemas de supervivencia mecánica. [ 22 ] En este último caso, la función de confiabilidad se denota R ( t ).

Por lo general se asume que S (0) = 1, aunque podría ser menor que 1  si existe la posibilidad de muerte o fallo inmediato.

La función de supervivencia debe ser no creciente: S ( u ) ≤ S ( t ) si ut . Esta propiedad se deduce directamente porque T > u implica T > t . Esto refleja la idea de que la supervivencia hasta una edad avanzada solo es posible si se alcanzan todas las edades más tempranas. Dada esta propiedad, la función de distribución de la vida útil y la densidad de eventos ( F y f a continuación) están bien definidas. [ 2 ]

Generalmente se asume que la función de supervivencia tiende a cero a medida que la edad aumenta sin límite (es decir, S ( t ) → 0 cuando t → ∞), aunque el límite podría ser mayor que cero si la vida eterna es posible. Por ejemplo, podríamos aplicar el análisis de supervivencia a una mezcla de isótopos de carbono estables e inestables ; los isótopos inestables se desintegrarían tarde o temprano, pero los isótopos estables durarían indefinidamente.

Función de distribución de la vida útil y densidad de eventos

Las cantidades relacionadas se definen en términos de la función de supervivencia.

La función de distribución de la vida útil , convencionalmente denotada F , se define como el complemento de la función de supervivencia,

F(t)=Pr(Tt)=1S(t).{\displaystyle F(t)=\Pr(T\leq t)=1-S(t).} Si F es diferenciable , entonces la derivada, que es la función de densidad de la distribución de la vida útil, se denota convencionalmente como f ,

F(t)=F(t)=ddtF(t).{\displaystyle f(t)=F'(t)={\frac {d}{dt}}F(t).} La función f a veces se denomina densidad de eventos ; es la tasa de eventos de muerte o falla por unidad de tiempo.

La función de supervivencia puede expresarse en términos de funciones de distribución de probabilidad y de densidad de probabilidad.

S(t)=Pr(T>t)=tF()d=1F(t).{\displaystyle S(t)=\Pr(T>t)=\int _{t}^{\infty }f(u)\,du=1-F(t).} De manera similar, se puede definir una función de densidad de eventos de supervivencia como

s(t)=S(t)=ddtS(t)=ddttF()d=ddt[1F(t)]=F(t).{\displaystyle s(t)=S'(t)={\frac {d}{dt}}S(t)={\frac {d}{dt}}\int _{t}^{\infty }f(u)\,du={\frac {d}{dt}}[1-F(t)]=-f(t).} En otros campos, como la física estadística, la función de densidad de eventos de supervivencia se conoce como densidad de tiempo de primer paso .

Función de riesgo y función de riesgo acumulativo

La función de riesgoh{\displaystyle h}se define como la tasa de eventos en el tiempot,{\displaystyle t,}condicionado a la supervivencia en el momentot.{\displaystyle t.}

Los sinónimos de función de riesgo en diferentes campos incluyen tasa de riesgo, función de intensidad, [ 23 ] fuerza de mortalidad ( demografía y ciencia actuarial , denotada porμ{\displaystyle \mu }), fuerza de falla o tasa de falla ( ingeniería , denotadaλ{\displaystyle \lambda }). Por ejemplo, en ciencias actuariales,μ(incógnita){\displaystyle \mu (x)}indica la tasa de mortalidad para personas de edadincógnita{\displaystyle x}, mientras que en ingeniería de confiabilidadλ(t){\displaystyle \lambda (t)}indica la tasa de falla de los componentes después de operar durante un tiempot{\displaystyle t}.

La función de riesgo representa la probabilidad de que un sujeto experimente un evento en el siguiente intervalo de tiempo pequeño, dividido por la duración de este intervalo, dado que ha sobrevivido hasta el momento.t{\displaystyle t}. [ 23 ] Formalmente, esto se puede escribir de la siguiente manera:

h(t)=límitedt0Pr(t<T<t+dt|T>t)dt=límitedt0Pr(t<T<t+dt)dtS(t)=F(t)S(t)=S(t)S(t),{\displaystyle h(t)=\lim _{dt\rightarrow 0}{\frac {\Pr(t<T<t+dt|T>t)}{dt}}=\lim _{dt\rightarrow 0}{\frac {\Pr(t<T<t+dt)}{dt\cdot S(t)}}={\frac {f(t)}{S(t)}}=-{\frac {S'(t)}{S(t)}},}

donde el teorema de Bayes y la identificaciónPr(T>t){\displaystyle \Pr(T>t)}como función de supervivencia, se ha utilizado en la primera igualdad, y la definición de la función de densidad de la distribución de la vida útil en la segunda.

Cualquier funciónh{\displaystyle h}es una función de riesgo si y solo si satisface las siguientes propiedades:

  1. incógnita0(h(incógnita)0){\displaystyle \forall x\geq 0\left(h(x)\geq 0\right)},
  2. 0h(incógnita)dincógnita={\displaystyle \int _{0}^{\infty }h(x)dx=\infty }.

De hecho, la tasa de riesgo suele ser más informativa sobre el mecanismo subyacente de la falla que otras representaciones de la distribución de la vida útil.

La función de riesgo debe ser no negativa,λ(t)0{\displaystyle \lambda (t)\geq 0}y su integral sobre[0,]{\displaystyle [0,\infty ]}debe ser infinito, pero no está restringido de otra manera; puede ser creciente o decreciente, no monótono o discontinuo. Un ejemplo es la función de riesgo de la curva de bañera , que es grande para valores pequeños det{\displaystyle t}, disminuyendo hasta un mínimo y luego aumentando de nuevo; esto puede modelar la propiedad de algunos sistemas mecánicos de fallar poco después de su funcionamiento, o mucho más tarde, a medida que el sistema envejece.

La función de riesgo puede representarse alternativamente en términos de la función de riesgo acumulado , denotada convencionalmenteΛ{\displaystyle \Lambda }oH{\displaystyle H}:

Λ(t)=registroS(t){\displaystyle \,\Lambda (t)=-\log S(t)} así transponiendo signos y potenciando

S(t)=exp(Λ(t)){\displaystyle \,S(t)=\exp(-\Lambda (t))} o diferenciando (con la regla de la cadena)

ddtΛ(t)=S(t)S(t)=λ(t).{\displaystyle {\frac {d}{dt}}\Lambda (t)=-{\frac {S'(t)}{S(t)}}=\lambda (t).} El nombre "función de riesgo acumulado" se deriva del hecho de que

Λ(t)=0tλ()d{\displaystyle \Lambda (t)=\int _{0}^{t}\lambda (u)\,du} que es la "acumulación" del peligro a lo largo del tiempo.

Desde la definición deΛ(t){\displaystyle \Lambda (t)}, vemos que aumenta sin límite cuando t tiende a infinito (suponiendo queS(t){\displaystyle S(t)}tiende a cero). Esto implica queλ(t){\displaystyle \lambda (t)}no debe disminuir demasiado rápido, ya que, por definición, el riesgo acumulado tiene que divergir. Por ejemplo,exp(t){\displaystyle \exp(-t)}no es la función de riesgo de ninguna distribución de supervivencia, porque su integral converge a 1.

La función de supervivenciaS(t){\displaystyle S(t)}, la función de riesgo acumuladoΛ(t){\displaystyle \Lambda (t)}la densidadF(t){\displaystyle f(t)}la función de riesgoλ(t){\displaystyle \lambda (t)}y la función de distribución de la vida útilF(t){\displaystyle F(t)}están relacionados a través de S(t)=exp[Λ(t)]=F(t)λ(t)=1F(t),t>0.{\displaystyle S(t)=\exp[-\Lambda (t)]={\frac {f(t)}{\lambda (t)}}=1-F(t),\quad t>0.}

Cantidades derivadas de la distribución de supervivencia

Vida útil futura en un momento dadot0{\displaystyle t_{0}}es el tiempo restante hasta la muerte, dado que la supervivencia llega a la edadt0{\displaystyle t_{0}}Por lo tanto, esTt0{\displaystyle T-t_{0}}en la notación actual. La esperanza de vida futura es el valor esperado de la esperanza de vida futura. La probabilidad de muerte a la edad o antes de la edadt0+t{\displaystyle t_{0}+t}, dado que la supervivencia llega a la edadt0{\displaystyle t_{0}}, es solo

PAG(Tt0+tT>t0)=PAG(t0<Tt0+t)PAG(T>t0)=F(t0+t)F(t0)S(t0).{\displaystyle P(T\leq t_{0}+t\mid T>t_{0})={\frac {P(t_{0}<T\leq t_{0}+t)}{P(T>t_{0})}}={\frac {F(t_{0}+t)-F(t_{0})}{S(t_{0})}}.} Por lo tanto, la densidad de probabilidad de la vida futura es

ddtF(t0+t)F(t0)S(t0)=F(t0+t)S(t0){\displaystyle {\frac {d}{dt}}{\frac {F(t_{0}+t)-F(t_{0})}{S(t_{0})}}={\frac {f(t_{0}+t)}{S(t_{0})}}} y la esperanza de vida futura es

1S(t0)0tF(t0+t)dt=1S(t0)t0S(t)dt,{\displaystyle {\frac {1}{S(t_{0})}}\int _{0}^{\infty }t\,f(t_{0}+t)\,dt={\frac {1}{S(t_{0})}}\int _{t_{0}}^{\infty }S(t)\,dt,} donde la segunda expresión se obtiene mediante integración por partes .

Parat0=0{\displaystyle t_{0}=0}, es decir, al nacer, esto se reduce a la esperanza de vida.

En los problemas de confiabilidad, la vida útil esperada se denomina tiempo medio hasta el fallo , y la vida útil futura esperada se denomina vida útil residual media .

Como la probabilidad de que un individuo sobreviva hasta la edad t o más tarde es S ( t ), por definición, el número esperado de supervivientes a la edad t de una población inicial de n recién nacidos es n × S ( t ), suponiendo la misma función de supervivencia para todos los individuos. Por lo tanto, la proporción esperada de supervivientes es S ( t ). Si la supervivencia de diferentes individuos es independiente, el número de supervivientes a la edad t tiene una distribución binomial con parámetros n y S ( t ), y la varianza de la proporción de supervivientes es S ( t ) × (1- S ( t ))/ n .

La edad a la que queda una proporción específica de supervivientes se puede calcular resolviendo la ecuación S ( t ) = q para t , donde q es el cuantil en cuestión. Normalmente, interesa la mediana de la esperanza de vida , para la cual q = 1/2, u otros cuantiles como q = 0,90 o q = 0,99.

Censura

La censura es un problema de datos faltantes en el que no se registra el tiempo transcurrido hasta el evento debido a razones como la finalización del estudio antes de que todos los participantes hayan experimentado el evento de interés o el abandono del estudio por parte del participante antes de que este lo experimente. La censura es común en el análisis de supervivencia.

Si solo se conoce el límite inferior l para el tiempo real del evento T , de modo que T > l , se habla de censura por la derecha . La censura por la derecha se produce, por ejemplo, en aquellos sujetos cuya fecha de nacimiento se conoce, pero que siguen vivos cuando se pierde su seguimiento o cuando finaliza el estudio. Generalmente, nos encontramos con datos censurados por la derecha.

Si el evento de interés ya ocurrió antes de que el sujeto se incluyera en el estudio, pero no se sabe cuándo ocurrió, se dice que los datos están censurados por la izquierda . [ 24 ] Cuando solo se puede decir que el evento ocurrió entre dos observaciones o exámenes, se trata de censura por intervalo .

La censura por la izquierda se produce, por ejemplo, cuando un diente permanente ya ha erupcionado antes del inicio de un estudio odontológico cuyo objetivo es estimar su distribución de erupción. En el mismo estudio, el tiempo de erupción se considera censurado por intervalo cuando el diente permanente está presente en la boca en el examen actual, pero no en el examen anterior. La censura por intervalo suele ocurrir en estudios sobre el VIH/SIDA. De hecho, el tiempo hasta la seroconversión al VIH solo puede determinarse mediante una prueba de laboratorio, que generalmente se realiza después de una consulta médica. Por lo tanto, solo se puede concluir que la seroconversión al VIH se produjo entre dos exámenes. Lo mismo ocurre con el diagnóstico del SIDA, que se basa en los síntomas clínicos y debe confirmarse mediante un examen médico.

También puede ocurrir que los sujetos con una esperanza de vida inferior a cierto umbral no sean observados en absoluto: esto se denomina truncamiento . Cabe señalar que el truncamiento es diferente de la censura por la izquierda, ya que para un dato censurado por la izquierda, sabemos que el sujeto existe, pero para un dato truncado, podemos desconocer por completo su existencia. El truncamiento también es frecuente. En un estudio denominado de entrada retardada , los sujetos no son observados hasta que alcanzan cierta edad. Por ejemplo, las personas pueden no ser observadas hasta que alcanzan la edad escolar. Cualquier sujeto fallecido en el grupo de edad preescolar sería desconocido. Los datos truncados por la izquierda son comunes en el trabajo actuarial para seguros de vida y pensiones . [ 25 ]

Los datos censurados por la izquierda pueden ocurrir cuando el tiempo de supervivencia de una persona se vuelve incompleto en el lado izquierdo del período de seguimiento. Por ejemplo, en un caso epidemiológico, podemos monitorear a un paciente con una enfermedad infecciosa desde el momento en que da positivo en la prueba de la infección. Si bien podemos conocer el lado derecho de la duración de interés, es posible que nunca sepamos el momento exacto de la exposición al agente infeccioso. [ 26 ]

Ajuste de parámetros a los datos

Los modelos de supervivencia pueden considerarse modelos de regresión ordinarios en los que la variable de respuesta es el tiempo. Sin embargo, el cálculo de la función de verosimilitud (necesaria para ajustar parámetros o realizar otro tipo de inferencias) se complica por la censura. La función de verosimilitud para un modelo de supervivencia, en presencia de datos censurados, se formula de la siguiente manera. Por definición, la función de verosimilitud es la probabilidad condicional de los datos dados los parámetros del modelo. Es habitual suponer que los datos son independientes dados los parámetros. Entonces, la función de verosimilitud es el producto de la verosimilitud de cada dato. Es conveniente dividir los datos en cuatro categorías: sin censura, censurados por la izquierda, censurados por la derecha y censurados por intervalo. Estas se denotan como "unc.", "lc", "rc" e "ic" en la ecuación siguiente.

L(θ)=Tinortedo.Pr(T=Tiθ)il.do.Pr(T<Tiθ)ir.do.Pr(T>Tiθ)ii.do.Pr(Ti,l<T<Ti,rθ).{\displaystyle L(\theta )=\prod _{T_{i}\in unc.}\Pr(T=T_{i}\mid \theta )\prod _{i\in l.c.}\Pr(T<T_{i}\mid \theta )\prod _{i\in r.c.}\Pr(T>T_{i}\mid \theta )\prod _{i\in i.c.}\Pr(T_{i,l}<T<T_{i,r}\mid \theta ).} Para datos sin censura, conTi{\displaystyle T_{i}}igual a la edad al morir, tenemos

Pr(T=Tiθ)=F(Tiθ).{\displaystyle \Pr(T=T_{i}\mid \theta )=f(T_{i}\mid \theta ).} Para datos censurados por la izquierda, de modo que se sabe que la edad al morir es menor queTi{\displaystyle T_{i}}, tenemos

Pr(T<Tiθ)=F(Tiθ)=1S(Tiθ).{\displaystyle \Pr(T<T_{i}\mid \theta )=F(T_{i}\mid \theta )=1-S(T_{i}\mid \theta ).} Para datos censurados por la derecha, de modo que se sabe que la edad al morir es mayor queTi{\displaystyle T_{i}}, tenemos

Pr(T>Tiθ)=1F(Tiθ)=S(Tiθ).{\displaystyle \Pr(T>T_{i}\mid \theta )=1-F(T_{i}\mid \theta )=S(T_{i}\mid \theta ).} Para un dato censurado por intervalo, de modo que se sabe que la edad al morir es menor queTi,r{\displaystyle T_{i,r}}y mayor queTi,l{\displaystyle T_{i,l}}, tenemos

Pr(Ti,l<T<Ti,rθ)=S(Ti,lθ)S(Ti,rθ).{\displaystyle \Pr(T_{i,l}<T<T_{i,r}\mid \theta )=S(T_{i,l}\mid \theta )-S(T_{i,r}\mid \theta ).} Una aplicación importante donde surgen datos censurados por intervalos son los datos de estado actual, donde un eventoTi{\displaystyle T_{i}}Se sabe que no ocurrió antes de un tiempo de observación y que ocurrió antes del siguiente tiempo de observación.

Estimación no paramétrica

El estimador de Kaplan-Meier se puede utilizar para estimar la función de supervivencia. El estimador de Nelson-Aalen se puede utilizar para proporcionar una estimación no paramétrica de la función de tasa de riesgo acumulada. Estos estimadores requieren datos de por vida. Los recuentos periódicos de casos (cohortes) y de defunciones (y recuperaciones) son estadísticamente suficientes para realizar estimaciones no paramétricas de máxima verosimilitud y mínimos cuadrados de las funciones de supervivencia, sin necesidad de datos de por vida.

Modelos de supervivencia en tiempo discreto

Si bien muchos modelos paramétricos asumen un tiempo continuo, los modelos de supervivencia en tiempo discreto pueden mapearse a un problema de clasificación binaria. En un modelo de supervivencia en tiempo discreto, el período de supervivencia se remuestrea artificialmente en intervalos donde, para cada intervalo, se registra un indicador objetivo binario si el evento tiene lugar en un horizonte temporal determinado. [ 27 ] Si se calibra un clasificador binario (potencialmente mejorado con una verosimilitud diferente para tener en cuenta una mayor estructura del problema) , entonces la puntuación del clasificador es la función de riesgo (es decir, la probabilidad condicional de fallo). [ 27 ]

Descripción de la transformación de datos de supervivencia en tiempo continuo a datos de supervivencia en tiempo discreto. El individuo 4 está censurado y, para el individuo 5, el evento ocurre fuera de la ventana de observación 5.

Los modelos de supervivencia en tiempo discreto están conectados a la verosimilitud empírica . [ 28 ] [ 29 ]

En lugar de realizar la discretización temporal y obtener los datos en este formato extenso, una alternativa es realizar una regresión distribucional sobre el eje temporal agrupado. Este enfoque permite aprovechar redes neuronales predefinidas (modelos tabulares) para trabajar incluso con conjuntos de datos pequeños.

Bondad de ajuste

La bondad de ajuste de los modelos de supervivencia se puede evaluar utilizando reglas de puntuación . [ 30 ]

Modelo de cura

Un modelo de cura contempla la posibilidad de que algunos individuos nunca experimenten el evento de interés. Esto genera curvas de supervivencia que se estabilizan en lugar de converger siempre a cero.

Un modelo de cura tiene dos componentes interrelacionados.

1. Regresión logística para la probabilidad de no experimentar nunca el evento:

π(incógnita)=PAG(curadoincógnita){\displaystyle \pi (X)=P({\text{cured}}\mid X)}

2. Modelo de riesgo. Por ejemplo, regresión logística en tiempo discreto para el riesgo de evento condicional en el tiempo t, dada la susceptibilidad:

h(tincógnita)=PAG(T=tTt,susceptible,incógnita){\displaystyle h(t\mid X)=P(T=t\mid T\geq t,{\text{susceptible}},X)}

Por lo tanto, la función de supervivencia combinada es

S(tincógnita)=π(incógnita)+(1π(incógnita))j=1t(1h(jincógnita)){\displaystyle S(t\mid X)=\pi (X)+(1-\pi (X))\prod _{j=1}^{t}(1-h(j\mid X))}

Primer término: individuos curados, que sobreviven indefinidamente.

Segundo término: individuos susceptibles, cuya supervivencia disminuye en función del riesgo.

Sin un modelo de cura, la supervivencia se ve obligada a ser cero en el límite de tiempos grandes. Con una fracción de cura, la supervivencia converge en cambio a

límitetS(tincógnita)=π(incógnita)>0{\displaystyle \lim _{t\to \infty }S(t\mid X)=\pi (X)>0}

Software informático para análisis de supervivencia

El libro de texto de Kleinbaum tiene ejemplos de análisis de supervivencia usando SAS, R y otros paquetes. [ 6 ] Los libros de texto de Brostrom, [ 31 ] Dalgaard [ 10 ] y Tableman y Kim [ 32 ] dan ejemplos de análisis de supervivencia usando R (o usando S, y que se ejecutan en R).

Distribuciones utilizadas en el análisis de supervivencia

Aplicaciones

Véase también

Referencias

  1. Clark, TG; Bradburn, MJ; Love, SB; Altman, DG (15 de julio de 2003). "Análisis de supervivencia Parte I: conceptos básicos y primeros análisis" . British Journal of Cancer . 89 (2): 232– 238. doi : 10.1038/sj.bjc.6601118 . PMC 2394262. PMID 12865907 .  
  2. 1 2 Kalbfleisch, John D.; Prentice, Ross L. (26 de agosto de 2002). Análisis estadístico de datos de tiempo de falla . Serie Wiley en probabilidad y estadística (1.ª ed.). Wiley. doi : 10.1002/9781118032985 . ISBN  978-0-471-36357-6.
  3. Mills, Melinda (2011). Introducción al análisis de supervivencia e historia de eventos . Londres Thousand Oaks, California: Sage. ISBN 978-1-84860-101-7.
  4. Miller, Rupert G. (1997), Análisis de supervivencia , John Wiley & Sons, ISBN 0-471-25218-2
  5. Kaplan, EL; Meier, Paul (1958-06-01). "Estimación no paramétrica a partir de observaciones incompletas" . Journal of the American Statistical Association . 53 (282): 457– 481. doi : 10.1080/01621459.1958.10501452 . ISSN 0162-1459 . 
  6. 1 2 Kleinbaum, David G.; Klein, Mitchel (2012), Análisis de supervivencia: Un texto de autoaprendizaje (Tercera ed.), Springer, ISBN  978-1-4419-6645-2
  7. 1 2 Hosmer, David W.; Lemeshow, Stanley; May, Susanne (26 de febrero de 2008). Análisis de supervivencia aplicado . Serie Wiley en probabilidad y estadística. Wiley. doi : 10.1002/9780470258019 . ISBN 978-0-471-75499-2.
  8. Agresti, Alan (2018). Métodos estadísticos para las ciencias sociales (Quinta edición, edición global). Harlow: Pearson Education, Limited. ISBN  978-1-292-22034-5.
  9. Therneau, Terry M.; Grambsch, Patricia M. (2000). Modelado de datos de supervivencia: extensión del modelo de Cox . Estadística para biología y salud. Nueva York: Springer. ISBN 978-0-387-98784-2.
  10. 1 2 Dalgaard, Peter (2008), Estadística introductoria con R (Segunda edición), Springer, ISBN  978-0-387-79053-4
  11. Saegusa, Takumi; Di, Chongzhi; Chen, Ying Qing (septiembre de 2014). "Prueba de hipótesis para un modelo de Cox extendido con coeficientes variables en el tiempo" . Biometrics . 70 (3): 619– 628. doi : 10.1111/biom.12185 . ISSN 0006-341X . PMC 4247822. PMID 24888739 .   
  12. Segal, Mark Robert (1988). " Árboles de regresión para datos censurados". Biometrics . 44 (1): 35– 47. doi : 10.2307/2531894 . JSTOR 2531894. S2CID 60974957 .  
  13. Leblanc, Michael; Crowley, John (1993). "Árboles de supervivencia según la calidad de la división" . Journal of the American Statistical Association . 88 (422): 457– 467. doi : 10.1080/01621459.1993.10476296 . ISSN 0162-1459 . 
  14. Ritschard, Gilbert; Gabadinho, Alexis; Muller, Nicolas S.; Studer, Matthias (2008). "Extracción de historias de eventos: una perspectiva de las ciencias sociales" . International Journal of Data Mining, Modelling and Management . 1 (1): 68. doi : 10.1504/IJDMMM.2008.022538 . ISSN 1759-1163 . 
  15. 1 2 Ishwaran, Hemant; Kogalur, Udaya B.; Blackstone, Eugene H.; Lauer, Michael S. (2008-09-01). "Bosques de supervivencia aleatorios" . The Annals of Applied Statistics . 2 (3). arXiv : 0811.1645 . doi : 10.1214/08-AOAS169 . ISSN 1932-6157 . S2CID 2003897 .  
  16. 1 2 Therneau, Terry J.; Atkinson, Elizabeth J. "rpart: Particionamiento recursivo y árboles de regresión" . CRAN . Recuperado el 12 de noviembre de 2021 .
  17. Atkinson, Elizabeth J.; Therneau, Terry J. (1997). Una introducción a la partición recursiva utilizando las rutinas RPART . Mayo Foundation.
  18. Ishwaran, Hemant; Kogalur, Udaya B. "randomForestSRC: Bosques aleatorios unificados rápidos para supervivencia, regresión y clasificación (RF-SRC)" . CRAN . Consultado el 12 de noviembre de 2021 .
  19. Singh, Jared; Katzman, L. (2018). "DeepSurv: sistema de recomendación de tratamientos personalizados que utiliza una red neuronal profunda de riesgos proporcionales de Cox". BMC Medical Research Methodology .
  20. Nagpal, Chirag (2021). "Máquinas de supervivencia profunda: regresión de supervivencia totalmente paramétrica y aprendizaje de representación para datos censurados con riesgos competitivos". IEEE Journal of Biomedical and Health Informatics . 25 (8): 3163– 3175. arXiv : 2003.01176 . Bibcode : 2021IJBHI..25.3163N . doi : 10.1109/JBHI.2021.3052441 . PMID 33460387 . S2CID 211817982 .  
  21. Nagpal, Chirag (2021). "Mezclas de Cox profundas para regresión de supervivencia". Conferencia de aprendizaje automático para la atención médica . arXiv : 2101.06536 .
  22. Meeker, William Q.; Escobar, Luis A.; Pascual, Francis G. (2022). Métodos estadísticos para datos de fiabilidad . Serie Wiley en probabilidad y estadística (Segunda edición). Hoboken, NJ: Wiley. ISBN  978-1-118-59448-3.
  23. 1 2 Moore, Dirk F. (2016), "Principios básicos del análisis de supervivencia" , Análisis de supervivencia aplicado con R , Cham: Springer International Publishing, pp. 11–24 , doi : 10.1007/978-3-319-31245-3_2 , ISBN  978-3-319-31243-9, consultado el 29 de octubre de 2025
  24. Darity, William A. Jr., ed. (2008). "Censura, izquierda y derecha" . Enciclopedia Internacional de las Ciencias Sociales . Vol. 1 (2.ª ed.). Macmillan. pp. 473–474 . Consultado el 6 de noviembre de 2016 .   
  25. Richards, SJ (2012). "Un manual de modelos de supervivencia paramétricos para uso actuarial". Scandinavian Actuarial Journal . 2012 (4): 233– 257. doi : 10.1080/03461238.2010.506688 . S2CID 119577304 . 
  26. Singh, R.; Mukhopadhyay, K. (2011). "Análisis de supervivencia en ensayos clínicos: conceptos básicos y áreas imprescindibles" . Perspect Clin Res . 2 (4): 145– 148. doi : 10.4103/2229-3485.86872 . PMC 3227332. PMID 22145125 .  
  27. 1 2 Suresh, K., Severn, C. y Ghosh, D. Modelos de predicción de supervivencia: una introducción al modelado en tiempo discreto. BMC Med Res Methodol 22, 207 (2022). https://doi.org/10.1186/s12874-022-01679-6 , https://bmcmedresmethodol.biomedcentral.com/articles/10.1186/s12874-022-01679-6
  28. Probabilidad empírica en el análisis de supervivencia, Gang Li (EE. UU.), Runze Li (EE. UU.) y Mai Zhou (EE. UU.), Análisis multivariante contemporáneo y diseño de experimentos. Marzo de 2005, 337-349, https://www.ms.uky.edu/~mai/research/llz.pdf
  29. La función de distribución empírica con datos agrupados arbitrariamente, censurados y truncados, Bruce W. Turnbull, Journal of the Royal Statistical Society. Serie B (Metodológica) Vol. 38, No. 3 (1976), pp. 290-295 (6 páginas), https://apps.dtic.mil/sti/tr/pdf/ADA030940.pdf
  30. Reglas de puntuación adecuadas para el análisis de supervivencia, Hiroki Yanagisawa, https://arxiv.org/abs/2305.00621v3
  31. Brostrom, Göran (2012), Event History Analysis with R (Primera ed.), Chapman & Hall/CRC, ISBN  978-1-4398-3164-9
  32. Tableman, Mara; Kim, Jong Sung (2003), Análisis de supervivencia usando S (Primera ed.), Chapman and Hall/CRC, ISBN  978-1-58488-408-8
  33. Stepanova, Maria; Thomas, Lyn (1 de abril de 2002). "Métodos de análisis de supervivencia para datos de préstamos personales". Operations Research . 50 (2): 277– 289. doi : 10.1287/opre.50.2.277.426 . ISSN 0030-364X . 
  34. Glennon, Dennis; Nigro, Peter (2005). "Medición del riesgo de impago de los préstamos a pequeñas empresas: un enfoque de análisis de supervivencia". Journal of Money, Credit and Banking . 37 (5): 923– 947. doi : 10.1353/mcb.2005.0051 . ISSN 0022-2879 . JSTOR 3839153 . S2CID 154615623 .   
  35. Kennedy, Edward H.; Hu, Chen; O'Brien, Barbara; Gross, Samuel R. (2014-05-20). "Tasa de condenas falsas de acusados ​​penales condenados a muerte" . Actas de la Academia Nacional de Ciencias . 111 (20): 7230– 7235. Bibcode : 2014PNAS..111.7230G . doi : 10.1073 / pnas.1306417111 . ISSN 0027-8424 . PMC 4034186. PMID 24778209 .   
  36. de Cos Juez, FJ; García Nieto, PJ; Martínez Torres, J.; Taboada Castro, J. (2010-10-01). "Análisis de los plazos de entrega de componentes metálicos en la industria aeroespacial mediante un modelo de máquina de vectores de soporte" . Modelado matemático y computacional . Modelos matemáticos en medicina, negocios e ingeniería 2009. 52 (7): 1177– 1184. doi : 10.1016/j.mcm.2010.03.017 . hdl : 10651/8288 . ISSN 0895-7177 . 
  37. Spivak, Andrew L.; Damphousse, Kelly R. (2006). "¿Quién regresa a prisión? Un análisis de supervivencia de la reincidencia entre delincuentes adultos liberados en Oklahoma, 1985-2004". Justice Research and Policy . 8 (2): 57–88 . doi : 10.3818/jrp.8.2.2006.57 . ISSN 1525-1071 . S2CID 144566819 .  
  38. Pollock, Kenneth H.; Winterstein, Scott R.; Bunck, Christine M.; Curtis, Paul D. (1989). "Análisis de supervivencia en estudios de telemetría: el diseño de entrada escalonada" . The Journal of Wildlife Management . 53 (1): 7– 15. doi : 10.2307/3801296 . ISSN 0022-541X . JSTOR 3801296 .  
  39. Saleh, Joseph Homer (23 de diciembre de 2019). "Análisis de fiabilidad estadística para una ocupación muy peligrosa: emperador romano" . Palgrave Communications . 5 (1) 155: 1– 7. doi : 10.1057/s41599-019-0366-y . ISSN 2055-1045 . 
  40. Kreer, Markus; Kizilersu, Ayse; Thomas, Anthony W. (2022). "Algoritmo de maximización de expectativas censurado para mezclas: Aplicación a los tiempos de espera entre transacciones" . Physica A: Mecánica estadística y sus aplicaciones . 587 (1) 126456. Bibcode : 2022PhyA..58726456K . doi : 10.1016/j.physa.2021.126456 . ISSN 0378-4371 . S2CID 244198364 .  

Lecturas adicionales

  • Collett, David (2003). Modelado de datos de supervivencia en la investigación médica (Segunda  edición). Boca Raton: Chapman & Hall/CRC. ISBN 1-58488-325-1.
  • Elandt-Johnson, Regina; Johnson, Norman (1999). Modelos de supervivencia y análisis de datos . Nueva York: John Wiley & Sons. ISBN 0-471-34992-5.
  • Kalbfleisch, JD; Prentice, Ross L. (2002). El análisis estadístico de los datos del tiempo de falla . Nueva York: John Wiley & Sons. ISBN 0-471-36357-X.
  • Lawless, Jerald F. (2003). Modelos y métodos estadísticos para datos de vida (2.ª  ed.). Hoboken: John Wiley and Sons. ISBN 0-471-37215-3.
  • Rausand, M.; Hoyland, A. (2004). Teoría de la fiabilidad de sistemas: modelos, métodos estadísticos y aplicaciones . Hoboken: John Wiley & Sons. ISBN 0-471-47133-X.
  • Therneau, Terry. "Un paquete para el análisis de supervivencia en S" . Archivado del original el 7 de septiembre de 2006.A través de la página del Dr. Therneau en el sitio web de la Clínica Mayo.
  • "Manual de estadística para ingeniería" . NIST/SEMATEK.
  • SOCR , aplicación de análisis de supervivencia y actividad de aprendizaje interactiva .
  • Análisis del tiempo de supervivencia/fallo en la página del libro de texto de estadística.
  • Análisis de supervivencia en R
  • Lifelines, un paquete de Python para análisis de supervivencia.
  • Análisis de supervivencia en la biblioteca Fortran de NAG