Articulo de referencia

Bioestadística

La bioestadística (a veces denominada biometría ) es una rama de la estadística que aplica métodos estadísticos a una amplia gama de temas en las ciencias biológicas , con espec...

La bioestadística (a veces denominada biometría ) es una rama de la estadística que aplica métodos estadísticos a una amplia gama de temas en las ciencias biológicas , con especial atención a las aplicaciones en medicina clínica y salud pública . [ 1 ] Este campo abarca el diseño de experimentos, la recopilación y el análisis de datos experimentales y observacionales, y la interpretación de los resultados. Está estrechamente relacionada con la estadística médica .

Historia

Bioestadística y genética

El modelado bioestadístico constituye una parte importante de numerosas teorías biológicas modernas. Los estudios genéticos , desde sus inicios, han utilizado conceptos estadísticos para comprender los resultados experimentales observados. Algunos genetistas incluso contribuyeron con avances estadísticos mediante el desarrollo de métodos y herramientas. Gregor Mendel inició los estudios genéticos investigando los patrones de segregación genética en familias de guisantes y utilizó la estadística para explicar los datos recopilados. A principios del siglo XX, tras el redescubrimiento del trabajo de Mendel sobre la herencia mendeliana, existían discrepancias en la comprensión entre la genética y el darwinismo evolutivo. Francis Galton intentó ampliar los descubrimientos de Mendel con datos humanos y propuso un modelo diferente en el que fracciones de la herencia provenían de cada ancestro, formando una serie infinita. A esto lo llamó la teoría de la " Ley de la Herencia Ancestral ". Sus ideas fueron fuertemente rechazadas por William Bateson , quien seguía las conclusiones de Mendel, según las cuales la herencia genética provenía exclusivamente de los padres, la mitad de cada uno. Esto dio lugar a un intenso debate entre los biometristas, que apoyaban las ideas de Galton, como Raphael Weldon , Arthur Dukinfield Darbishire y Karl Pearson , y los mendelianos, que apoyaban las ideas de Bateson (y de Mendel), como Charles Davenport y Wilhelm Johannsen . Posteriormente, los biometristas no pudieron reproducir las conclusiones de Galton en diferentes experimentos, y las ideas de Mendel prevalecieron. En la década de 1930, los modelos basados ​​en el razonamiento estadístico ayudaron a resolver estas diferencias y a producir la síntesis evolutiva moderna neodarwiniana .

La resolución de estas diferencias permitió definir el concepto de genética de poblaciones y unificar la genética y la evolución. Las tres figuras clave en el establecimiento de la genética de poblaciones y esta síntesis se basaron en la estadística y desarrollaron su aplicación en biología.

Estos y otros bioestadísticos, biólogos matemáticos y genetistas con inclinación estadística ayudaron a reunir la biología evolutiva y la genética en un todo consistente y coherente que pudiera comenzar a ser modelado cuantitativamente .

Paralelamente a este desarrollo general, el trabajo pionero de D'Arcy Thompson en " Sobre el crecimiento y la forma" también contribuyó a añadir rigor cuantitativo al estudio biológico.

A pesar de la importancia fundamental y la frecuente necesidad del razonamiento estadístico, es posible que entre los biólogos existiera una tendencia a desconfiar o menospreciar los resultados que no fueran cualitativamente evidentes. Una anécdota describe cómo Thomas Hunt Morgan prohibió la calculadora Friden en su departamento del Caltech , diciendo: «Bueno, soy como un tipo que busca oro a orillas del río Sacramento en 1849. Con un poco de inteligencia, puedo agacharme y recoger grandes pepitas de oro. Y mientras pueda hacer eso, no voy a permitir que nadie en mi departamento malgaste recursos escasos en la minería aluvial ». [ 4 ]

Planificación de la investigación

Toda investigación en ciencias de la vida se propone para responder a una pregunta científica . Para responderla con alta certeza, necesitamos resultados precisos . La correcta definición de la hipótesis principal y del plan de investigación reducirá los errores al tomar decisiones para comprender un fenómeno. El plan de investigación puede incluir la pregunta de investigación, la hipótesis a comprobar, el diseño experimental , los métodos de recolección de datos , las perspectivas de análisis de datos y los costos involucrados. Es fundamental llevar a cabo el estudio basándose en los tres principios básicos de la estadística experimental: aleatorización , replicación y control local.

Pregunta de investigación

La pregunta de investigación definirá el objetivo del estudio. La investigación estará guiada por la pregunta, por lo que debe ser concisa y, al mismo tiempo, centrarse en temas interesantes e innovadores que puedan mejorar la ciencia, el conocimiento y el campo en cuestión. Para definir la forma de formular la pregunta científica , puede ser necesaria una revisión exhaustiva de la literatura . De esta manera, la investigación puede aportar valor a la comunidad científica . [ 5 ]

Definición de hipótesis

Una vez definido el objetivo del estudio, se pueden proponer las posibles respuestas a la pregunta de investigación, transformando esta pregunta en una hipótesis . La principal propuesta se denomina hipótesis nula (H₀ ) y suele basarse en un conocimiento permanente sobre el tema o en una ocurrencia evidente del fenómeno, respaldada por una revisión exhaustiva de la literatura. Podemos decir que es la respuesta estándar esperada para los datos en la situación de prueba . En general, H₀ supone que no existe asociación entre los tratamientos. Por otro lado, la hipótesis alternativa es la negación de H₀ . Supone cierto grado de asociación entre el tratamiento y el resultado. Sin embargo, la hipótesis se sustenta en la pregunta de investigación y sus respuestas esperadas e inesperadas. [ 5 ]

Como ejemplo, consideremos grupos de animales similares (ratones, por ejemplo) bajo dos sistemas de alimentación diferentes. La pregunta de investigación sería: ¿cuál es la mejor dieta? En este caso, H₀ sería que no hay diferencia entre las dos dietas en el metabolismo de los ratones (H₀ : μ₁ = μ₂ ) y la hipótesis alternativa sería que las dietas tienen efectos diferentes sobre el metabolismo de los animales (H₁ : μ₁ μ₂ ) .

La hipótesis la define el investigador, según sus intereses para responder a la pregunta principal. Además, puede haber más de una hipótesis alternativa . Esta puede contemplar no solo diferencias entre los parámetros observados, sino también su grado de diferencia ( es decir, valores mayores o menores).

Muestreo

Generalmente, un estudio busca comprender el efecto de un fenómeno sobre una población . En biología , una población se define como el conjunto de todos los individuos de una especie determinada , en un área específica y en un momento dado. En bioestadística, este concepto se extiende a una variedad de conjuntos de datos que pueden ser objeto de estudio. Sin embargo, en bioestadística, una población no se limita a los individuos, sino que abarca el conjunto de un componente específico de sus organismos , como el genoma completo , todos los espermatozoides en el caso de los animales o la superficie foliar total en el caso de las plantas, por ejemplo.

No es posible tomar medidas de todos los elementos de una población . Por ello, el proceso de muestreo es fundamental para la inferencia estadística . El muestreo se define como la obtención aleatoria de una parte representativa de toda la población para realizar inferencias posteriores sobre ella. Así, la muestra puede capturar la mayor variabilidad de una población. [ 6 ] El tamaño de la muestra está determinado por varios factores, desde el alcance de la investigación hasta los recursos disponibles. En la investigación clínica , el tipo de ensayo ( inferioridad , equivalencia y superioridad) es clave para determinar el tamaño de la muestra . [ 5 ]

Diseño experimental

Los diseños experimentales sustentan esos principios básicos de la estadística experimental . Hay tres diseños experimentales básicos para asignar aleatoriamente tratamientos en todas las parcelas del experimento . Estos son el diseño completamente aleatorizado , el diseño de bloques aleatorizados y los diseños factoriales . Los tratamientos pueden organizarse de muchas maneras dentro del experimento. En agricultura , el diseño experimental correcto es la base de un buen estudio y la disposición de los tratamientos dentro del estudio es esencial porque el ambiente afecta en gran medida a las parcelas ( plantas , ganado , microorganismos ). Estas disposiciones principales pueden encontrarse en la literatura bajo los nombres de " retículos ", "bloques incompletos", " parcela dividida ", "bloques aumentados" y muchos otros. Todos los diseños pueden incluir parcelas de control , determinadas por el investigador, para proporcionar una estimación de error durante la inferencia .

En los estudios clínicos , las muestras suelen ser más pequeñas que en otros estudios biológicos y, en la mayoría de los casos, el efecto del entorno puede controlarse o medirse. Es común utilizar ensayos clínicos controlados aleatorizados , donde los resultados se comparan habitualmente con diseños de estudios observacionales como los de casos y controles o de cohortes . [ 7 ]

Recopilación de datos

En la planificación de la investigación deben tenerse en cuenta los métodos de recolección de datos, ya que influyen considerablemente en el tamaño de la muestra y el diseño experimental.

La recopilación de datos varía según el tipo de datos. Para datos cualitativos , la recopilación puede hacerse con cuestionarios estructurados o mediante observación, considerando la presencia o intensidad de la enfermedad, utilizando criterios de puntuación para categorizar los niveles de ocurrencia. [ 8 ] Para datos cuantitativos , la recopilación se realiza midiendo información numérica utilizando instrumentos.

En estudios agrícolas y biológicos, los datos de rendimiento y sus componentes se obtienen mediante medidas métricas . Sin embargo, los daños causados ​​por plagas y enfermedades en las plantas se obtienen mediante observación, considerando escalas de puntuación para los niveles de daño. En particular, en estudios genéticos, se deben considerar métodos modernos para la recolección de datos en campo y laboratorio, como plataformas de alto rendimiento para fenotipado y genotipado. Estas herramientas permiten realizar experimentos de mayor envergadura y, a su vez, evaluar numerosas parcelas en menos tiempo que un método de recolección de datos exclusivamente manual. Finalmente, todos los datos de interés recopilados deben almacenarse en un marco de datos organizado para su posterior análisis.

Análisis e interpretación de datos

Herramientas descriptivas

Los datos se pueden representar mediante tablas o representaciones gráficas , como diagramas de líneas, diagramas de barras, histogramas y diagramas de dispersión. Asimismo, las medidas de tendencia central y variabilidad pueden ser muy útiles para obtener una visión general de los datos. A continuación, se presentan algunos ejemplos:

Tablas de frecuencia

Un tipo de tabla es la tabla de frecuencias , que consiste en datos organizados en filas y columnas, donde la frecuencia es el número de ocurrencias o repeticiones de los datos. La frecuencia puede ser: [ 9 ]

Absoluto : representa el número de veces que aparece un valor determinado;

norte=F1+F2+F3+...+Fnorte{\displaystyle N=f_{1}+f_{2}+f_{3}+...+f_{n}}

Relativo : se obtiene dividiendo la frecuencia absoluta entre el número total;

nortei=Finorte{\displaystyle n_{i}={\frac {f_{i}}{N}}}

En el siguiente ejemplo, tenemos el número de genes en diez operones del mismo organismo.

Genes = {2,3,3,4,5,3,3,3,3,4}

Gráfico de líneas

Figura A: Ejemplo de gráfico de líneas . La tasa de natalidad en Brasil (2010–2016); [ 10 ] Figura B: Ejemplo de gráfico de barras. La tasa de natalidad en Brasil para los meses de diciembre de 2010 a 2016; Figura C: Ejemplo de diagrama de caja : número de glicinas en el proteoma de ocho organismos diferentes (AH); Figura D: Ejemplo de diagrama de dispersión.

Los gráficos de líneas representan la variación de un valor en función de otra métrica, como el tiempo. En general, los valores se representan en el eje vertical, mientras que la variación temporal se representa en el eje horizontal. [ 11 ]

Gráfico de barras

Un gráfico de barras es una representación gráfica que muestra datos categóricos mediante barras cuyas alturas (barras verticales) o anchuras (barras horizontales) son proporcionales a los valores que representan. Los gráficos de barras proporcionan una imagen que también puede representarse en formato tabular. [ 11 ]

En el ejemplo del gráfico de barras, tenemos la tasa de natalidad en Brasil para los meses de diciembre de 2010 a 2016. [ 10 ] La fuerte caída en diciembre de 2016 refleja el brote del virus Zika en la tasa de natalidad en Brasil.

Histogramas

Ejemplo de un histograma.

El histograma (o distribución de frecuencias) es una representación gráfica de un conjunto de datos tabulado y dividido en clases uniformes o no uniformes. Fue introducido por primera vez por Karl Pearson . [ 12 ]

Diagrama de dispersión

Un diagrama de dispersión es un diagrama matemático que utiliza coordenadas cartesianas para mostrar los valores de un conjunto de datos. Un diagrama de dispersión muestra los datos como un conjunto de puntos, cada uno de los cuales representa el valor de una variable que determina la posición en el eje horizontal y otra variable en el eje vertical. [ 13 ] También se les denomina gráfico de dispersión , diagrama de dispersión o diagrama de dispersión . [ 14 ]

Significar

La media aritmética es la suma de una colección de valores (incógnita1+incógnita2+incógnita3++incógnitanorte{\displaystyle {x_{1}+x_{2}+x_{3}+\cdots +x_{n}}}) dividido por el número de artículos de esta colección (norte{\displaystyle {n}}).

incógnita¯=1norte(i=1norteincógnitai)=incógnita1+incógnita2++incógnitanortenorte{\displaystyle {\bar {x}}={\frac {1}{n}}\left(\sum _{i=1}^{n}{x_{i}}\right)={\frac {x_{1}+x_{2}+\cdots +x_{n}}{n}}}

Mediana

La mediana es el valor que se encuentra en el centro de un conjunto de datos.

Modo

La moda es el valor de un conjunto de datos que aparece con mayor frecuencia. [ 15 ]

Diagrama de caja

El diagrama de caja es un método para representar gráficamente grupos de datos numéricos. Las líneas representan los valores máximo y mínimo, y el rango intercuartil (RIC) representa el 25-75% de los datos. Los valores atípicos se pueden representar como círculos.

Coeficientes de correlación

Aunque las correlaciones entre dos tipos de datos diferentes podrían inferirse mediante gráficos, como diagramas de dispersión, es necesario validarlas mediante información numérica. Por esta razón, se requieren coeficientes de correlación . Estos proporcionan un valor numérico que refleja la fuerza de una asociación. [ 11 ]

coeficiente de correlación de Pearson

Diagrama de dispersión que muestra la correlación de Pearson para diferentes valores de ρ.

El coeficiente de correlación de Pearson es una medida de asociación entre dos variables, X e Y. Este coeficiente, generalmente representado por ρ (rho) para la población y r para la muestra, toma valores entre −1 y 1, donde ρ = 1 representa una correlación positiva perfecta, ρ = −1 representa una correlación negativa perfecta y ρ = 0 indica ausencia de correlación lineal. [ 11 ]

estadística inferencial

Se utiliza para realizar inferencias [ 16 ] sobre una población desconocida, mediante estimación y/o prueba de hipótesis. En otras palabras, es deseable obtener parámetros que describan la población de interés, pero dado que los datos son limitados, es necesario utilizar una muestra representativa para estimarlos. De esta manera, es posible probar hipótesis previamente definidas y aplicar las conclusiones a toda la población. El error estándar de la media es una medida de variabilidad crucial para realizar inferencias. [ 6 ]

La comprobación de hipótesis es esencial para realizar inferencias sobre poblaciones con el fin de responder a preguntas de investigación, como se establece en la sección "Planificación de la investigación". Los autores definieron cuatro pasos a seguir: [ 6 ]

  1. La hipótesis a contrastar : como se indicó anteriormente, debemos trabajar con la definición de una hipótesis nula (H₀ ) , que será la que se someta a prueba, y una hipótesis alternativa . Pero estas deben definirse antes de la realización del experimento.
  2. Nivel de significancia y regla de decisión : Una regla de decisión depende del nivel de significancia , o dicho de otro modo, del margen de error aceptable (α). Es más sencillo pensar que definimos un valor crítico que determina la significancia estadística al comparar un estadístico de prueba con él. Por lo tanto, α también debe predefinirse antes del experimento.
  3. Experimentación y análisis estadístico : En esta etapa se lleva a cabo el experimento siguiendo el diseño experimental adecuado , se recopilan los datos y se evalúan las pruebas estadísticas más apropiadas.
  4. Inferencia : Se realiza cuando se rechaza o no la hipótesis nula , basándose en la evidencia que aporta la comparación de los valores p y α. Cabe señalar que el hecho de no rechazar H₀ simplemente significa que no hay suficiente evidencia para respaldar su rechazo, pero no que esta hipótesis sea verdadera.

Un intervalo de confianza es un rango de valores que puede contener el verdadero valor real del parámetro, dado un cierto nivel de confianza. El primer paso es estimar la mejor estimación insesgada del parámetro poblacional. El límite superior del intervalo se obtiene sumando esta estimación y multiplicando el error estándar de la media por el nivel de confianza. El cálculo del límite inferior es similar, pero en lugar de una suma, se debe aplicar una resta. [ 6 ]

Consideraciones estadísticas

Potencia y error estadístico

Al probar una hipótesis, existen dos tipos de errores estadísticos posibles: error de tipo I y error de tipo II .

El nivel de significancia, representado por α, corresponde a la tasa de error de tipo I y debe seleccionarse antes de realizar la prueba. La tasa de error de tipo II se representa por β, y la potencia estadística de la prueba es 1 − β.

valor p

El valor p es la probabilidad de obtener resultados tan extremos o más extremos que los observados, suponiendo que la hipótesis nula (H₀ ) es verdadera. También se le denomina probabilidad calculada. Es común confundir el valor p con el nivel de significancia (α) , pero α es un umbral predefinido para considerar significativos los resultados. Si p es menor que α, se rechaza la hipótesis nula (H₀ ) . [ 17 ]

Pruebas múltiples

En pruebas múltiples de la misma hipótesis, la probabilidad de que se produzcan falsos positivos (tasa de error familiar) aumenta, por lo que se necesita una estrategia para tener en cuenta este fenómeno. Esto se suele lograr utilizando un umbral más estricto para rechazar las hipótesis nulas. La corrección de Bonferroni define un nivel de significación global aceptable, denotado por α*, y cada prueba se compara individualmente con un valor de α = α*/m. Esto garantiza que la tasa de error familiar en las m pruebas sea menor o igual a α*. Cuando m es grande, la corrección de Bonferroni puede ser demasiado conservadora. Una alternativa a la corrección de Bonferroni es controlar la tasa de falsos descubrimientos (FDR) . La FDR controla la proporción esperada de hipótesis nulas rechazadas (los llamados descubrimientos) que son falsas (rechazos incorrectos). Este procedimiento garantiza que, para pruebas independientes, la tasa de falsos descubrimientos sea como máximo q*. Por lo tanto, la FDR es menos conservadora que la corrección de Bonferroni y tiene mayor potencia, a costa de un mayor número de falsos positivos. [ 18 ]

Verificaciones de especificación errónea y robustez

La hipótesis principal que se está probando (por ejemplo, que no existe asociación entre los tratamientos y los resultados) suele ir acompañada de otros supuestos técnicos (por ejemplo, sobre la forma de la distribución de probabilidad de los resultados) que también forman parte de la hipótesis nula. Cuando en la práctica se incumplen los supuestos técnicos, la hipótesis nula puede rechazarse con frecuencia, incluso si la hipótesis principal es verdadera. Se dice que tales rechazos se deben a una especificación incorrecta del modelo. [ 19 ] Verificar que el resultado de una prueba estadística no cambie cuando se modifican ligeramente los supuestos técnicos (las llamadas pruebas de robustez) es la principal forma de combatir la especificación incorrecta.

Criterios de selección de modelos

La selección de criterios de modelado elegirá el modelo que más se aproxime al modelo verdadero. El Criterio de Información de Akaike (AIC) y el Criterio de Información Bayesiano (BIC) son ejemplos de criterios asintóticamente eficientes.

Desarrollos y macrodatos

Los avances recientes han tenido un gran impacto en la bioestadística. Dos cambios importantes han sido la capacidad de recopilar datos a gran escala y la capacidad de realizar análisis mucho más complejos mediante técnicas computacionales. Esto se debe al desarrollo en áreas como las tecnologías de secuenciación , la bioinformática y el aprendizaje automático ( aprendizaje automático en bioinformática ).

Uso en datos de alto rendimiento

Las nuevas tecnologías biomédicas, como los microarrays , los secuenciadores de nueva generación (para genómica) y la espectrometría de masas (para proteómica), generan enormes cantidades de datos, lo que permite realizar muchas pruebas simultáneamente. [ 20 ] Se requiere un análisis cuidadoso con métodos bioestadísticos para separar la señal del ruido. Por ejemplo, un microarray podría usarse para medir miles de genes simultáneamente, determinando cuáles de ellos tienen una expresión diferente en células enfermas en comparación con células normales. Sin embargo, solo una fracción de los genes se expresará diferencialmente. [ 21 ]

La multicolinealidad suele ocurrir en entornos bioestadísticos de alto rendimiento. Debido a la alta intercorrelación entre los predictores (como los niveles de expresión génica ), la información de un predictor puede estar contenida en otro. Podría darse el caso de que solo el 5% de los predictores expliquen el 90% de la variabilidad de la respuesta. En tal caso, se podría aplicar la técnica bioestadística de reducción de dimensionalidad (por ejemplo, mediante el análisis de componentes principales). Las técnicas estadísticas clásicas, como la regresión lineal o logística y el análisis discriminante lineal, no funcionan bien con datos de alta dimensionalidad (es decir, cuando el número de observaciones n es menor que el número de características o predictores p: n < p). De hecho, se pueden obtener valores de R² bastante altos a pesar de la baja capacidad predictiva del modelo estadístico. Estas técnicas estadísticas clásicas (especialmente la regresión lineal por mínimos cuadrados ) se desarrollaron para datos de baja dimensionalidad (es decir, cuando el número de observaciones n es mucho mayor que el número de predictores p: n >> p). En casos de alta dimensionalidad, siempre se debe considerar un conjunto de prueba de validación independiente y la suma de cuadrados residuales (RSS) y R 2 correspondientes del conjunto de prueba de validación, no los del conjunto de entrenamiento.

A menudo, resulta útil combinar información de múltiples predictores. Por ejemplo, el Análisis de Enriquecimiento de Conjuntos de Genes (GSEA) considera la perturbación de conjuntos de genes completos (funcionalmente relacionados) en lugar de genes individuales. [ 22 ] Estos conjuntos de genes podrían ser vías bioquímicas conocidas u otros genes funcionalmente relacionados. La ventaja de este enfoque es su mayor robustez: es más probable que se encuentre una perturbación falsa en un solo gen que en una vía completa. Además, mediante este enfoque se puede integrar el conocimiento acumulado sobre vías bioquímicas (como la vía de señalización JAK-STAT ).

Avances en bioinformática en bases de datos, minería de datos e interpretación biológica.

El desarrollo de bases de datos biológicas permite el almacenamiento y la gestión de datos biológicos, con la posibilidad de garantizar el acceso a usuarios de todo el mundo. Son útiles para investigadores que depositan datos, recuperan información y archivos (en bruto o procesados) originados en otros experimentos o indexan artículos científicos, como PubMed . Otra posibilidad es buscar el término deseado (un gen, una proteína, una enfermedad, un organismo, etc.) y consultar todos los resultados relacionados con esta búsqueda. Existen bases de datos dedicadas a los SNP ( dbSNP ), al conocimiento sobre la caracterización de genes y sus vías ( KEGG ) y a la descripción de la función genética clasificándola por componente celular, función molecular y proceso biológico ( Ontología Génica ). [ 23 ] Además de las bases de datos que contienen información molecular específica, existen otras que son amplias en el sentido de que almacenan información sobre un organismo o grupo de organismos. Como ejemplo de una base de datos dirigida a un solo organismo, pero que contiene muchos datos sobre él, es la base de datos genética y molecular de Arabidopsis thaliana (TAIR). [ 24 ] Phytozome, [ 25 ] a su vez, almacena los ensamblajes y archivos de anotación de docenas de genomas de plantas, y también contiene herramientas de visualización y análisis. Además, existe una interconexión entre algunas bases de datos en el intercambio/compartición de información y una iniciativa importante fue la Colaboración Internacional de Bases de Datos de Secuencias de Nucleótidos (INSDC) [ 26 ] que relaciona datos de DDBJ, [ 27 ] EMBL-EBI, [ 28 ] y NCBI. [ 29 ]

Hoy en día, el aumento en el tamaño y la complejidad de los conjuntos de datos moleculares lleva al uso de métodos estadísticos potentes proporcionados por algoritmos de ciencias de la computación desarrollados por el área de aprendizaje automático . Por lo tanto, la minería de datos y el aprendizaje automático permiten la detección de patrones en datos con una estructura compleja, como los biológicos, mediante el uso de métodos de aprendizaje supervisado y no supervisado , regresión, detección de clústeres y minería de reglas de asociación , entre otros. [ 23 ] Para indicar algunos de ellos, los mapas autoorganizados y k -medias son ejemplos de algoritmos de clúster; la implementación de redes neuronales y los modelos de máquinas de vectores de soporte son ejemplos de algoritmos comunes de aprendizaje automático.

El trabajo colaborativo entre biólogos moleculares, bioinformáticos, estadísticos e informáticos es importante para realizar un experimento correctamente, desde la planificación, pasando por la generación y el análisis de datos, hasta la interpretación biológica de los resultados. [ 23 ]

Uso de métodos computacionalmente intensivos

Por otro lado, la llegada de la tecnología informática moderna y de recursos informáticos relativamente económicos ha posibilitado el uso de métodos bioestadísticos que requieren un uso intensivo de la computadora, como los métodos de remuestreo y de bootstrapping .

En los últimos tiempos, los bosques aleatorios han ganado popularidad como método para realizar clasificación estadística . Las técnicas de bosques aleatorios generan un conjunto de árboles de decisión. Los árboles de decisión tienen la ventaja de que se pueden dibujar e interpretar (incluso con conocimientos básicos de matemáticas y estadística). Por lo tanto, los bosques aleatorios se han utilizado en sistemas de apoyo a la toma de decisiones clínicas. [ 30 ]

Aplicaciones

Salud pública

Salud pública , incluyendo epidemiología , investigación en servicios de salud , nutrición , salud ambiental y políticas y gestión de la atención médica. En estos contenidos médicos , es importante considerar el diseño y el análisis de los ensayos clínicos . Como ejemplo, está la evaluación de la gravedad de la enfermedad en un paciente y el pronóstico de su evolución.

Gracias a las nuevas tecnologías y al conocimiento genético, la bioestadística se utiliza ahora también en la medicina de sistemas , que consiste en una medicina más personalizada. Para ello, se integran datos de diferentes fuentes, incluyendo datos convencionales del paciente, parámetros clínico-patológicos, datos moleculares y genéticos, así como datos generados por tecnologías ómicas novedosas. [ 31 ]

Genética cuantitativa

El estudio de la genética de poblaciones y la genética estadística busca vincular la variación genotípica con la variación fenotípica . En otras palabras, se busca descubrir la base genética de un rasgo medible, un rasgo cuantitativo, que se encuentra bajo control poligénico. Una región del genoma responsable de un rasgo continuo se denomina locus de rasgo cuantitativo (QTL). El estudio de los QTL se hace posible mediante el uso de marcadores moleculares y la medición de rasgos en poblaciones, pero su mapeo requiere la obtención de una población a partir de un cruzamiento experimental, como una generación F2 o líneas/ cepas endogámicas recombinantes (RIL). Para buscar regiones QTL en un genoma, es necesario construir un mapa genético basado en el ligamiento. Algunos de los algoritmos de mapeo de QTL más conocidos son el mapeo de intervalos, el mapeo de intervalos compuestos y el mapeo de intervalos múltiples. [ 32 ]

Sin embargo, la resolución del mapeo de QTL se ve afectada por la cantidad de recombinación analizada, un problema para especies en las que es difícil obtener descendencia numerosa. Además, la diversidad alélica se restringe a individuos originados de progenitores contrastantes, lo que limita los estudios de diversidad alélica cuando se dispone de un panel de individuos que representan una población natural. [ 33 ] Por esta razón, se propuso el estudio de asociación de todo el genoma para identificar QTL basados ​​en el desequilibrio de ligamiento , es decir, la asociación no aleatoria entre rasgos y marcadores moleculares. Esto se vio impulsado por el desarrollo del genotipado de SNP de alto rendimiento . [ 34 ]

En el mejoramiento animal y vegetal , el uso de marcadores en la selección orientada al mejoramiento, principalmente los moleculares, contribuyó al desarrollo de la selección asistida por marcadores . Si bien el mapeo de QTL es limitado debido a la resolución, el GWAS no tiene suficiente poder cuando las variantes raras de pequeño efecto que también están influenciadas por el ambiente. Por lo tanto, surge el concepto de Selección Genómica (GS) para utilizar todos los marcadores moleculares en la selección y permitir la predicción del desempeño de los candidatos en esta selección. La propuesta es genotipificar y fenotipificar una población de entrenamiento, desarrollar un modelo que pueda obtener los valores genómicos estimados de cría (GEBV) de individuos que pertenecen a una población genotípica pero no fenotípica, llamada población de prueba. [ 35 ] Este tipo de estudio también podría incluir una población de validación, pensando en el concepto de validación cruzada , en la que los resultados fenotípicos reales medidos en esta población se comparan con los resultados fenotípicos basados ​​en la predicción, lo que se utiliza para verificar la precisión del modelo.

A modo de resumen, algunos puntos sobre la aplicación de la genética cuantitativa son:

Datos de expresión

Los estudios de expresión diferencial de genes a partir de datos de RNA-Seq , al igual que los de RT-qPCR y microarrays , requieren la comparación de condiciones. El objetivo es identificar genes que presenten un cambio significativo en su abundancia entre diferentes condiciones. Para ello, se diseñan experimentos adecuados, con réplicas para cada condición/tratamiento, aleatorización y bloqueo, cuando sea necesario. En RNA-Seq, la cuantificación de la expresión utiliza la información de las lecturas mapeadas, que se resumen en una unidad genética, como los exones que forman parte de una secuencia genética. Si bien los resultados de los microarrays pueden aproximarse mediante una distribución normal, los datos de recuento de RNA-Seq se explican mejor mediante otras distribuciones. La primera distribución utilizada fue la de Poisson , pero subestima el error de muestreo, lo que genera falsos positivos. Actualmente, la variación biológica se considera mediante métodos que estiman un parámetro de dispersión de una distribución binomial negativa . Se utilizan modelos lineales generalizados para realizar las pruebas de significación estadística y, dado el elevado número de genes, es necesario considerar la corrección para pruebas múltiples. [ 36 ] Algunos ejemplos de otros análisis de datos genómicos provienen de experimentos de microarrays o proteómica . [ 37 ] [ 38 ] A menudo relacionados con enfermedades o etapas de enfermedades. [ 39 ]

Otros estudios

Herramientas

Existen numerosas herramientas que pueden utilizarse para realizar análisis estadísticos de datos biológicos. La mayoría de ellas son útiles en otras áreas del conocimiento y abarcan un gran número de aplicaciones (en orden alfabético). A continuación, se presentan breves descripciones de algunas de ellas:

  • ASReml : Otro software desarrollado por VSNi [ 42 ] que también puede utilizarse en el entorno R como paquete. Está diseñado para estimar componentes de varianza bajo un modelo lineal mixto general mediante máxima verosimilitud restringida (REML). Permite modelos con efectos fijos y aleatorios, así como modelos anidados o cruzados. Ofrece la posibilidad de investigar diferentes estructuras de matriz de varianza-covarianza .
  • CycDesigN: [ 43 ] Un paquete informático desarrollado por VSNi [ 42 ] que ayuda a los investigadores a crear diseños experimentales y analizar datos provenientes de un diseño presente en una de las tres clases manejadas por CycDesigN. Estas clases son diseños resolubles, no resolubles, parcialmente replicados y cruzados . Incluye diseños menos utilizados, como los latinizados, como el diseño t-latinizado. [ 44 ]
  • Orange : Una interfaz de programación para el procesamiento de datos de alto nivel, minería de datos y visualización de datos. Incluye herramientas para la expresión génica y la genómica. [ 23 ]
  • R : Un entorno y lenguaje de programación de código abierto dedicado a la computación estadística y los gráficos. Es una implementación del lenguaje S mantenida por CRAN. [ 45 ] Además de sus funciones para leer tablas de datos, tomar estadísticas descriptivas, desarrollar y evaluar modelos, su repositorio contiene paquetes desarrollados por investigadores de todo el mundo. Esto permite el desarrollo de funciones escritas para manejar el análisis estadístico de datos que provienen de aplicaciones específicas. [ 46 ] En el caso de la bioinformática, por ejemplo, hay paquetes ubicados en el repositorio principal (CRAN) y en otros, como Bioconductor . También es posible utilizar paquetes en desarrollo que se comparten en servicios de alojamiento como GitHub .
  • SAS : Un software de análisis de datos ampliamente utilizado en universidades, empresas de servicios e industria. Desarrollado por una empresa del mismo nombre ( SAS Institute ), utiliza el lenguaje SAS para su programación.
  • PLA 3.0: [ 47 ] Es un software de análisis bioestadístico para entornos regulados (por ejemplo, pruebas de fármacos) que admite ensayos de respuesta cuantitativa (línea paralela, logística paralela, relación de pendiente) y ensayos dicotómicos (respuesta cuantitativa, ensayos binarios). También admite métodos de ponderación para cálculos de combinación y la agregación automática de datos de ensayos independientes.
  • Weka : Un software Java para aprendizaje automático y minería de datos , que incluye herramientas y métodos para visualización, agrupamiento, regresión, reglas de asociación y clasificación. Dispone de herramientas para validación cruzada, remuestreo (bootstrapping) y un módulo de comparación de algoritmos. Weka también puede ejecutarse en otros lenguajes de programación como Perl o R. [ 23 ]
  • Python (lenguaje de programación) , análisis de imágenes, aprendizaje profundo, aprendizaje automático
  • bases de datos SQL
  • NoSQL
  • NumPy numérico en Python
  • SciPy
  • SageMath
  • Álgebra lineal LAPACK
  • MATLAB
  • Apache Hadoop
  • Apache Spark
  • Servicios web de Amazon

Alcance y programas de formación

Casi todos los programas educativos en bioestadística son de nivel de posgrado . Se imparten con mayor frecuencia en escuelas de salud pública, adscritas a facultades de medicina, silvicultura o agricultura, o como área de aplicación en departamentos de estadística.

En Estados Unidos, donde varias universidades cuentan con departamentos de bioestadística, muchas otras universidades de primer nivel integran a su profesorado en estadística u otros departamentos, como epidemiología . Por lo tanto, los departamentos denominados "bioestadística" pueden tener estructuras muy diferentes. Por ejemplo, se han fundado departamentos de bioestadística relativamente nuevos centrados en la bioinformática y la biología computacional , mientras que los departamentos más antiguos, generalmente afiliados a facultades de salud pública , suelen tener líneas de investigación más tradicionales que incluyen estudios epidemiológicos y ensayos clínicos , además de bioinformática. En las universidades más grandes del mundo, donde existen departamentos tanto de estadística como de bioestadística, el grado de integración entre ambos puede variar desde la mínima hasta una colaboración muy estrecha. En general, la diferencia entre un programa de estadística y un programa de bioestadística es doble: (i) los departamentos de estadística suelen albergar investigaciones teóricas/metodológicas que son menos comunes en los programas de bioestadística y (ii) los departamentos de estadística tienen líneas de investigación que pueden incluir aplicaciones biomédicas, pero también otras áreas como la industria ( control de calidad ), los negocios y la economía , y áreas biológicas distintas de la medicina.

Revistas especializadas

  • Bioestadística [ 48 ]
  • Revista Internacional de Bioestadística [ 49 ]
  • Revista de Epidemiología y Bioestadística [ 50 ]
  • Bioestadística y Salud Pública [ 51 ]
  • Biometría [ 52 ]
  • Biometrika [ 53 ]
  • Revista Biométrica [ 54 ]
  • Comunicaciones en Biometría y Ciencias Agrícolas [ 55 ]
  • Aplicaciones estadísticas en genética y biología molecular [ 56 ]
  • Métodos estadísticos en la investigación médica [ 57 ]
  • Estadísticas farmacéuticas [ 58 ]
  • Estadísticas en Medicina [ 59 ]

Véase también

Referencias

  1. Leaverton, Paul E.; Vaughn, Frances L.; Zhu, Yiliang (24 de octubre de 2016). «Bioestadística» . Enciclopedia Internacional de Salud Pública . págs. 223–232 . doi : 10.1016/B978-0-12-803678-5.00034-5 . ISBN  978-0-12-803708-9. Consultado el 29 de agosto de 2025 .{{cite book}}: |journal=ignorado ( ayuda )
  2. Centro para la Innovación Transformadora, Universidad Tecnológica de Swinburne. "Allan, Frances Elizabeth (Betty) - Persona - Enciclopedia de la Ciencia y la Innovación Australianas" . www.eoas.info . Consultado el 26 de octubre de 2022 .
  3. Gunter, Chris (10 de diciembre de 2008). "Genética cuantitativa" . Nature . 456 (7223): 719. Bibcode : 2008Natur.456..719G . doi : 10.1038/456719a . PMID 19079046 . 
  4. Charles T. Munger (3 de octubre de 2003). "Economía académica: fortalezas y defectos tras considerar las necesidades interdisciplinarias" (PDF) . Archivado (PDF) del original el 9 de octubre de 2022.
  5. 1 2 3 Nizamuddin, Sarah L.; Nizamuddin, Junaid; Mueller, Ariel; Ramakrishna, Harish; Shahul, Sajid S. (octubre de 2017). "Desarrollo de una hipótesis y planificación estadística". Journal of Cardiothoracic and Vascular Anesthesia . 31 (5): 1878– 1882. doi : 10.1053/j.jvca.2017.04.020 . PMID 28778775 . 
  6. 1 2 3 4 Overholser, Brian R; Sowinski, Kevin M (2017). "Introducción a la bioestadística: Parte I". Nutrición en la práctica clínica . 22 (6): 629– 35. doi : 10.1177/0115426507022006629 . PMID 18042950 . 
  7. Szczech, Lynda Anne; Coladonato, Joseph A.; Owen, William F. (4 de octubre de 2002). "Conceptos clave en bioestadística: uso de la estadística para responder a la pregunta "¿Existe una diferencia?"". Seminars in Dialysis . 15 (5): 347– 351. doi : 10.1046/j.1525-139X.2002.00085.x . PMID 12358639 . S2CID 30875225 .  
  8. Sandelowski, Margarete (2000). "Combinación de técnicas cualitativas y cuantitativas de muestreo, recopilación de datos y análisis en estudios de métodos mixtos". Research in Nursing & Health . 23 (3): 246– 255. CiteSeerX 10.1.1.472.7825 . doi : 10.1002/1098-240X(200006)23:3 < 246::AID-NUR9 > 3.0.CO ; 2-H . PMID 10871540 . S2CID 10733556 .   
  9. Matemáticas, Sangaku. "Frecuencia absoluta, relativa, acumulativa y tablas estadísticas – Probabilidad y estadística" . www.sangakoo.com . Consultado el 10 de abril de 2018 .
  10. ^ " DATOSUS: TabNet Win32 3.0: Nascidos vivos - Brasil" . DATOS: Tecnologia da Informação a Serviço do SUS .
  11. 1 2 3 4 Forthofer, Ronald N.; Lee, Eun Sul (1995). Introducción a la bioestadística. Una guía para el diseño, el análisis y el descubrimiento . Academic Press. ISBN 978-0-12-262270-0.
  12. Pearson, Karl (1895-01-01). "X. Contribuciones a la teoría matemática de la evolución.—II. Variación asimétrica en material homogéneo" . Phil. Trans. R. Soc. Lond. A. 186 : 343–414 . Bibcode : 1895RSPTA.186..343P . doi : 10.1098 /rsta.1895.0010 . ISSN 0264-3820 . 
  13. Utts, Jessica M. (2005). Seeing through statistics (3.ª ed.). Belmont, CA: Thomson, Brooks/Cole. ISBN  978-0534394028OCLC 56568530 .​ 
  14. Jarrell, Stephen B. (1994). Estadística básica . Dubuque, Iowa: Wm. C. Brown Pub. ISBN 978-0697215956OCLC 30301196 
  15. Gujarati, Damodar N. (2006). Econometría . McGraw-Hill Irwin.
  16. Watson, Lyndsey (2009). "Fundamentos de bioestadística en salud pública y libro de ejercicios de fundamentos de bioestadística: computación estadística con Excel" . Revista australiana y neozelandesa de salud pública . 33 (2): 196–197 . doi : 10.1111/j.1753-6405.2009.00372.x . ISSN 1326-0200 . 
  17. Baker, Monya (2016). "Los estadísticos advierten sobre el mal uso de los valores p" . Nature . 531 (7593): 151. Bibcode : 2016Natur.531..151B . doi : 10.1038/nature.2016.19503 . PMID 26961635 . 
  18. Benjamini, Y. y Hochberg, Y. Control del índice de falsos descubrimientos: un enfoque práctico y potente para las pruebas múltiples. Journal of the Royal Statistical Society. Serie B (Metodológica) 57, 289–300 (1995).
  19. "Hipótesis nula" . www.statlect.com . Consultado el 8 de mayo de 2018 .
  20. Hayden, Erika Check (8 de febrero de 2012). "Bioestadística: Análisis revelador" . Nature . 482 (7384): 263–265 . doi : 10.1038/nj7384-263a . PMID 22329008 . 
  21. Efron, Bradley (febrero de 2008). "Microarrays, Bayes empírico y el modelo de dos grupos". Statistical Science . 23 (1): 1– 22. arXiv : 0808.0572 . doi : 10.1214/07-STS236 . S2CID 8417479 . 
  22. Subramanian, A.; Tamayo, P.; Mootha, VK; Mukherjee, S.; Ebert, BL; Gillette, MA; Paulovich, A.; Pomeroy, SL; Golub, TR; Lander, ES; Mesirov, JP (30 de septiembre de 2005). "Análisis de enriquecimiento de conjuntos de genes: un enfoque basado en el conocimiento para interpretar perfiles de expresión de todo el genoma" . Actas de la Academia Nacional de Ciencias . 102 (43): 15545– 15550. Bibcode : 2005PNAS..10215545S . doi : 10.1073/pnas.0506580102 . PMC 1239896. PMID 16199517 .  
  23. 1 2 3 4 5 Moore, Jason H (2007). "Bioinformática" . Journal of Cellular Physiology . 213 (2): 365– 9. doi : 10.1002 / jcp.21218 . PMID 17654500. S2CID 221831488 .  
  24. "TAIR - Página principal" . www.arabidopsis.org .
  25. "Fitozoo" . phytozome.jgi.doe.gov .
  26. "Colaboración Internacional de Bases de Datos de Secuencias de Nucleótidos - INSDC" . www.insdc.org .
  27. "Arriba" . www.ddbj.nig.ac.jp. 11 de enero de 2024.
  28. "Instituto Europeo de Bioinformática < EMBL-EBI" . www.ebi.ac.uk .
  29. "Centro Nacional de Información Biotecnológica" . www.ncbi.nlm.nih.gov . Biblioteca Nacional de Medicina de EE. UU. –.
  30. "Un algoritmo que preserva la privacidad para sistemas de apoyo a la toma de decisiones clínicas mediante bosques aleatorios" . Tech Science Press . Consultado el 13 de junio de 2026 .
  31. Apweiler, Rolf; et al. (2018). "¿Hacia dónde se dirige la medicina de sistemas?" . Experimental & Molecular Medicine . 50 (3): e453. doi : 10.1038/emm.2017.290 . PMC 5898894 . PMID 29497170 .   
  32. Zeng, Zhao-Bang (2005). "Mapeo de QTL y la base genética de la adaptación: desarrollos recientes". Genetica . 123 ( 1–2 ) : 25–37 . doi : 10.1007/s10709-004-2705-0 . PMID 15881678. S2CID 1094152 .  
  33. Korte, Arthur; Farlow, Ashley (2013). "Las ventajas y limitaciones del análisis de rasgos con GWAS: una revisión" . Plant Methods . 9 (1): 29. Bibcode : 2013PlMet...9...29K . doi : 10.1186/1746-4811-9-29 . PMC 3750305. PMID 23876160 .  
  34. Zhu, Chengsong; Gore, Michael; Buckler, Edward S; Yu, Jianming (2008). "Estado y perspectivas del mapeo de asociación en plantas" . The Plant Genome . 1 plantgenome2008.02.0089: 5–20 . doi : 10.3835/plantgenome2008.02.0089 .
  35. Crossa, José; Pérez-Rodríguez, Paulino; Cuevas, Jaime; Montesinos López, Osval; Jarquín, Diego; De Los Campos, Gustavo; Burgueño, Juan; González-Camacho, Juan M; Pérez-Elizalde, Sergio; Beyene, Yosef; Dreisigacker, Susanne; Singh, Ravi; Zhang, Xuecai; Gowda, Manje; Roorkiwal, Manish; Rutkoski, Jessica; Varshney, Rajeev K (2017). "Selección genómica en fitomejoramiento: métodos, modelos y perspectivas" (PDF) . Tendencias en ciencia vegetal . 22 (11): 961– 975. Bibcode : 2017TPS....22..961C . doi : 10.1016/j.tplants.2017.08.011 . PMID 28965742. Archivado (PDF) del original el 9 de octubre de 2022 . 
  36. Oshlack, Alicia; Robinson, Mark D; Young, Matthew D (2010). "De las lecturas de RNA-seq a los resultados de expresión diferencial" . Genome Biology . 11 (12): 220. Bibcode : 2010GenBi..11..220O . doi : 10.1186/gb-2010-11-12-220 . PMC 3046478. PMID 21176179 .  
  37. Helen Causton; John Quackenbush; Alvis Brazma (2003). Análisis estadístico de datos de microarrays de expresión génica . Wiley-Blackwell.
  38. Terry Speed ​​(2003). Análisis de datos de expresión génica mediante microarrays: una guía para principiantes . Chapman & Hall/CRC.
  39. Frank Emmert-Streib; Matthias Dehmer (2010). Bioestadística médica para enfermedades complejas . Wiley-Blackwell. ISBN 978-3-527-32585-6.
  40. Warren J. Ewens; Gregory R. Grant (2004). Métodos estadísticos en bioinformática: una introducción . Springer.
  41. Matthias Dehmer; Frank Emmert-Streib; Armin Graber; Armindo Salvador (2011). Applied Statistics for Network Biology: Methods in Systems Biology . Wiley-Blackwell. ISBN 978-3-527-32750-8.
  42. 1 2 " Inicio - VSN International" . www.vsni.co.uk.
  43. "CycDesigN - VSN International" . www.vsni.co.uk .
  44. Piepho, Hans-Peter; Williams, Emlyn R; Michel, Volker (2015). "Más allá de los cuadrados latinos: un breve recorrido por los diseños de filas y columnas". Agronomy Journal . 107 (6): 2263. Bibcode : 2015AgrJ..107.2263P . doi : 10.2134/agronj15.0144 .
  45. "La red integral de archivos R" . cran.r-project.org .
  46. Renganathan V (2021). Bioestadística explorada mediante el software R: Una visión general . Vinaitheerthan Renganathan. ISBN 9789354936586.
  47. Stegmann, Dr Ralf (2019-07-01). "PLA 3.0" . PLA 3.0 – Software para análisis bioestadístico . Recuperado el 2019-07-02 .
  48. "Bioestadística - Oxford Academic" . OUP Academic .
  49. "Revista Internacional de Bioestadística" .
  50. "Las revistas de PubMed serán clausuradas" . 15 de junio de 2018.
  51. https://ebph.it/ Epidemiología
  52. "Biometrics" . onlinelibrary.wiley.com . doi : 10.1111/(ISSN)1541-0420 .
  53. "Biometrika - Oxford Academic" . OUP Academic .
  54. "Biometrical Journal" . onlinelibrary.wiley.com . doi : 10.1002/(ISSN)1521-4036 .
  55. "Comunicaciones en Biometría y Ciencias Agrícolas" . agrobiol.sggw.waw.pl .
  56. "Aplicaciones estadísticas en genética y biología molecular" . www.degruyter.com . 1 de mayo de 2002.
  57. "Métodos estadísticos en la investigación médica" . SAGE Journals . 12 de diciembre de 2024.
  58. "Estadística farmacéutica" . onlinelibrary.wiley.com . doi : 10.1002/(ISSN)1539-1612 .
  59. "Estadística en Medicina" . onlinelibrary.wiley.com . doi : 10.1002/(ISSN)1097-0258 .
  • Logotipo de Wikimedia CommonsContenido multimedia relacionado con la bioestadística en Wikimedia Commons.
  • La Sociedad Biométrica Internacional
  • Colección de Archivos de Investigación en Bioestadística
  • Guía de Bioestadística (MedPageToday.com) Archivada el 22/05/2012 en Wayback Machine.
  • Estadística biomédica