Septiembre 2026. Volumen 22. Número 3

Cómo se interpreta un metanálisis: conceptos básicos

 
 
 
 
 
 
 
 
 
 
Valoración: 0 (0 Votos)
Suscripción gratuita al boletín de novedades
Reciba periódicamente por correo electrónico los últimos artículos publicados
Suscribirse
Imprimir
Añadir a biblioteca
Comentar este artículo

AM | Apuntes metodológicos

Autores: Pérez-Moneo Agapito B1, Ortega Páez E2, Cuestas Montañés EJ3.
1Servicio de Pediatría. Hospital Universitario Infanta Leonor. Facultad de Medicina. Universidad Complutense. Madrid. España.
2Pediatra. CS Góngora. Distrito Granada-Metropolitano. Granada. España.
3Servicio de Pediatría y Neonatología. Hospital Privado Universitario de Córdoba. Córdoba. Argentina.
Correspondencia: Begoña Pérez-Moneo Agapito. Correo electrónico: begopma@gmail.com
Fecha de recepción: 10/09/2026
Fecha de aceptación: 16/09/2026
Fecha de publicación: 30/09/2026

AM | Apuntes metodológicos

Autores: Pérez-Moneo Agapito B1, Ortega Páez E2, Cuestas Montañés EJ3.
1Servicio de Pediatría. Hospital Universitario Infanta Leonor. Facultad de Medicina. Universidad Complutense. Madrid. España.
2Pediatra. CS Góngora. Distrito Granada-Metropolitano. Granada. España.
3Servicio de Pediatría y Neonatología. Hospital Privado Universitario de Córdoba. Córdoba. Argentina.
Correspondencia: Begoña Pérez-Moneo Agapito. Correo electrónico: begopma@gmail.com
Fecha de recepción: 10/09/2026
Fecha de aceptación: 16/09/2026
Fecha de publicación: 30/09/2026

1. ¿Qué es un metanálisis?

Un metanálisis (MA) es un conjunto de procedimientos estadísticos diseñados para realizar una síntesis cuantitativa de los resultados de diferentes estudios independientes que abordan una misma pregunta de investigación. Se considera el paso final de una revisión sistemática, donde la combinación de estudios individuales —preferentemente ensayos clínicos aleatorizados (ECA), pero, como veremos en el estudio escogido como ejemplo, puede ser de cualquier tipo de diseño— permite obtener una información más completa y robusta.

Sus objetivos principales son:

  • Aumentar el poder estadístico: al combinar muestras, se pueden detectar diferencias que los estudios pequeños no logran identificar por sí solos.
  • Mejorar la precisión: ofrece una medida global ponderada del efecto con intervalos de confianza más estrechos.
  • Resolver controversias: ayuda a obtener conclusiones firmes cuando los estudios primarios muestran resultados contradictorios.
  • Facilitar la generalización: al incluir poblaciones y entornos diversos, los resultados tienen mayor validez externa.

Pese a todas las bondades referidas, un MA estadísticamente significativo no implica necesariamente que la evidencia sea de alta calidad. La interpretación final también debe considerar la certeza de la evidencia mediante herramientas como GRADE, que evalúan aspectos como el riesgo de sesgo, la consistencia de los resultados entre los estudios, la precisión de las estimaciones, la aplicabilidad de la evidencia a la pregunta clínica y el posible sesgo de publicación. De este modo, la magnitud del efecto y la confianza que merece ese efecto constituyen dos dimensiones complementarias para interpretar los resultados.

En este número de Evidencias en Pediatría se valora críticamente el artículo de Núñez García B, Álvarez-García N. Association between endocrine disruptors and surgical congenital malformations: Systematic review and meta-analysis. J Pediatr Surg. 2026;61:162829, que se toma de ejemplo para este apunte metodológico.

2. El problema de la heterogeneidad

La heterogeneidad se define como la variabilidad existente entre los resultados de los estimadores de los distintos estudios incluidos. Esta puede ser: clínica (diferencias en pacientes o intervenciones), metodológica (diferencias en el diseño) o estadística (variación de los resultados más allá de lo esperado por el azar).

Para evaluarla, se utilizan herramientas específicas:

  • Q de Cochran: mide las desviaciones de cada estudio con el resultado global, ponderando cada estudio según su contribución al resultado global. Es un test de significación donde un valor de p <0,1 suele indicar la presencia de heterogeneidad. Solo nos indica cómo es de probable que la dispersión de los resultados sea solo por azar.
  • Estadístico I2: mide el porcentaje de la variabilidad que no es debida al azar, por lo que nos podemos hacer una idea mejor de la magnitud de la heterogeneidad al ser un valor relativo. Se interpreta del mismo modo en todos los MA, de la siguiente forma: 25% (baja), 50% (moderada) y 75% (alta heterogeneidad). Es la herramienta más utilizada.
  • τ2 (tau-cuadrado): se utiliza en los modelos de efectos aleatorios para representar la varianza de los resultados entre los diferentes estudios. Al ser un valor absoluto resulta comparable entre distintos subgrupos de un mismo MA, pero no entre distintos MA.
  • H2: medida menos común que estima el exceso del valor de Q respecto al esperado si no hubiera heterogeneidad; su principal utilidad es permitir el cálculo de intervalos de confianza para el I2.

Por otro lado, dependiendo del grado de heterogeneidad, los autores eligen el modelo matemático para combinar los datos y dar una medida de resultado única. Este modelo puede ser:

  • Modelo de efecto fijo: asume que existe un único tamaño de efecto real y que las diferencias se deben solo al error de muestreo. Se usa cuando hay poca heterogeneidad.
  • Modelo de efectos aleatorios: en este caso, asume que el efecto varía entre estudios. Es más conservador, otorga más peso relativo a los estudios pequeños y genera intervalos de confianza más amplios.

Finalmente, hay que considerar el intervalo de predicción. En los MA con modelos de efectos aleatorios es recomendable presentar, además del intervalo de confianza del efecto combinado, el intervalo de predicción. Mientras el primero refleja la precisión con la que se estima el efecto medio, el intervalo de predicción estima el rango de efectos que cabría esperar en un nuevo estudio realizado en condiciones similares. Su interpretación es especialmente útil cuando existe heterogeneidad importante, ya que ayuda a valorar la aplicabilidad clínica de los resultados.

En el artículo analizado en Evidencias en Pediatría se evalúa la heterogeneidad de los estudios incluidos para cada tipo de malformación con el estadístico I2. Sus valores se pueden ver en el citado artículo (pág. 6, fig. 2.), que presenta un forest plot, y oscilan entre un 42 y un 81%, con valores de p inferiores a 0,1 en todos los casos.

Para la combinación de resultados utilizan un modelo de efectos aleatorios denominado DerSimonian-Laird, que precisa del cálculo de la τ2 para estimar los intervalos de confianza de la odds ratio (OR). En cambio, no aportan los valores de τ2 para la valoración de la heterogeneidad y prefieren dar una medida relativa como el I2.

3. Y, ¿cuándo se usan los análisis por subgrupos, los análisis de sensibilidad y la metarregresión?

Cuando existe heterogeneidad o se busca profundizar en los resultados, se recurre a técnicas adicionales:

  • Análisis por subgrupos: consiste en dividir los estudios en grupos según características específicas (ej.: dosis del fármaco, edad de los pacientes) para ver cómo varía el efecto. Deben estar establecidos a priori en el protocolo para evitar hallazgos falsos por comparaciones múltiples.
  • Análisis de sensibilidad: evalúa la robustez de los resultados omitiendo un estudio cada vez y repitiendo el MA. Si la conclusión no cambia tras estas exclusiones, se considera que el resultado es estable y fiable.
  • Metarregresión: es una técnica estadística compleja que utiliza modelos de regresión (generalmente lineal múltiple) donde la variable dependiente es el efecto observado y las independientes son las características de los estudios. Permite explorar qué factores específicos explican la heterogeneidad.

El apartado 3.6 del artículo de ejemplo hace referencia a estos tres análisis:

  • Subgrupos: dividen los estudios entre los de alta y baja calidad metodológica; la segunda división es entre estudios que usan biomarcadores frente a los que usan cuestionarios para conocer las exposiciones, y finalmente dividen entre el trimestre de exposición.
  • Hacen estudio de sensibilidad excluyendo los estudios de baja calidad metodológica, encontrando que la relación sigue siendo significativa para las malformaciones cardiacas e hipospadias.
  • Finalmente, hacen una metarregresión, cuyo análisis muestra el mayor peso de los estudios que emplean biomarcadores.

4. Resumen gráfico del MA: interpretación del forest plot (o diagrama de bosque)

El forest plot es la representación gráfica central del MA. Permite visualizar de un vistazo lo que aporta cada estudio y el resultado final acumulado.

Sus partes se pueden ver en la Figura 1 señaladas con su número en rojo:

  1. Columna de identificación: nombre del primer autor y año del estudio.
  2. Datos numéricos: para cada estudio se indican el número de eventos o medida principal del efecto, con el total de participantes. A continuación, se aporta el valor ponderado con su intervalo de confianza del 95% (IC 95).
  3. Línea vertical central: representa el valor del efecto nulo. Se sitúa en el 1 para medidas de cociente (RR, OR) y en el 0 para medidas de diferencia (diferencia de medias).
  4. Cuadrados: representan el resultado de cada estudio. Su tamaño es proporcional al peso de cada estudio; es decir, la importancia que tiene ese estudio en el cálculo global.
  5. Líneas horizontales: marcan los límites del IC 95 de cada estudio. Si esta línea cruza la línea vertical de efecto nulo, el resultado de ese estudio no es estadísticamente significativo.
  6. Diamante: es el resultado global situado al final del gráfico o al final de cada subgrupo. El centro indica el valor del efecto combinado y su anchura representa el IC global. Si el diamante no toca la línea vertical, el resultado general es significativo.

Figura 1. Ejemplo de forest plot (datos ficticios). Mostrar/ocultar

A continuación, se va a analizar el forest plot incluido en el estudio original sobre el artículo comentado (Figura 2).

  1. Columna de identificación: aparecen subgrupos por tipo de malformación, sin que figuren los estudios individuales. No se indica cuántos estudios primarios se han incluido, ni el peso de ninguno de ellos.
  2. Datos numéricos: al no constar los estudios individuales no se documentan ni el número de eventos ni el total de participantes por grupo.
  3. Línea vertical central: debería representar el valor del efecto nulo, en este caso en el que ser representan odds ratio, en el 1, pero la línea discontinua vertical está trazada sobre el valor 2,0. Esto es un error grave que distorsiona la interpretación visual del gráfico.
  4. Cuadrados de cada estudio y su peso en el global: también faltan.
  5. Líneas horizontales: en este caso de color azul, representarían la amplitud del IC 95 de cada estudio. En este caso, todas tienen igual longitud.
  6. Diamante: en este caso, para cada subgrupo, tiene el mismo tamaño y está localizado en el mismo lugar para todos los estudios agrupados.

Figura 2. Forest plot recreado en base al del artículo original (datos ficticios). Mostrar/ocultar

En resumen, esta representación gráfica no sigue las recomendaciones y, por lo tanto, no es posible interpretarla.

5. Sesgos de publicación: ¿por qué son importantes?

El sesgo de publicación ocurre cuando los estudios con resultados positivos o significativos tienen más probabilidades de ser publicados que aquellos con resultados negativos o neutros y, por lo tanto, serán los incluidos en la revisión sistemática y metanálisis.

Para detectarlo, se utiliza el gráfico de embudo (o funnel plot). En ausencia de sesgo, el gráfico debe ser un embudo simétrico. Los estudios grandes aparecen concentrados en la parte superior y los pequeños se dispersan en la base. Una asimetría (falta de puntos en un lado del embudo) sugiere sesgo de publicación o problemas de calidad en los estudios pequeños (Figura 3).

Figura 3. Gráfico de embudo para el sesgo de publicación (datos ficticios). Mostrar/ocultar

En el artículo comentado no se aporta la figura, pero se hace referencia a que puede haber un posible sesgo de publicación de estudios pequeños con efectos grandes, y aportan el test de Egger (p = 0,034). Este test es un método estadístico diseñado para detectar la asimetría en el gráfico de embudo y se interpreta como que existe asimetría y, por tanto, sesgo de publicación, cuando el valor de p es menor de 0,1.

¿Es posible ofrecer en metanálisis de estudios observacionales los resultados de las medidas de impacto?

Sí, es posible expresar los resultados en NIE (número de impacto en lo expuestos) a partir de la aproximación del riesgo basal (Ro) del resultado, en el caso del MA sería el riesgo con menor valor del grupo no expuesto dentro de todos los estudios individuales. La fórmula sería:

NIE =
1 + Ro(OR ajustada − 1) Ro(1 − Ro)(OR ajustada − 1)

En el estudio original, no es posible calcular ni conocer el Ro ya que no se muestran los riesgos basales de los estudios, pero es posible aproximarlos conociendo la prevalencia basal de cada resultado, asumiendo que las malformaciones tienen una prevalencia muy baja y que los datos extraídos son representativos de la población de estudio. EUROCAT nos ofrece las prevalencias basales de las malformaciones des estudio. Calcularemos a modo de ejemplo la del hipospadias:

Ro = 0,001987

OR (ajustada) = 2,21

NIE =
1 + 0,001987(2,21 − 1) Ro(1 − 0,001987)(2,21 − 1)
= 417,76 ≈ 418

Para calcular los IC del NIE basta con introducir los IC de la OR.

Se produciría un caso adicional de hipospadias por cada 418 embarazos o nacimientos expuestos frente al grupo de referencia. Es un NIE aproximado, no directamente observado en el MA.

Para facilitar el cálculo de los demás resultados el lector puede utilizar Calcupedev.

Bibliografía

  • Calcupedev. Herramienta de cálculo epidemiológico en pediatría. E. Ortega Páez. Comité de Pediatría Basada en la Evidencia de la AEP. 2019 [en línea] [consultado el 15/09/2026]. Disponible en www.aepap.org/calculadora-estudios-pbe/#/
  • González de Dios J, Balaguer Santamaría A. Valoración crítica de artículos científicos. Parte 2: revisiones sistemáticas y metaanálisis. FAPap Monogr. 2021;6.
  • Kumar J, Kumar P, Goyal JP, Rajvanshi N, Prabhakaran K, Meena J, Gupta A. Role of nebulised magnesium sulfate in treating acute asthma in children: a systematic review and meta-analysis. BMJ Paediatr Open. 2024;8:e002638.
  • Martínez-González MA, Sánchez-Villegas A, Toledo Atucha E, Faulin Fajardo J. Bioestadística amigable. 3ª ed. Madrid: Elsevier España; 2014.
  • Meseguer Guaita F. Lectura crítica de un Metaanálisis y de una revisión sistemática. Ed: Grupo de Atención Sanitaria basada en la Evidencia. 2007. En: Atención sanitaria basada en la evidencia: su aplicación a la práctica clínica. Servicio Murciano de Salud [en línea] [consultado el 15/09/2026]. Disponible en https://sms.carm.es/ricsmur/handle/123456789/541
  • Comité de Pediatría Basada en la Evidencia de la AEP; Grupo de Trabajo de Pediatría Basada en la Evidencia de la AEPap (coords.). Medicina Basada en la Evidencia. Lo que siempre quiso saber sobre la evidencia aplicada a la práctica clínica sin morir en el intento. Madrid: Lúa Ediciones; 2024 [en línea] [consultado el 15/09/2026]. Disponible en https://evidenciasenpediatria.es/book/
  • Murad MH, Montori VM, Ioannidis JPA, Jaeschke R, Devereaux PJ, Prasad K, et al. How to read a systematic review and meta-analysis and apply the results to patient care. JAMA. 2014;312:171-9.

Cómo citar este artículo

Pérez-Moneo Agapito B, Ortega Páez E, Cuestas Montañés E. Cómo se interpreta un metanálisis: conceptos básicos. Evid Pediatr. 2026;22:34


Artículos relacionados

AVC | Disruptores endocrinos y malformaciones congénitas: una asociación sugerente, pero con evidencia limitada

Rivero Martín MJ, Gutiérrez Medina P. Disruptores endocrinos y malformaciones congénitas: una asociación sugerente, pero con evidencia limitada. Evid Pediatr. 2026;22:31.

30/09/2026

Comentario asociado

Apunte metodológico