Serie de Medicina Basada en Evidencia · Universidad Señor de Sipán

Calculadora de medidas de efecto e interpretación de la evidencia

Introduzca los datos de un artículo y obtenga la medida, su intervalo de confianza y una interpretación redactada, con advertencias automáticas y ejemplos publicados reales.

Dr. Joshuan J. Barboza Meca · Doctor en Investigación Clínica y Traslacional · Investigador Distinguido RENACYT · Miembro Cochrane – USIL afiliado al INS · ORCID 0000-0002-2896-1407
Módulo 1 · Desenlaces binarios

Tabla 2×2: RR, RD (RRA), OR, NNT y NND

El punto de partida de casi toda la literatura terapéutica. Introduzca los cuatro conteos y obtendrá las seis medidas con sus intervalos de confianza, la prueba de significación y una lectura clínica redactada.

Datos

Conteos crudos del artículo. Use el total del grupo, no el porcentaje.

Evento (sí)Evento (no)Total
Tratamiento 2104
Control 4321
Ejemplos:

Resultado

Riesgos observados y medidas derivadas.

Cómo se calcula

Desarrollo paso a paso con sus propios números.

Guía de lectura: qué informa y qué distorsiona cada medida

Riesgo relativo (RR). Proporción del riesgo que permanece tras la intervención. Es relativamente estable entre poblaciones con riesgos basales distintos, y por eso es la medida que se transporta y se agrupa en metaanálisis. No dice cuánta gente se beneficia.

Diferencia de riesgos (RD o RRA). Impacto absoluto en puntos porcentuales. Depende directamente del riesgo basal, de modo que no puede trasladarse de una población a otra sin recalcular. Es la medida que sostiene una decisión clínica.

Razón de odds (OR). Compara ventajas, no probabilidades. Aproxima al RR solo cuando el desenlace es infrecuente; con desenlaces frecuentes se aleja del valor nulo más que el RR —nunca al revés—, de modo que leerlo como riesgo relativo sobreestima siempre el efecto. En casos y controles es la única medida estimable.

NNT y NND. Inverso de la diferencia de riesgos. Requieren tres etiquetas obligatorias para ser interpretables: comparador, desenlace y horizonte temporal. Se redondean hacia arriba y deben reportarse con intervalo de confianza.

  • Si el intervalo de confianza de la diferencia de riesgos incluye el cero, el intervalo del NNT no es un rango continuo: abarca el infinito y se expresa como «NNT beneficio X a ∞ a NND Y».
  • La significación estadística no equivale a relevancia clínica: un intervalo estrecho alrededor de un efecto trivial es un resultado preciso e irrelevante.
Módulo 2 · Desenlaces continuos

Diferencia de medias (MD) y diferencia de medias estandarizada (SMD)

Para escalas, puntajes y variables numéricas. La MD conserva la unidad original y es interpretable; la SMD permite combinar instrumentos distintos a costa de perder la unidad.

Datos por grupo

Media, desviación estándar y tamaño de cada grupo.

Ejemplos:

Resultado

MD en la unidad original y SMD en desviaciones estándar.

Cómo se calcula

Incluye la corrección de Hedges para muestras pequeñas.

Guía de lectura: cuándo usar MD y cuándo SMD

Use MD cuando todos los estudios midieron con el mismo instrumento. Conserva la unidad y permite comparar con la diferencia mínima importante para el paciente, que es el único umbral clínicamente defendible.

Use SMD solo cuando los instrumentos difieren. Los umbrales convencionales de Cohen (0,2 pequeño; 0,5 moderado; 0,8 grande) son orientativos y no clínicos: una SMD de 0,2 en mortalidad importa más que una de 0,8 en una escala de satisfacción.

  • La g de Hedges corrige el sesgo al alza de la d de Cohen en muestras pequeñas; con n total por debajo de 50 la diferencia es apreciable.
  • Una SMD puede reconvertirse a la unidad original multiplicándola por la desviación estándar de un instrumento familiar. Es la forma honesta de comunicarla.
  • Si el artículo reporta error estándar en lugar de DE, recuerde que DE = EE × √n.
Módulo 3 · Análisis de supervivencia

Kaplan-Meier, prueba de log-rank y hazard ratio

Cuando importa no solo si ocurre el evento sino cuándo. Pegue los datos individuales y obtendrá las curvas, la mediana de supervivencia, la prueba de log-rank y el hazard ratio con su intervalo.

Datos individuales

Una línea por paciente: tiempo, evento(1/0), grupo(1=tratado / 0=control). Se aceptan comas, tabuladores o espacios.

Ejemplos:

Resultado

Log-rank y hazard ratio por el método de Peto (O−E)/V.

Curvas de Kaplan-Meier

Los trazos verticales pequeños marcan las censuras. Debajo, la tabla de sujetos en riesgo.

Tabla de vida y cálculo del log-rank

Cada fila es un tiempo de evento observado.

Guía de lectura: qué es y qué no es un hazard ratio

El HR es una razón de tasas instantáneas, promediada a lo largo de todo el seguimiento. Un HR de 0,70 no significa «un 30 % menos de muertes al final del estudio»: significa que, en cada instante, quien sigue en riesgo en el grupo tratado tiene un 30 % menos de probabilidad instantánea de presentar el evento.

Supuesto de riesgos proporcionales. El HR asume que esa razón se mantiene constante en el tiempo. Si las curvas se cruzan o se separan tarde, el HR promedia efectos opuestos y deja de ser interpretable; en ese caso hay que reportar diferencias de supervivencia a tiempos fijos o la media restringida de supervivencia (RMST).

  • La mediana de supervivencia solo existe si la curva baja del 50 %. Con seguimiento corto es frecuente que no se alcance: reportar «mediana no alcanzada» es correcto y no es un fallo.
  • La prueba de log-rank responde si las curvas difieren, no cuánto. Es sensible a diferencias tardías y poco potente cuando las curvas se cruzan.
  • Un HR nunca debe convertirse mecánicamente a NNT sin fijar un horizonte temporal y un riesgo basal.
Módulo 4 · Precisión diagnóstica

Sensibilidad, especificidad, razones de verosimilitud y valores predictivos

La exactitud de una prueba no depende del contexto; su utilidad clínica sí. Este módulo separa ambas cosas y muestra cómo la misma prueba cambia de valor al cambiar la prevalencia.

Tabla de contingencia

Prueba en estudio frente al estándar de referencia.

Enfermedad (+)Enfermedad (−)Total
Prueba positiva 133
Prueba negativa 367
Ejemplos:

Exactitud intrínseca

No cambia con la prevalencia.

Rendimiento en su escenario

Depende de la probabilidad pre-prueba que usted fijó.

De 1 000 personas evaluadas

Frecuencias naturales con la prevalencia indicada: la forma más comprensible de comunicar una prueba.

Nomograma de Fagan

Cómo la probabilidad pre-prueba se transforma en post-prueba según el resultado.

Probabilidad post-prueba según prevalencia

Guía de lectura: por qué las razones de verosimilitud son la medida útil

Sensibilidad y especificidad describen la prueba, no al paciente: responden «entre los enfermos, ¿cuántos salen positivos?». El clínico necesita la pregunta inversa, que es la que responden los valores predictivos, y esos sí dependen de la prevalencia.

Las razones de verosimilitud (LR) resuelven el problema: son intrínsecas como la sensibilidad y la especificidad, pero se aplican directamente sobre la probabilidad del paciente concreto mediante el teorema de Bayes. Reglas prácticas: LR+ mayor de 10 y LR− menor de 0,1 modifican de forma decisiva; entre 5–10 y 0,1–0,2 modifican de forma moderada; entre 1 y 2 (o entre 0,5 y 1) apenas mueven la probabilidad.

  • SnNout: con sensibilidad muy alta, un resultado negativo descarta. SpPin: con especificidad muy alta, un positivo confirma.
  • La razón de odds diagnóstica (DOR) resume la prueba en un solo número, pero pierde la asimetría entre descartar y confirmar; úsela solo para comparar pruebas, nunca para decidir.
  • El índice de Youden (Sens + Esp − 1) sirve para elegir un punto de corte solo si los costos de un falso positivo y de un falso negativo son equivalentes, lo que casi nunca ocurre.
Módulo 5 · Curva ROC

Área bajo la curva, puntos de corte y utilidad clínica

Pegue los valores de un marcador continuo junto con el estado real de cada sujeto y obtendrá la curva ROC completa, el AUC con su intervalo, y la tabla de rendimiento en cada punto de corte posible.

Datos individuales

Una línea por sujeto: valor del marcador, estado(1=enfermo / 0=sano).

Ejemplos:

Curva ROC

La diagonal representa una prueba sin capacidad discriminante.

Rendimiento por punto de corte

Resaltado en verde el corte que maximiza el índice de Youden.

Guía de lectura: el AUC no es la utilidad clínica

El área bajo la curva es la probabilidad de que un enfermo elegido al azar tenga un valor del marcador más extremo que un sano elegido al azar. Es una medida global de discriminación y tiene dos limitaciones importantes.

  • Ignora la calibración. Un modelo puede ordenar bien a los pacientes y aun así predecir probabilidades sistemáticamente erróneas, lo que lo hace inservible para decidir.
  • Trata por igual todos los umbrales, incluidos los que nadie usaría en la práctica, y pondera igual falsos positivos y falsos negativos.
  • Umbrales orientativos: 0,5 nula; 0,6–0,7 pobre; 0,7–0,8 aceptable; 0,8–0,9 buena; superior a 0,9 excelente. Un AUC alto en la muestra de desarrollo casi siempre baja en validación externa.

Para decidir si una prueba aporta se necesita el análisis de curvas de decisión y el beneficio neto, que incorporan la relación entre el daño de tratar de más y el de tratar de menos.

Módulo 6 · Síntesis de evidencia

Metaanálisis, heterogeneidad, forest plot y sesgo de publicación

Combine estudios por el método de la varianza inversa (efectos fijos) o de DerSimonian-Laird (efectos aleatorios). Se calculan I², τ², Q, el intervalo de predicción y la prueba de Egger.

Estudios

Una línea por estudio. Elija el formato de entrada según lo que publique el artículo.

Ejemplos:

Resultado agrupado

Efecto combinado, heterogeneidad e intervalo de predicción.

Forest plot

El tamaño del cuadrado es proporcional al peso del estudio; el rombo es el efecto agrupado; la barra fina bajo el rombo es el intervalo de predicción.

Funnel plot y prueba de Egger

La asimetría sugiere efectos de estudios pequeños; no prueba sesgo de publicación por sí sola.

Guía de lectura: heterogeneidad, predicción y los límites de la síntesis

I² no mide cuánta heterogeneidad hay, sino qué proporción de la variabilidad observada no se explica por azar. Con estudios grandes, un I² del 70 % puede corresponder a diferencias clínicamente triviales; con estudios pequeños, un I² del 0 % puede ocultar heterogeneidad real no detectada.

El intervalo de confianza del efecto agrupado describe la precisión del promedio; el intervalo de predicción describe dónde caería el efecto verdadero en un nuevo escenario. Cuando hay heterogeneidad, el segundo es mucho más ancho y a menudo cruza el valor nulo aunque el primero no lo haga. Es la lectura que evita la falsa certeza.

  • La prueba de Egger requiere al menos 10 estudios para tener potencia razonable; con menos, su resultado no es informativo.
  • Un metaanálisis hereda la validez de sus estudios: la posición en la pirámide no lo protege del sesgo de sus componentes.
  • Con menos de 5 estudios, la estimación de τ² es muy inestable y el modelo de efectos aleatorios puede dar intervalos engañosamente estrechos o anchos.
Módulo 7 · Precisión y poder por diseño

Tamaño de muestra según el diseño del estudio

Dieciséis diseños con su fórmula específica: superioridad, no inferioridad, cruzado, conglomerados, tiempo al evento, cohorte, casos y controles, prevalencia, precisión diagnóstica, ROC, correlación, fiabilidad, modelos de predicción y un solo brazo. Cada uno con su desarrollo, sus supuestos y las advertencias que suelen omitirse.

Diseño del estudio

Elija el diseño: los parámetros y la fórmula cambian con él.

Resultado

Fórmula y desarrollo

Con sus propios números, para pegar en el protocolo.

Guía de lectura: elegir el diseño correcto y por qué el poder post hoc no sirve

El tamaño se calcula sobre la mínima diferencia clínicamente importante, no sobre la que uno espera encontrar ni sobre la que dio significativa en un estudio piloto. Fijarlo sobre un efecto optimista es la causa más frecuente de ensayos infrapotenciados para el efecto que realmente importa.

El poder calculado después de conocer el resultado no aporta información. El poder observado es una transformación monótona del valor p: un estudio con p = 0,30 siempre tendrá poder observado bajo. Lo correcto es mirar el intervalo de confianza y preguntarse si excluye o no los efectos clínicamente relevantes.

  • No inferioridad: el margen debe justificarse clínicamente y ser menor que el efecto del comparador activo frente a placebo; de lo contrario se puede «demostrar» no inferioridad frente a un tratamiento que ya no funciona (creep de biocreep).
  • Conglomerados: ignorar el efecto de diseño es el error metodológico más frecuente en salud pública. Con un CCI de 0,02 y conglomerados de 50 personas, el tamaño necesario casi se duplica.
  • Tiempo al evento: lo que determina el poder es el número de eventos, no el de participantes. Un estudio con 5 000 pacientes y 40 eventos está infrapotenciado.
  • Casos y controles: aumentar la razón de controles por caso mejora el poder, pero con rendimientos decrecientes: pasar de 1:1 a 1:4 ayuda mucho; de 1:4 a 1:10, casi nada.
  • Modelos de predicción: la regla de 10 eventos por variable es un mínimo grosero; los criterios de Riley exigen además controlar el sobreajuste esperado y la precisión de la estimación del riesgo basal.
Módulo 8 · Acuerdo y fiabilidad

Kappa de Cohen, kappa ponderado y coeficiente de correlación intraclase

Para revisiones sistemáticas, evaluación de riesgo de sesgo y estudios de reproducibilidad: cuánto coinciden dos observadores más allá de lo que coincidirían por azar.

Datos

Obs. B: síObs. B: no
Obs. A: sí
Obs. A: no
Ejemplos:

Resultado

Cómo se calcula

Guía de lectura: el kappa y su paradoja

Escala orientativa de Landis y Koch: menor de 0 pobre; 0–0,20 leve; 0,21–0,40 aceptable; 0,41–0,60 moderado; 0,61–0,80 sustancial; 0,81–1 casi perfecto. Son convenciones, no umbrales validados.

La paradoja del kappa. Con prevalencias muy desequilibradas —por ejemplo, dos revisores que excluyen el 95 % de los títulos— el acuerdo esperado por azar es altísimo y el kappa se hunde aunque el acuerdo observado supere el 90 %. Por eso conviene reportar siempre el acuerdo bruto junto al kappa, y considerar los índices de prevalencia y sesgo.

  • Con categorías ordinales, el kappa ponderado cuadrático penaliza más los desacuerdos lejanos y es la elección habitual en escalas de riesgo de sesgo.
  • El CCI mide acuerdo absoluto y no solo asociación: dos observadores perfectamente correlacionados pero con un sesgo constante tienen r alta y CCI bajo.
Módulo 9 · Herramientas de conversión

Convertir entre medidas, reconstruir errores estándar y traducir a lenguaje absoluto

Los artículos rara vez publican la medida que uno necesita. Aquí se reconstruye lo que falta a partir de lo que sí está publicado.

De medida relativa a impacto absoluto

La operación más útil de todas: traducir un RR, un OR o un HR al beneficio para un paciente concreto.

Reconstruir el error estándar

A partir de un intervalo de confianza publicado, o de un valor p y la estimación.

Entre tamaños de efecto

Conversión entre d de Cohen, razón de odds y correlación r.

Conversiones estándar: d = ln(OR)·√3/π · r = d/√(d²+4). Son aproximaciones válidas bajo supuestos de normalidad subyacente; conviene declararlas cuando se usan en una síntesis.

Guía de lectura: los límites de convertir

Convertir un OR a RR requiere conocer el riesgo basal, y la fórmula RR = OR / (1 − R₀ + R₀·OR) supone que el OR proviene de un análisis no ajustado o mínimamente ajustado. Con OR fuertemente ajustados por covariables, la conversión es aproximada y debe declararse como tal.

Convertir un HR a RR es aún más delicado: el HR es una razón de tasas instantáneas y el RR una razón de riesgos acumulados. La equivalencia RR ≈ (1 − e^(−H·t·HR))/(1 − e^(−H·t)) solo es razonable con seguimiento corto y riesgos bajos. En horizontes largos, el RR se acerca a 1 aunque el HR no cambie.

  • Reconstruir el error estándar desde un IC del 95 % : EE = (límite superior − límite inferior) / (2 × 1,96), en escala logarítmica si la medida es una razón.
  • Reconstruirlo desde un valor p: z = Φ⁻¹(1 − p/2) y EE = estimación / z, también en escala logarítmica para razones.
Módulo 10 · Laboratorio de simulación

Cuatro simuladores para proyectar en clase

Mueva los controles y observe cómo cambian las medidas. Cada simulador aísla un malentendido concreto de la literatura.

1 · El NNT no es una propiedad del fármaco

Con un efecto relativo constante, el beneficio absoluto depende por completo del riesgo de partida.

2 · Cuánto se separa el OR del RR

La divergencia no es un accidente de un estudio: es una propiedad matemática predecible.

3 · Teorema de Bayes visual

Por qué una prueba excelente puede generar más falsos positivos que verdaderos cuando la enfermedad es rara.

4 · Tamaño muestral e incertidumbre

Cómo se estrecha el intervalo de confianza al crecer el estudio, manteniendo el mismo efecto observado.

Referencia

Glosario operativo y fórmulas

Definiciones breves y expresiones de cálculo para consulta rápida durante la lectura de un artículo.

Fuentes de las cifras precargadas