Lo esencial

  • El valor p depende de una hipótesis y de los demás supuestos de la prueba.
  • La significación estadística no mide el tamaño ni la importancia clínica de un efecto.
  • Lee la estimación del efecto, el intervalo de confianza y el plan de análisis junto con el valor p.

01

¿Qué es un valor p?

Un valor p es la probabilidad de obtener un estadístico de prueba al menos tan extremo como el observado, suponiendo que el modelo estadístico es correcto, incluida la hipótesis que se pone a prueba. En muchos estudios de salud, esa hipótesis nula plantea que no hay diferencia entre grupos. Otros supuestos se refieren a la independencia, al proceso que genera los datos y a cómo se seleccionó el análisis.

El sentido del razonamiento importa: primero se supone el modelo y después se pregunta por los datos posibles. El valor p no invierte ese cálculo para indicar la probabilidad de que la hipótesis sea cierta. Un valor pequeño señala tensión entre las observaciones y el modelo supuesto; no identifica cuál de sus supuestos es incorrecto.

Fuentes de esta sección: [1] [2]

02

Un ejemplo calculado: nueve caras en diez lanzamientos

Este es un ejemplo matemático, no un estudio clínico. Antes de lanzar una moneda, decidimos hacer diez lanzamientos independientes y evaluar un desequilibrio en cualquiera de las dos direcciones. Bajo el modelo nulo, cara y cruz tienen cada una una probabilidad de un medio en cada lanzamiento. Hay 1.024 secuencias ordenadas igualmente probables.

Si salen nueve caras, los resultados al menos tan alejados de un reparto equilibrado son cero, una, nueve o diez caras. Esos resultados corresponden a 1 + 10 + 10 + 1 = 22 secuencias. El valor p bilateral es, por tanto, 22 / 1.024 = 0,021484375, aproximadamente un 2,15%.

Ese desequilibrio, o uno mayor, ocurriría alrededor del 2,15% de las veces bajo el modelo de moneda equilibrada, lanzamientos independientes y número de lanzamientos fijado de antemano. No significa que haya un 2,15% de probabilidad de que la moneda sea equilibrada. Preguntar solo por un exceso de caras, o decidir cuándo parar después de ver los resultados, cambia el análisis y su interpretación.

Fuentes de esta sección: [2]

03

¿Qué significa p < 0,05?

Cuando el umbral de significación, o alfa, se fija en 0,05, un valor p inferior se denomina convencionalmente estadísticamente significativo. Alfa se elige como parte del procedimiento; el valor p se calcula con los datos observados. En una prueba individual válida, alfa controla la probabilidad a largo plazo de rechazar una hipótesis nula verdadera, no la probabilidad de que este hallazgo publicado sea falso.

Lecturas frecuentes y sus límites
Resultado informadoLectura razonableConclusión sin fundamento
p = 0,03El resultado cruza un umbral preseleccionado de 0,05, sujeto a los supuestos de la prueba.Hay un 97% de probabilidad de que el tratamiento funcione.
p = 0,06El resultado no cruza ese umbral.El tratamiento no tiene efecto.
p = 0,001El estadístico observado es muy inusual bajo el modelo supuesto.El efecto es grande, importante o está libre de sesgo.

Son ejemplos de interpretación, no resultados de ensayos con pacientes. No existe un salto científico entre 0,049 y 0,051. Datos muy parecidos pueden quedar a lados distintos del umbral; la estimación completa y su incertidumbre merecen más atención que la etiqueta por sí sola.

Fuentes de esta sección: [2]

04

Significación estadística e importancia clínica

La estimación del efecto indica cuánto difirieron los grupos. El intervalo de confianza ayuda a mostrar la precisión de esa estimación y qué tamaños de efecto siguen siendo compatibles con los datos bajo el modelo. La importancia clínica considera si la magnitud y la naturaleza del beneficio importan a los pacientes, teniendo en cuenta daños, carga del tratamiento y alternativas.

Un estudio grande puede detectar una diferencia demasiado pequeña para importar en la práctica. Uno más pequeño o con mayor variabilidad puede dejar abiertos tanto un beneficio sustancial como un daño, aunque el valor p supere 0,05. Antes de interpretar un resultado para la atención clínica, lee los límites del intervalo y las unidades de medida.

Cuando la prueba bilateral y el método del intervalo se corresponden, un intervalo de confianza del 95% que excluye el valor nulo suele corresponder a p < 0,05. El valor nulo suele ser cero para una diferencia y uno para una razón. La relación depende de métodos compatibles; el redondeo o cálculos distintos pueden producir discrepancias aparentes. Ni un valor p ni un intervalo estrecho eliminan el sesgo de un estudio defectuoso.

Fuentes de esta sección: [2] [3]

05

Por qué importan las pruebas múltiples

Examinar muchos desenlaces, subgrupos u opciones de análisis crea más oportunidades de encontrar un valor p pequeño. Por ejemplo, con 20 pruebas independientes cuyas hipótesis nulas son todas verdaderas y cuya probabilidad individual de falso positivo es exactamente 0,05, la probabilidad de al menos un falso positivo es 1 − 0,9520 ≈ 64,2%. Pruebas correlacionadas u otros procedimientos cambian esa cifra.

Por eso importan el desenlace principal previsto, el registro del ensayo y el manejo de las comparaciones múltiples. Un análisis preespecificado y un hallazgo exploratorio interesante pueden ser útiles, pero justifican grados distintos de confianza. Informar solo el valor p más pequeño oculta la búsqueda que lo produjo. Los ajustes estadísticos ayudan con familias de pruebas definidas; no corrigen la selección de resultados que se mantiene oculta.

Fuentes de esta sección: [2]

06

Lista para leer una afirmación científica

Antes de aceptar un titular que diga que un tratamiento «funcionó», reconstruye la afirmación con estas preguntas. Permiten pasar de un único umbral a evaluar la pregunta del estudio, el tamaño del resultado y la incertidumbre que permanece.

  1. Identifica la comparación: ¿a quiénes se estudió, qué se comparó y qué desenlace se midió?
  2. Lee la estimación: ¿cuán grande fue la diferencia, en unidades que tengan sentido para quien lee?
  3. Examina el intervalo: ¿incluye beneficios o daños importantes, o solo diferencias pequeñas?
  4. Revisa el plan: ¿se eligieron de antemano el desenlace y el análisis, y se atendieron las pruebas múltiples?
  5. Evalúa la credibilidad: considera sesgo, datos faltantes, aplicabilidad y concordancia con otros estudios.

Un valor p grande, por sí solo, no demuestra equivalencia entre tratamientos. Eso requiere un diseño apropiado, un margen de equivalencia justificado y un análisis dirigido a esa pregunta. Tampoco un valor p pequeño establece causalidad: el diseño del estudio y sus supuestos deben sostener una interpretación causal.

Las explicaciones estadísticas se apoyan en la guía de Greenland y sus colegas, bajo CC BY 4.0, con redacción adaptada y ejemplos calculados propios. La declaración de la ASA y la orientación de Cochrane aportan contexto adicional. Los enlaces a las fuentes aparecen abajo.

Fuentes de esta sección: [2]

Fuentes

  1. Wasserstein and Lazar — The ASA’s Statement on p-Values: Context, Process, and PurposeThe American Statistician · 2016Fuente consultada: DOI 10.1080/00031305.2016.1154108
  2. Greenland et al. — Statistical tests, P values, confidence intervals, and power: a guide to misinterpretationsEuropean Journal of Epidemiology · 2016Fuente consultada: DOI 10.1007/s10654-016-0149-3
  3. Cochrane Handbook, Chapter 15: Interpreting results and drawing conclusionsCochraneFuente consultada:

Historial de revisiones

  1. Artículo inicial preparado con asistencia automatizada y fuentes comprobadas el 2026-09-05T17:53:18Z (UTC). Incluye ejemplos calculados de lanzamientos de moneda y pruebas múltiples, no datos de pacientes. No consta una revisión clínica independiente. Las fechas mostradas y esta explicación usan UTC; los instantes registrados no han cambiado.