Un estudio de exactitud diagnóstica plantea una pregunta sencilla, qué tan bien distingue esta prueba a los enfermos de los sanos. La respuesta vive en una tabla 2×2, y unos pocos números leídos de ella describen la prueba desde todos los ángulos. La trampa es que dos de ellos, los valores predictivos, cambian en silencio con el entorno, así que una prueba que parece excelente en una clínica puede decepcionar en otra. Reportar el conjunto completo, con intervalos, es lo que un lector cuidadoso y la guía STARD esperan.

1Empieza por la tabla 2×2

Cada resultado diagnóstico es una de cuatro cosas. Un verdadero positivo, donde la prueba es positiva y la enfermedad está presente. Un falso positivo, positivo pero sano. Un falso negativo, negativo pero enfermo. Un verdadero negativo, negativo y sano. Pon la prueba en las filas y el verdadero estado de enfermedad en las columnas, y cada medida de exactitud es un cociente leído de esta sola tabla.

La tabla 2×2 diagnóstica Enfermo + Enfermo − Test + Test − Verdadero positivo TP Falso positivo FP Falso negativo FN Verdadero negativo TN La sensibilidad se lee bajando por la columna Enfermo +, la especificidad por la columna Enfermo −.
Figura 1. Todo el estudio en una tabla. Los resultados correctos están en la diagonal verde, los errores en la roja. Cada medida de exactitud es un cociente de estas cuatro casillas.

2La sensibilidad y la especificidad pertenecen a la prueba

La sensibilidad es cuántos de los enfermos detecta la prueba, leída bajando por la columna de los enfermos. La especificidad es cuántos de los sanos libera, leída por la columna de los sanos. Ambas son propiedades de la prueba en sí y no cambian cuando la llevas a una población donde la enfermedad es más o menos común. Esa estabilidad las convierte en los números principales de un estudio diagnóstico, y por eso siempre van con un intervalo de confianza.

3Los valores predictivos cambian con la prevalencia

Los valores predictivos responden a la pregunta que un paciente hace de verdad, dado mi resultado tengo la enfermedad. Eso depende de lo común que sea la enfermedad de partida. Toma una prueba con 95% de sensibilidad y 90% de especificidad.

  • En una clínica donde uno de cada tres pacientes ya tiene la enfermedad, un resultado positivo acierta unas ocho de cada diez veces.
  • En un cribado poblacional donde uno de cada cien la tiene, el mismo resultado positivo es una falsa alarma más veces que no.

La prueba no cambió, la prevalencia sí. Por eso un valor predictivo tomado de un estudio con otra mezcla de casos puede engañar gravemente.

La misma prueba, una respuesta distinta Valor predictivo positivo Prevalencia de la enfermedad cribado, ~9% clínica, ~80%
Figura 2. Valor predictivo positivo para una prueba fija con 95% de sensibilidad y 90% de especificidad. Es bajo cuando la enfermedad es rara y alto cuando es común, por lo que la misma prueba puede parecer débil en cribado y fuerte en clínica.

4Las razones de verosimilitud se aplican a un paciente

Una razón de verosimilitud combina sensibilidad y especificidad en un solo número que puedes aplicar a un individuo. La razón positiva es cuánto más probable es un resultado positivo en un enfermo que en un sano, y la negativa hace lo mismo para un resultado negativo. No dependen de la prevalencia, lo que las convierte en una forma limpia de describir cuánto debería mover un resultado tu razonamiento.

Leer una razón de verosimilitud CP+ por encima de 10, o CP− por debajo de 0,1 large shift CP+ de 5 a 10, o CP− de 0,1 a 0,2 cambio moderado CP+ de 2 a 5, o CP− de 0,5 a 0,2 cambio pequeño Cerca de 1 not useful
Figura 3. Una guía aproximada de las razones de verosimilitud. Los valores lejos de 1 cambian mucho un diagnóstico, los cercanos a 1 apenas lo mueven. Una razón positiva por encima de 10 o una negativa por debajo de 0,1 suele considerarse evidencia fuerte.

5Reporta intervalos y sigue STARD

Una estimación puntual sin intervalo de confianza oculta cuánto del resultado podría ser azar, y STARD, la guía de presentación para estudios de exactitud diagnóstica, espera intervalos en todo y un diagrama de flujo de quién fue evaluado. Algunos errores aparecen una y otra vez, y cada uno es visible solo con los métodos y los resultados.

Cinco errores al reportar diagnóstico que los revisores detectan Reportar solo la exactitud, lo que oculta dónde están los errores Sin intervalos de confianza en sensibilidad y especificidad Valores predictivos de una muestra de casos y controles leídos como generales Sin diagrama de flujo STARD de quién fue evaluado y excluido Resultados indeterminados quitados en silencio de la tabla
Figura 4. Cada punto aquí es visible solo con el artículo, sin los datos crudos. Cada uno es un motivo frecuente por el que un estudio diagnóstico es devuelto, y todos son fáciles de evitar.

6Calcula los números en segundos, gratis

Puedes obtener cada medida de tu propia tabla 2×2 con nuestra calculadora gratuita de pruebas diagnósticas. Introduce los cuatro recuentos y devuelve sensibilidad, especificidad, valores predictivos, razones de verosimilitud y exactitud, cada uno con un intervalo de confianza del 95%, más un campo de prevalencia que reexpresa los valores predictivos para tu entorno y el código R correspondiente. Todo funciona en tu navegador. El trabajo más difícil, las curvas ROC, comparar dos pruebas y elegir un punto de corte, es donde un estadístico se gana sus honorarios.