Uno studio di accuratezza diagnostica pone una domanda semplice, quanto bene questo test distingue i malati dai sani. La risposta vive in una tabella 2×2, e alcuni numeri letti da essa descrivono il test da ogni angolazione. L'insidia è che due di questi, i valori predittivi, cambiano in silenzio con il contesto, così un test che appare eccellente in una clinica può deludere in un'altra. Riportare l'insieme completo, con gli intervalli, è ciò che un lettore attento e la linea guida STARD si aspettano.

1Parti dalla tabella 2×2

Ogni risultato diagnostico è una di quattro cose. Un vero positivo, dove il test è positivo e la malattia è presente. Un falso positivo, positivo ma sano. Un falso negativo, negativo ma malato. Un vero negativo, negativo e sano. Metti il test sulle righe e il vero stato di malattia sulle colonne, e ogni misura di accuratezza è un rapporto letto da questa sola tabella.

La tabella 2×2 diagnostica Malato + Malato − Test + Test − Vero positivo TP Falso positivo FP Falso negativo FN Vero negativo TN La sensibilità si legge lungo la colonna Malato +, la specificità lungo la colonna Malato −.
Figura 1. L'intero studio in una tabella. I risultati corretti stanno sulla diagonale verde, gli errori su quella rossa. Ogni misura di accuratezza è un rapporto di queste quattro celle.

2Sensibilità e specificità appartengono al test

La sensibilità è quanti dei malati il test individua, letta lungo la colonna dei malati. La specificità è quanti dei sani libera, letta lungo la colonna dei sani. Entrambe sono proprietà del test stesso e non cambiano quando lo sposti in una popolazione dove la malattia è più o meno comune. Questa stabilità le rende i numeri principali di uno studio diagnostico, ed è per questo che vanno sempre con un intervallo di confidenza.

3I valori predittivi cambiano con la prevalenza

I valori predittivi rispondono alla domanda che un paziente pone davvero, dato il mio risultato ho la malattia. Questo dipende da quanto è comune la malattia all'inizio. Prendi un test con sensibilità del 95% e specificità del 90%.

  • In una clinica dove un paziente su tre ha già la malattia, un risultato positivo è corretto circa otto volte su dieci.
  • In uno screening di popolazione dove uno su cento ce l'ha, lo stesso risultato positivo è più spesso un falso allarme che no.

Il test non è cambiato, la prevalenza sì. È per questo che un valore predittivo preso da uno studio con una diversa composizione di casi può ingannare gravemente.

Lo stesso test, una risposta diversa Valore predittivo positivo Prevalenza della malattia screening, ~9% clinica, ~80%
Figura 2. Valore predittivo positivo per un test fisso con sensibilità del 95% e specificità del 90%. È basso quando la malattia è rara e alto quando è comune, motivo per cui lo stesso test può sembrare debole nello screening e forte in clinica.

4I rapporti di verosimiglianza si applicano a un paziente

Un rapporto di verosimiglianza unisce sensibilità e specificità in un unico numero che puoi applicare a un individuo. Il rapporto positivo è quanto più probabile è un risultato positivo in un malato rispetto a un sano, e quello negativo fa lo stesso per un risultato negativo. Non dipendono dalla prevalenza, il che li rende un modo pulito per descrivere quanto un risultato dovrebbe spostare il tuo ragionamento.

Leggere un rapporto di verosimiglianza LR+ sopra 10, o LR− sotto 0,1 large shift LR+ 5 a 10, o LR− 0,1 a 0,2 spostamento moderato LR+ 2 a 5, o LR− 0,5 a 0,2 piccolo spostamento Vicino a 1 not useful
Figura 3. Una guida approssimativa ai rapporti di verosimiglianza. Valori lontani da 1 cambiano molto una diagnosi, valori vicini a 1 la muovono appena. Un rapporto positivo sopra 10 o uno negativo sotto 0,1 è di solito considerato prova forte.

5Riporta gli intervalli e segui STARD

Una stima puntuale senza intervallo di confidenza nasconde quanto del risultato potrebbe essere caso, e STARD, la linea guida di reporting per gli studi di accuratezza diagnostica, si aspetta intervalli ovunque e un diagramma di flusso di chi è stato testato. Alcuni errori tornano di continuo, e ognuno è visibile dai soli metodi e risultati.

Cinque errori di reporting diagnostico che i revisori colgono Riportare solo l'accuratezza, che nasconde dove sono gli errori Nessun intervallo di confidenza su sensibilità e specificità Valori predittivi da un campione caso-controllo letti come generali Nessun diagramma di flusso STARD di chi è stato testato ed escluso Risultati indeterminati tolti in silenzio dalla tabella
Figura 4. Ogni voce qui è visibile dal solo articolo, senza i dati grezzi. Ognuna è un motivo comune per cui uno studio diagnostico viene rimandato indietro, e tutte sono facili da evitare.

6Calcola i numeri in pochi secondi, gratis

Puoi ottenere ogni misura dalla tua tabella 2×2 con il nostro calcolatore gratuito per test diagnostici. Inserisci i quattro conteggi e restituisce sensibilità, specificità, valori predittivi, rapporti di verosimiglianza e accuratezza, ognuno con un intervallo di confidenza al 95%, più un campo di prevalenza che riesprime i valori predittivi per il tuo contesto e il codice R corrispondente. Tutto gira nel browser. Il lavoro più difficile, le curve ROC, il confronto tra due test e la scelta di un cut-off, è dove uno statistico guadagna il suo onorario.