Connetti wallet

Superforecaster: cosa fanno di diverso

Di insiderz9 min di lettura

Illustrazione piatta e astratta su fondo scuro: un punto luminoso molto avanti rispetto a un fitto grappolo di punti più spenti lungo una scala orizzontale di accuratezza

Un superforecaster è una persona che si è piazzata nel 2 per cento più accurato su centinaia di domande valutate e ha continuato a farlo. L'etichetta è nata da un torneo di ricerca, non da un ufficio marketing, e il vantaggio è misurabile: calibrazione migliore, separazione più netta tra ciò che accade e ciò che non accade, e un insieme di abitudini di lavoro che costano poco da copiare. Niente in quella lista richiede un talento con cui bisogna nascere.

Da dove viene il termine?

Tra il 2011 e il 2014 l'agenzia di ricerca dell'intelligence statunitense IARPA ha organizzato tre tornei di previsione geopolitica in cui cinque programmi di ricerca universitari si sono sfidati a produrre stime probabilistiche accurate. Il programma vincitore è stato il Good Judgment Project, guidato da Barbara Mellers e Philip Tetlock all'Università della Pennsylvania. Ogni gruppo era valutato con la stessa metrica, il Brier score introdotto da Glenn Brier nel 1950 per le previsioni del tempo.

I dettagli contano, perché definiscono il campione. Ogni torneo durava circa nove mesi. I primi due ponevano poco più di 100 domande, il terzo circa 150, e le domande restavano aperte in media 102 giorni. Ogni anno iniziava con un numero di previsori tra 2.200 e 3.900. Alla fine del primo anno il progetto ha stilato una classifica e ha preso i migliori cinque previsori di ciascuna delle dodici condizioni sperimentali, 60 persone, mettendoli in cinque squadre selezionate da dodici. A quelle squadre è stato dato il nome di superforecaster. Tutto questo è documentato in Identifying and Cultivating Superforecasters, pubblicato da Mellers e colleghi su Perspectives on Psychological Science nel 2015.

Ci si aspettava una regressione verso la media. Non è avvenuta. I superforecaster sono rimasti avanti il secondo anno e di nuovo il terzo.

Che aspetto ha il vantaggio misurato?

Misura Superforecaster o folla selezionata Gruppo di confronto Studio e data
Brier score standardizzato, media anni 2 e 3 -0,34 -0,14 fascia successiva, +0,04 tutti gli altri Mellers et al., 2015
Errore di calibrazione 0,01 0,03 fascia successiva, 0,04 tutti gli altri Mellers et al., 2015
Risoluzione 0,40 0,35 fascia successiva, 0,32 tutti gli altri Mellers et al., 2015
Area sotto la curva ROC 96 per cento 84 per cento fascia successiva, 75 per cento tutti gli altri Mellers et al., 2015
Valori di probabilità distinti usati 57 29 fascia successiva, 30 tutti gli altri Mellers et al., 2015
Previsioni inviate per domanda, anno 1 2,77 1,47 gruppi di confronto Mellers et al., 2015
Notizie aperte, anni 2 e 3 255 55 e 58 Mellers et al., 2015
Brier score aggregato, sondaggio selezionato contro folla di oltre 300 0,166 0,228 Atanasov et al., 2024
Brier score mediano, 498 domande di benchmark 0,096 0,121 mediana del pubblico Karger et al., ICLR 2025

Due note per leggere la tabella. Il torneo Good Judgment usava la definizione originale di Brier a due esiti, che va da 0 a 2, quindi quei numeri non sono confrontabili direttamente con i punteggi da 0 a 1 dell'ultima riga. E i punteggi standardizzati sono relativi al gruppo sulle stesse domande, che è l'unico modo corretto di confrontare previsori che non hanno risposto tutti alle stesse cose.

Quali sono le abitudini, dette come passi?

Sette, nell'ordine in cui le eseguiresti davvero.

  1. Parti dalla visione esterna. Chiediti quanto spesso accadono le cose di questa classe di riferimento, prima di guardare i dettagli del caso.
  2. Spezza la domanda in parti stimabili. La scomposizione è la singola capacità più trasferibile di questa lista.
  3. Cerca i criteri di risoluzione prima di cercare una risposta. Metà delle liti sulle previsioni sono liti sulle definizioni.
  4. Dichiara un numero preciso. I superforecaster hanno usato in media 57 valori di probabilità distinti sulle loro domande, contro 29 e 30 dei due gruppi di confronto, ed erano il gruppo che più spesso usava numeri al singolo punto percentuale invece di arrotondare a multipli di 10.
  5. Aggiorna spesso, a piccoli passi. Nel primo anno di torneo i superforecaster hanno inviato 2,77 previsioni per domanda contro 1,47 dei gruppi di confronto. La frequenza di aggiornamento delle credenze è risultata il singolo predittore comportamentale più forte dell'accuratezza.
  6. Fai la lettura. Nel secondo e terzo anno i superforecaster hanno aperto in media 255 notizie tramite il lettore del progetto, contro 55 e 58 dei gruppi di confronto.
  7. Tieni il punteggio e guardalo. Il progetto misurava l'apprendimento come riduzione dell'errore nell'arco dell'anno di torneo, e i superforecaster miglioravano più in fretta.

Le abitudini si accompagnavano anche a differenze cognitive vere. I superforecaster ottenevano almeno una deviazione standard sopra la popolazione generale nei test di intelligenza fluida e in quelli di conoscenza politica. La sintesi onesta dell'articolo è che sono stati in parte scoperti e in parte creati. La parte creata è quella dell'elenco qui sopra.

Come funziona la scomposizione nella pratica?

Scomporre vuol dire sostituire una domanda che non sai stimare con diverse domande che sai stimare.

"Questa legge passerà entro fine anno" non è stimabile come blocco unico. Scomposta diventa: esce dalla commissione, c'è tempo in aula nelle sedute rimaste, la maggioranza vuole il voto, una legge simile è mai passata in questa configurazione. Ogni pezzo ha un tasso di base approssimativo. Moltiplica quelli che devono accadere tutti e hai un numero di partenza che viene da qualcosa invece che da una sensazione.

Il vantaggio meccanico è che la scomposizione mette in luce l'anello debole. Quando scrivi quattro sotto domande e scopri che una porta tutta l'incertezza, sai esattamente cosa approfondire e cosa ignorare. Ti dà anche qualcosa da aggiornare: quando arriva una notizia, di solito riguarda una sotto domanda, non l'intera.

Perché aggiornare a piccoli passi?

Perché quasi tutte le notizie spostano una probabilità di poco, e la disciplina di spostarla di poco è ciò che separa una previsione da una reazione.

Aggiornamenti piccoli e frequenti sono stati il predittore comportamentale più forte dell'accuratezza nei dati Good Judgment. Il meccanismo non è misterioso. Chi rivede una domanda ogni settimana incorpora dieci pezzetti di prova in dieci settimane. Chi mette un numero e se ne dimentica non ne incorpora nessuno, e chi passa dal 20 all'80 per cento su un singolo titolo di giornale ha sostituito una prova a tutte le altre.

I passi piccoli proteggono anche la granularità che rende utili i numeri. Se le tue uniche mosse sono da 10 punti percentuali, non puoi esprimere la differenza tra una prova debole e una media.

Perché tenere il punteggio conta così tanto?

Perché senza punteggio non c'è riscontro, e senza riscontro le abitudini qui sopra sono solo preferenze.

È il punto in cui quasi tutte le previsioni pubbliche falliscono. Le previsioni vengono fatte in posti dove si possono cancellare, ignorare o reinterpretare a posteriori. Uno storico che puoi modificare non dice niente sulla persona e, peggio, non dice niente alla persona su sé stessa. Il risultato Good Judgment dipende interamente dal fatto che ogni previsione era datata, valutata con una regola fissa e impossibile da ritirare.

Il secondo requisito è un riferimento. Un numero di accuratezza grezzo dipende da quanto erano difficili le domande. Valutare contro qualcosa che ha risposto alle stesse domande negli stessi momenti, un altro previsore, un tasso di base o un prezzo di mercato, è ciò che trasforma un numero in una prova su di te.

Come stanno i superforecaster rispetto a mercati e intelligenza artificiale nel 2026?

Rispetto ai mercati, il risultato utile è che conta più la folla del meccanismo. In Crowd prediction systems: Markets, polls, and elite forecasters, pubblicato sull'International Journal of Forecasting nel 2024, Pavel Atanasov, Jens Witkowski, Barbara Mellers e Philip Tetlock hanno confrontato mercati predittivi e sondaggi di previsione a squadre usando i dati del torneo Good Judgment, con ciascun sistema gestito o da una folla grande e generica o da una piccola e selezionata. Le piccole folle selezionate hanno battuto quelle più grandi, mentre i due sistemi risultavano statisticamente pari tra loro. Il sondaggio selezionato aggregato ha ottenuto un Brier score di 0,166 contro lo 0,228 di una folla non selezionata di oltre 300 previsori sulle stesse domande, e una scomposizione ha mostrato che la differenza veniva tutta da una migliore capacità di discriminare, non da una migliore calibrazione. La soglia di selezione in quei dati era il 2 per cento migliore. Lo stesso articolo ricorda lavori precedenti secondo cui i previsori selezionati nei sondaggi a squadre erano più accurati di analisti professionali dell'intelligence con accesso a informazioni riservate.

Rispetto all'intelligenza artificiale, il quadro invecchia nel momento in cui lo scrivi. Su ForecastBench, presentato a ICLR 2025, il Brier score mediano dei superforecaster era 0,096 su 498 domande, contro 0,121 della mediana del pubblico e 0,122 del miglior modello linguistico testato, Claude 3.5 Sonnet. Le previsioni umane sono state raccolte a luglio 2024. Lo stesso articolo stima una tendenza tra qualità dei modelli e accuratezza previsiva e proietta che i modelli raggiungano il livello dei superforecaster attorno a un punteggio Arena di circa 1406, con un intervallo di confidenza ampio. A settembre 2026, qualunque affermazione sulla distanza attuale ha bisogno di un benchmark aggiornato alle spalle.

Ci si può allenare senza un torneo?

Sì, e i requisiti sono pochi: domande che si risolvono davvero, un modo di registrare una probabilità che poi non si può cambiare, e un riferimento con cui essere valutati.

Il primo requisito in Italia non manca. Il calendario elettorale offre eventi con una data e un esito netto: il Ministero dell'Interno ha indicato che il 24 e 25 maggio 2026 si è votato in 661 comuni delle regioni a statuto ordinario, 15 dei quali capoluoghi, con i ballottaggi il 7 e 8 giugno. Sono esattamente il tipo di domanda su cui una previsione o si avvera o no, senza spazio per raccontarla diversamente dopo.

Metaculus e Good Judgment Open propongono entrambi domande valutate. insiderz aggiunge il terzo ingrediente per impostazione predefinita. Una call su insiderz è un'affermazione Sì o No su un evento reale con la tua confidenza attaccata, sugli stessi eventi elencati da Polymarket. La call viene bloccata nell'istante in cui la pubblichi, con l'ora e il prezzo Polymarket di quel momento congelati accanto. Niente si può modificare o cancellare, né da te né da noi. Quando l'evento si risolve, la call viene valutata contro quel prezzo congelato, quindi il riferimento è integrato e non scelto a posteriori.

Non ci sono soldi in mezzo e non c'è niente da scommettere. La classifica degli insider ordina le persone su quante volte battono il prezzo di mercato, quanti eventi hanno risolto, il vantaggio medio sul prezzo e con quanto anticipo. Gli eventi aperti sono qui.

Per il punteggio in sé, in parole semplici, leggi il Brier score spiegato. Per il difetto che queste abitudini servono a correggere, leggi la calibrazione. Per la versione pratica di tutto questo applicata a un prezzo in tempo reale, leggi come battere il mercato.

Domande frequenti

Cos'è un superforecaster?
Nel Good Judgment Project l'etichetta era operativa e non onorifica: il 2 per cento più accurato dei previsori alla fine di un anno di torneo, promosso in piccole squadre selezionate. Indica uno storico misurato su domande valutate, non un titolo professionale.
Si può imparare a prevedere meglio?
Sì. Nel Good Judgment Project il predittore comportamentale più forte dell'accuratezza era la frequenza con cui le persone aggiornavano le previsioni, e un breve modulo di formazione sulle probabilità migliorava i risultati. Sono entrambe cose copiabili, e funzionano solo se le previsioni vengono valutate.
I superforecaster battono i mercati predittivi?
Piccole folle selezionate battono grandi folle generiche in entrambi i formati, mentre mercati predittivi e sondaggi di previsione a squadre risultavano statisticamente pari tra loro nei dati Good Judgment. Contava più chi c'era nella folla del meccanismo usato.
Nel 2026 i superforecaster battono ancora l'intelligenza artificiale?
Su ForecastBench, le cui previsioni umane sono state raccolte a luglio 2024, il Brier score mediano dei superforecaster era 0,096 contro 0,122 del miglior modello linguistico. L'articolo prevede che quella distanza si chiuda con il migliorare dei modelli, quindi ogni affermazione su questo punto va datata.
Come si diventa superforecaster?
Non ci sono scorciatoie che aggirino lo storico. Fai previsioni su domande che si risolvono, dichiara un numero invece di un'opinione, conserva tutte le previsioni comprese quelle brutte, e valutale contro un riferimento sugli stessi eventi.

Fonti

  1. Barbara Mellers et al., Identifying and Cultivating Superforecasters as a Method of Improving Probabilistic Predictions, Perspectives on Psychological Science 10(3), 2015
  2. Pavel Atanasov, Jens Witkowski, Barbara Mellers and Philip Tetlock, Crowd prediction systems: Markets, polls, and elite forecasters, International Journal of Forecasting, 2024
  3. Ezra Karger et al., ForecastBench: A Dynamic Benchmark of AI Forecasting Capabilities, ICLR 2025, arXiv, revised February 2025
  4. Glenn W. Brier, Verification of Forecasts Expressed in Terms of Probability, Monthly Weather Review 78(1), American Meteorological Society, January 1950
  5. Elezioni amministrative 2026, 661 i comuni al voto nelle regioni a statuto ordinario, Ministero dell'Interno, 2026

Continua a leggere

Come battere il mercato: guida pratica

Battere un mercato predittivo vuol dire avere ragione dove il prezzo sbagliava, abbastanza spesso e su abbastanza eventi perché la fortuna smetta di essere la spiegazione. Non esiste un trucco che funzioni ovunque. Funziona un metodo: partire dal prezzo invece che dalla propria opinione, dissentire solo nelle poche situazioni in cui i prezzi sono notoriamente molli, mettere un numero preciso, e valutare ogni call contro il prezzo del momento in cui è stata fatta.

11 min di lettura

Il Brier score spiegato in parole semplici

Il Brier score misura quanto le tue probabilità erano lontane dalla realtà. Per ogni previsione prendi la probabilità che hai dato, sottrai l'esito scritto come 1 se è successo e 0 se non è successo, ed elevi al quadrato. Poi fai la media su tutte le previsioni. Zero è perfetto, 0,25 è quello che ottieni dicendo sempre 50 per cento, e 1 è il massimo errore possibile.

9 min di lettura

Calibrazione: cosa vuol dire avere ragione al 70 per cento

La calibrazione è la corrispondenza tra quello che dichiari e quello che succede. Se sei calibrato, gli eventi che chiami al 70 per cento accadono circa il 70 per cento delle volte, quelli che chiami al 90 per cento circa il 90 per cento delle volte, e così via lungo la scala. È una proprietà di un gruppo di previsioni, mai di una sola. Una singola call al 70 per cento che si avvera non dimostra niente.

8 min di lettura