Vai al contenuto
Percorso formativo Argento Metodo ripetibile

Overfitting

Adattamento al rumore storico e selezione fra molti tentativi: come riconoscere, misurare e contenere l'overfitting nei sistemi di trading.

A chi serve — A chi confronta strategie, parametri o feature sullo stesso storico e vuole capire quanto della performance scelta possa essere adattamento al rumore anziché capacità di generalizzazione.

L'overfitting si verifica quando una specifica apprende particolarità del campione che non si ripetono fuori da esso. Nel trading può nascere dalla complessità del modello, ma anche da un processo apparentemente semplice: provare molte regole, mercati, periodi o metriche e pubblicare soltanto la combinazione migliore.

Il data snooping è l'uso ripetuto degli stessi dati per selezionare una strategia o una conclusione. È strettamente collegato all'overfitting, ma non è un sinonimo perfetto: il primo descrive il processo di ricerca e selezione; il secondo descrive la scarsa generalizzazione della specifica risultante. Anche una regola con un solo parametro può essere sovra-adattata se è la vincitrice di migliaia di tentativi non dichiarati.

Overfitting e selezione tra molti tentativiIl migliore in-sample incorpora anche la fortuna della ricerca. Numeri e superfici sono illustrativi; ogni specifica provata appartiene al processo di selezione.Overfitting e selezione tra molti tentativiIl migliore in-sample incorpora anche la fortuna della ricercaNumeri e superfici sono illustrativi; ogni specifica provata appartiene al processo di selezione.Spazio delle prove16 configurazioni provate · un picco isolato0.20.40.1-0.10.30.81.90.20.10.60.70.1-0.20.10.30.02Vincitore selezionatoIl massimo storico non è una stima non distorta delrendimento futuro.3Test indipendenteUna valutazione non usata nella scelta misura ladegradazione fuori campione.4Inferenza con molteplicitàLa conclusione considera numero dei tentativi, dipendenza eregola di selezione.Cyclepedia · schema didattico condizionato, non previsione né promessa
Più alternative vengono cercate, più è facile trovare per caso una curva attraente: il denominatore corretto comprende anche i tentativi scartati.

Da dove nasce

Fonte di adattamento Esempio Informazione da registrare
Parametri Molti lookback, soglie o stop Griglia completa e criterio di scelta
Regole Filtri aggiunti dopo perdite visibili Sequenza delle modifiche
Universo Mercati o titoli scelti perché hanno funzionato Universo iniziale ed esclusioni
Periodo Data d'inizio spostata fino a migliorare la curva Tutte le finestre esaminate
Metriche Si mostra Sharpe perché il drawdown è sfavorevole Metriche previste prima del test
Dati e pipeline Provider, pulizia o fill scelti ex post Versioni e varianti del simulatore
Narrazione La spiegazione economica nasce dopo il risultato Ipotesi originaria e motivazione temporale

Il rischio non dipende soltanto dal rapporto fra numero di parametri e numero di righe del dataset. Conta la libertà effettiva del processo di ricerca: quante decisioni potevano cambiare dopo ogni risultato e quanta dipendenza esiste fra le osservazioni. Per questo il numero di trade grezzo non misura da solo quanta informazione indipendente sostenga il modello.

Sintomi, non diagnosi automatiche

Un picco molto stretto nella superficie dei parametri, regole difficili da motivare, rendimento concentrato in poche operazioni e forte differenza fra sviluppo e test sono segnali di fragilità. Nessuno è una prova isolata. Un edge reale può essere localizzato; un regime futuro può cambiare; un OOS breve può essere rumoroso. Viceversa, una superficie regolare può derivare da bias comuni a tutte le varianti.

La semplicità è utile come vincolo, non come certificato. “Poche regole” non annulla la selezione ex post, mentre una tecnica complessa può generalizzare se il protocollo, la regolarizzazione e la validazione sono adeguati.

Test multipli e vincitore apparente

Se molte strategie senza vero vantaggio vengono misurate, alcune presenteranno comunque risultati eccezionali per caso. Un p-value o uno Sharpe calcolato come se la strategia fosse l'unica ipotesi testata sottostima questo problema. I metodi di White, Hansen e Romano-Wolf affrontano confronti multipli fra modelli o regole; la Probability of Backtest Overfitting studia la probabilità che la configurazione scelta in-sample perda rango fuori campione; il Deflated Sharpe Ratio adegua l'interpretazione dello Sharpe alla selezione e alle caratteristiche non gaussiane dei rendimenti.

Questi strumenti hanno assunzioni e non trasformano una ricerca retrospettiva in una prova causale. Per essere informativi richiedono almeno un inventario credibile delle alternative esplorate.

Protocollo di contenimento

  1. Formulare l'ipotesi prima dei risultati. Dichiarare meccanismo economico, universo, variabili, benchmark, metrica principale e criterio di arresto.
  2. Tenere un registro dei tentativi. Includere configurazioni fallite, seed, periodi, asset, filtri, trasformazioni e metriche consultate.
  3. Separare selezione e valutazione. Usare training e validazione per le scelte; conservare un test temporale finale non consultato.
  4. Rispettare la struttura dei dati. Trattare dipendenza, label sovrapposte e informazione point-in-time con split adatti al problema.
  5. Limitare la libertà giustificabile. Regolarizzare, ridurre feature e parametri o usare gerarchie motivate, senza cercare un “numero magico”.
  6. Correggere l'inferenza. Considerare test multipli, non normalità, autocorrelazione e incertezza delle metriche.
  7. Sottoporre la specifica a perturbazioni. Variare assunzioni plausibili su parametri, campione, costi ed esecuzione senza scegliere ex post soltanto gli stress superati.
  8. Conservare una decisione leggibile. Motivare perché la strategia viene scartata, studiata ancora o candidata al forward test.

Esempio illustrativo

Esempio dichiarato illustrativo — Un ricercatore prova dieci lookback, cinque soglie e quattro universi: sono già duecento configurazioni, prima di contare costi, periodi e filtri successivi. La configurazione con Sharpe storico più alto non può essere valutata come un'ipotesi unica formulata in anticipo. Il protocollo conserva tutte le prove, seleziona nella validazione, applica una misura coerente con il confronto multiplo e consulta il test finale una sola volta. I numeri descrivono il meccanismo della selezione, non una soglia di accettazione.

Se il test finale viene usato per cambiare lookback o universo, il segmento non è più puro per la nuova versione. Il fallimento non dimostra necessariamente che l'idea sia priva di valore; segnala che la specifica valutata non ha fornito l'evidenza prevista dal protocollo.

Robustezza e OOS non sono prove definitive

Stress test, plateau dei parametri, sottoperiodi e walk-forward aiutano a descrivere sensibilità e stabilità. Non provano da soli che l'edge sia reale: possono condividere lo stesso look-ahead, lo stesso universo contaminato o lo stesso errore di esecuzione. Anche il test OOS diventa parte dello sviluppo quando viene consultato ripetutamente.

Il controllo più solido è quindi procedurale oltre che statistico: rendere visibili tutte le scelte, impedire che l'informazione futura entri nel modello e preservare una distinzione reale fra esplorazione e valutazione.

Limiti

  • Non esiste un indice unico che misuri ogni forma di overfitting.
  • Le correzioni per confronti multipli dipendono dall'insieme dei tentativi e dalla loro dipendenza, spesso solo parzialmente osservabili.
  • Un buon OOS può essere fortuna; un OOS debole può riflettere varianza o cambio di regime.
  • Nuovi dati temporali riducono il riuso del passato, ma non eliminano problemi di dati, costi, causalità o governance.
  • La replicazione indipendente resta distinta dalla semplice riesecuzione dello stesso backtest.

Fonti

Collegamenti