Vai al contenuto
Percorso formativo Argento Metodo ripetibile

Robustezza

Stabilità di una strategia rispetto ad assunzioni plausibili su dati, parametri, esecuzione e regimi: una batteria diagnostica, non una prova di validità.

A chi serve — A chi ha ottenuto un risultato storico favorevole e vuole sapere quanto dipenda da una precisa combinazione di dati, parametri, costi, periodo ed esecuzione.

La robustezza descrive quanto le conclusioni su una strategia restino coerenti quando cambiano, entro intervalli plausibili, le assunzioni che non dovrebbero determinarne interamente il valore. È una proprietà graduata e condizionata: una strategia può essere robusta rispetto ai parametri ma fragile rispetto ai costi, oppure stabile su più periodi ma dipendente da un solo provider di dati.

Robustezza non significa immunità ai cambiamenti, non garantisce che esista un edge futuro ed è anche un esercizio di falsificazione. Una batteria di test può condividere lo stesso look-ahead, lo stesso survivorship bias o lo stesso errore di fill. Il suo scopo è rendere visibili le dipendenze del risultato e cercare punti di rottura, non assegnare un bollino automatico di validità.

Batteria di robustezzaUna strategia viene perturbata lungo assi economicamente motivati. I test sono definiti prima dei risultati; superarli non certifica stabilità futura.Batteria di robustezzaUna strategia viene perturbata lungo assi economicamente motivatiI test sono definiti prima dei risultati; superarli non certifica stabilità futura.ParametriviciniCercare regionicoerenti, non il solomassimo puntuale.RegolealternativePiccoleimplementazioniplausibili nondovrebbero invertireogni conclusione.SottoperiodiLa performance vieneseparata nel temposenza sceglieresoltanto finestrefavorevoli.RegimiTrend, volatilità eliquidità rendonovisibilel'eterogeneità.Asset e sediTrasferibilità especificità delmercato vengonodistinte.Costi ecapacitàFrizioni più severema plausibilistressano ilrisultato netto.Ritardi emissingDelay, salti disegnale e fillparziali testanol'implementazione.Dati e modelloFonti, revisioni eassunzionialternative espongonoil rischio dimodello.Cyclepedia · schema didattico condizionato, non previsione né promessa
Ogni stress interroga una vulnerabilità diversa; nessun singolo test copre l'intera catena del backtest.

Robustezza, sensibilità e validazione

Concetto Domanda Che cosa non dimostra
Analisi di sensibilità Come cambia l'output al variare di un input? Che gli scenari scelti siano completi
Stress test Dove si rompe il sistema in condizioni severe ma coerenti? La probabilità dello scenario
Robustezza La conclusione sopravvive a un insieme motivato di variazioni? Performance futura o causalità
Out-of-sample La specifica generalizza su dati non usati per sceglierla? Immunità a regime change e bias comuni
Replicazione Un'analisi indipendente ottiene evidenza compatibile? Identità dei risultati in ogni campione

Un plateau di parametri può essere preferibile a un picco isolato perché mostra minore sensibilità locale, ma non è una prova. Il plateau potrebbe essere generato da dati contaminati o da una famiglia di varianti quasi identiche. La logica economica e la correttezza della simulazione restano prerequisiti.

Le dimensioni da sottoporre a prova

Dati. Confrontare, quando possibile, fonti, regole di pulizia, timestamp, corporate action, universo point-in-time e trattamento dei missing. Un cambio di provider può rivelare dipendenza da convenzioni non documentate.

Specificazione. Variare parametri e trasformazioni entro regioni motivate dal processo studiato. L'ampiezza non dovrebbe essere una percentuale fissa uguale per qualunque variabile: un giorno, un tick e un decile hanno significati diversi.

Campione. Esaminare sottoperiodi, mercati e condizioni senza scegliere ex post soltanto le segmentazioni favorevoli. Rimuovere un periodo influente può mostrare concentrazione, ma riduce anche il campione e aumenta l'incertezza.

Esecuzione. Cambiare ritardo del segnale, benchmark di fill, spread, slippage, impatto, partecipazione al volume, fill parziali e costo opportunità secondo scenari plausibili per lo strumento e la size. Raddoppiare sempre le commissioni non è un criterio universale né copre la liquidità.

Costruzione del portafoglio. Verificare leva, cap, ribilanciamento, concentrazione, borrow, funding, rendimento della cassa e interazione fra posizioni. L'edge del segnale e quello prodotto dal sizing vanno distinti.

Selezione statistica. Registrare tutte le varianti e considerare test multipli. Provare centinaia di stress e mostrare soltanto quelli superati è una nuova forma di data snooping.

Protocollo di una batteria di robustezza

  1. Dichiarare la conclusione da stressare. Per esempio: segno dell'expectancy netta, vantaggio sul benchmark o tollerabilità del drawdown.
  2. Elencare le assunzioni materiali. Dati, orologio degli eventi, feature, parametri, universo, sizing, costi, liquidità e metriche.
  3. Collegare ogni test a un rischio. Motivare intervallo e direzione dello stress con proprietà del mercato o incertezza di misura.
  4. Congelare criteri e output. Stabilire prima quali metriche osservare e come classificare esiti favorevoli, ambigui o incompatibili.
  5. Eseguire test singoli e congiunti. Le perturbazioni isolate facilitano la diagnosi; combinazioni coerenti mostrano interazioni e possibili cliff.
  6. Registrare l'intera batteria. Conservare configurazioni, risultati negativi, seed e modifiche. Ogni prova conta nel processo di selezione.
  7. Separare robustezza e test finale. Gli stress usati per scegliere la specifica appartengono allo sviluppo; l'OOS finale resta non consultato.
  8. Tradurre il risultato in limiti. Documentare condizioni in cui il modello non è affidabile, controlli live e cause di sospensione.

Come rappresentare i risultati

Una tabella o una mappa di sensibilità dovrebbe mostrare tutte le regioni esaminate, non soltanto il parametro migliore. Oltre alla media servono dispersione, drawdown, turnover, esposizione, costi e concentrazione per eventi. È utile distinguere:

  • stabilità del segno, quando la conclusione qualitativa resta uguale;
  • stabilità dell'ordine, quando il modello conserva il vantaggio sul benchmark o sulle alternative;
  • stabilità economica, quando il margine resta significativo dopo costi e vincoli;
  • stabilità operativa, quando fill, dati e controlli possono essere riprodotti nel processo reale.

Non occorre che ogni numero resti invariato. Una strategia può essere robusta pur mostrando la degradazione attesa in scenari più costosi; il punto è che la conclusione e i limiti siano comprensibili e non dipendano da un'unica assunzione nascosta.

Esempio illustrativo

Esempio dichiarato illustrativo — Un segnale di breakout viene valutato con più ritardi eseguibili, fonti dati confrontabili, finestre di lookback adiacenti e modelli di costo legati a spread e partecipazione al volume. La redditività scompare quando il fill viene spostato al primo evento realmente negoziabile: questo esito identifica un problema di causalità, non una semplice “mancanza di robustezza”. In un altro scenario il risultato resta positivo ma molto incerto: la classificazione corretta può essere “non conclusivo”, non “promosso”.

I valori degli stress devono derivare dal mercato e dall'incertezza del modello; non esistono scostamenti percentuali, moltiplicatori di costo o soglie di profit factor validi per tutte le strategie.

Monte Carlo e perturbazioni del percorso

Bootstrap, rimescolamento e simulazioni Monte Carlo possono descrivere come una metrica cambia sotto uno specifico modello di dipendenza e distribuzione. Se si rimescolano trade indipendentemente, si elimina per costruzione parte della sequenza temporale; se si usano blocchi, la scelta della loro lunghezza diventa un'assunzione. Queste tecniche non creano eventi mai osservati e non correggono automaticamente leakage, universo contaminato, impact sottostimato o selezione fra molte strategie.

Limiti

  • La batteria è necessariamente incompleta rispetto ai futuri stati del mondo.
  • Stress scelti dopo aver visto il risultato possono diventare ottimizzazione.
  • Stabilità storica e significatività statistica sono domande differenti.
  • Scenari estremi non hanno automaticamente una probabilità interpretabile.
  • La robustezza supporta la gestione del rischio di modello; non sostituisce validazione indipendente, controlli operativi e monitoraggio successivo.

Fonti

Collegamenti