Aller au contenu

Data snooping et tests multiples

Erreur de sélection qui apparaît lorsque de nombreuses stratégies, features ou seuils sont essayés sur les mêmes données et que seul le meilleur résultat est présenté.

À qui s’adresse cette page — À quiconque compare de nombreuses stratégies, marchés, features ou paramètres et risque d’attribuer une compétence au gagnant produit par le hasard.

Le data snooping se produit lorsque le même ensemble de données sert de manière répétée à explorer, sélectionner et évaluer des règles, tandis que l’inférence finale ignore le processus de recherche. Le problème des tests multiples en est la conséquence statistique : plus le nombre d’hypothèses essayées augmente, plus la probabilité qu’au moins l’une paraisse convaincante par chance s’élève.

Il n’est pas nécessaire de manipuler consciemment les résultats. Essayer dix fenêtres, cinq filtres, plusieurs univers, coûts et dates initiales crée une famille de candidats. Ne publier que la combinaison au meilleur Sharpe revient à la traiter comme si elle avait été choisie avant d’observer les données. L’incertitude ainsi calculée est trop faible.

Surapprentissage et sélection parmi de nombreux essaisLe meilleur résultat en échantillon intègre aussi la chance liée à la recherche. Les nombres et les surfaces sont illustratifs ; chaque spécification testée appartient au processus de sélection.Surapprentissage et sélection parmi de nombreuxessaisLe meilleur résultat en échantillon intègre aussi la chance liée à la rechercheLes nombres et les surfaces sont illustratifs ; chaque spécification testée appartient au processus de sélection.Espace des essais16 configurations testées · un pic isolé0.20.40.1-0.10.30.81.90.20.10.60.70.1-0.20.10.30.02Gagnant sélectionnéLe maximum historique n’est pas une estimation non biaiséedu rendement futur.3Test indépendantUne évaluation non utilisée pour le choix mesure ladégradation hors échantillon.4Inférence avec multiplicitéLa conclusion tient compte du nombre d’essais, de ladépendance et de la règle de sélection.Cyclepedia · schéma pédagogique conditionnel, ni prévision ni promesse
Le résultat sélectionné hérite de toute l’histoire de la recherche : variantes écartées et choix informés par les données ne disparaissent pas.

Surapprentissage et data snooping ne sont pas identiques

Problème Unité principale Exemple
Surapprentissage du modèle configuration trop ajustée à l’échantillon de nombreuses règles captent le bruit local
Data snooping recherche répétée sur les mêmes données marché, fenêtre et métrique les plus favorables sont choisis ex post
Tests multiples famille d’hypothèses comparées au moins un résultat franchit le seuil par hasard
Biais de publication résultats qui deviennent visibles les succès sont publiés plus souvent
Degrés de liberté du chercheur choix analytiques flexibles exclusions, transformations et benchmarks changent après le résultat

Un modèle simple peut être sélectionné par data snooping ; un modèle complexe peut surapprendre au cours d’une seule estimation. Souvent, les deux problèmes s’additionnent.


Pourquoi le nombre d’essais compte

Supposons, à titre purement pédagogique, que chaque test ait une probabilité α de franchir un seuil sous l’hypothèse nulle et que les tests soient indépendants. La probabilité qu’au moins un test sur m franchisse le seuil est :

1 − (1 − α)ᵐ

Dans la recherche réelle, les candidats sont souvent corrélés ; cette formule ne décrit donc pas exactement le problème. Elle montre néanmoins pourquoi évaluer le gagnant comme test unique est incorrect. La corrélation entre stratégies ne rend pas la sélection négligeable ; elle modifie la distribution du maximum et exige des méthodes cohérentes.

Les « essais » comprennent aussi des décisions informelles : regarder le graphique puis changer la date initiale, supprimer un marché, transformer une feature ou choisir la métrique après le résultat. Si ces choix ne sont pas enregistrés, aucune correction ne peut en reconstituer parfaitement le nombre.


Registre des expériences

Un registre utile conserve pour chaque essai :

  • identifiant et horodatage ;
  • hypothèse et motivation ;
  • version du code, des données et de la configuration ;
  • univers, période, benchmark et coûts ;
  • features, paramètres et contraintes ;
  • métriques prévues avant le test ;
  • résultat complet, même négatif ;
  • décision prise et justification ;
  • relation avec les essais précédents.

Le registre n’élimine pas le data snooping. Il rend toutefois l’espace de recherche mesurable et empêche les échecs de disparaître. Regrouper des variantes presque identiques peut être nécessaire pour certaines méthodes, mais la règle de regroupement doit être déclarée et ne pas être choisie pour améliorer le résultat corrigé.


Outils statistiques : problème et objectif

Outil Question traitée Ce qu’il ne démontre pas
Reality Check de White le meilleur parmi de nombreux modèles dépasse-t-il un benchmark en tenant compte de la recherche ? que le modèle restera stable ou investissable
SPA de Hansen une capacité prédictive supérieure existe-t-elle avec davantage de puissance dans certains contextes ? absence de fuite ou réalisme des coûts
Corrections FWER / stepwise comment contrôler la probabilité d’au moins un faux rejet ? équivalence économique des candidats
False discovery rate quelle proportion attendue de fausses découvertes tolérer dans une famille ? validité causale du mécanisme
Deflated Sharpe Ratio le Sharpe observé reste-t-il exceptionnel compte tenu de la sélection et de la non-normalité ? historique réel ou garantie future
Probability of Backtest Overfitting à quelle fréquence la sélection in-sample peut-elle se dégrader hors échantillon dans le plan retenu ? exactitude des données ou universalité de l’estimation

Chaque outil exige des entrées et possède des hypothèses. Appliquer une formule après avoir dissimulé la moitié des essais produit une précision apparente, et non une inférence honnête.


Un hors échantillon peut être consommé

Le premier test d’un segment peut se situer hors de l’échantillon de développement. Si son résultat conduit à modifier la stratégie et à réexécuter le même segment, cette période est entrée dans la sélection. Renommer l’étiquette « validation » après de nombreuses itérations ne résout rien : il faut déclarer l’histoire et préserver une nouvelle information pour une évaluation ultérieure.

Une comparaison publique peut elle aussi transférer de l’information. Choisir une stratégie parce que de nombreuses publications montrent son succès sur les mêmes données historiques réduit l’indépendance d’un nouveau backtest sur cette période. La recherche reste utile, mais la force de la confirmation est limitée.


Exemple illustratif

Un chercheur essaie 200 variantes d’un signal et choisit celle au Sharpe le plus élevé. Il présente ensuite intervalle et p-value comme si cette variante avait été la seule. L’erreur n’est pas d’avoir exploré : l’exploration peut produire des idées. L’erreur consiste à appliquer l’inférence d’un test préspécifié à un gagnant sélectionné.

Un processus plus transparent enregistre les 200 variantes, sépare exploration et confirmation, compare une baseline, applique une méthode adaptée à la famille des essais et conserve des données inutilisées ou une évaluation prospective. Le nombre 200 est illustratif ; la matérialité dépend de la dépendance entre candidats et du plan.


Protocole de réduction du risque

  1. Préspecifier hypothèses, métriques primaires, benchmark et critère de décision.
  2. Conserver chaque essai et chaque modification informée par les données.
  3. Séparer environnement exploratoire, sélection et confirmation.
  4. Employer des baselines simples pour mesurer la valeur incrémentale.
  5. Corriger l’inférence pour la famille de comparaisons lorsque c’est pertinent.
  6. Vérifier la sensibilité sans ne retenir ex post que les stress réussis.
  7. Présenter la distribution des candidats, pas seulement le maximum.
  8. Limiter la conclusion à l’échantillon, aux hypothèses et à l’usage réellement examinés.

Simplicité et plateau des paramètres sont des diagnostics utiles, pas des preuves d’absence de snooping. Une région entière peut paraître stable parce que tous ses paramètres exploitent le même biais dans les données.


Références

Liens connexes