Aller au contenu

Surapprentissage

Ajustement au bruit historique et sélection parmi de nombreux essais : comment reconnaître, mesurer et contenir le surapprentissage dans les systèmes de trading.

À qui s’adresse cette page — À quiconque compare stratégies, paramètres ou features sur le même historique et souhaite comprendre quelle part de la performance sélectionnée peut relever de l’ajustement au bruit plutôt que de la capacité de généralisation.

Le surapprentissage se produit lorsqu’une spécification apprend des particularités de l’échantillon qui ne se répètent pas en dehors de celui-ci. Dans le trading, il peut naître de la complexité du modèle, mais aussi d’un processus apparemment simple : essayer de nombreuses règles, marchés, périodes ou métriques et ne publier que la meilleure combinaison.

Le data snooping est l’emploi répété des mêmes données pour sélectionner une stratégie ou une conclusion. Il est étroitement lié au surapprentissage, sans en être un synonyme parfait : le premier décrit le processus de recherche et de sélection ; le second, la faible généralisation de la spécification obtenue. Même une règle à paramètre unique peut être surajustée si elle gagne parmi des milliers d’essais non déclarés.

Surapprentissage et sélection parmi de nombreux essaisLe meilleur résultat en échantillon intègre aussi la chance liée à la recherche. Les nombres et les surfaces sont illustratifs ; chaque spécification testée appartient au processus de sélection.Surapprentissage et sélection parmi de nombreuxessaisLe meilleur résultat en échantillon intègre aussi la chance liée à la rechercheLes nombres et les surfaces sont illustratifs ; chaque spécification testée appartient au processus de sélection.Espace des essais16 configurations testées · un pic isolé0.20.40.1-0.10.30.81.90.20.10.60.70.1-0.20.10.30.02Gagnant sélectionnéLe maximum historique n’est pas une estimation non biaiséedu rendement futur.3Test indépendantUne évaluation non utilisée pour le choix mesure ladégradation hors échantillon.4Inférence avec multiplicitéLa conclusion tient compte du nombre d’essais, de ladépendance et de la règle de sélection.Cyclepedia · schéma pédagogique conditionnel, ni prévision ni promesse
Plus les solutions recherchées sont nombreuses, plus il devient facile de trouver par hasard une courbe séduisante : le bon dénominateur inclut aussi les essais écartés.

D’où vient-il ?

Source d’ajustement Exemple Information à enregistrer
Paramètres nombreux lookbacks, seuils ou stops grille complète et critère de sélection
Règles filtres ajoutés après des pertes visibles séquence des modifications
Univers marchés ou titres choisis parce qu’ils ont fonctionné univers initial et exclusions
Période date de début déplacée jusqu’à améliorer la courbe toutes les fenêtres examinées
Métriques le Sharpe est montré parce que le drawdown est défavorable métriques prévues avant le test
Données et chaîne fournisseur, nettoyage ou exécution choisis ex post versions et variantes du simulateur
Récit l’explication économique naît après le résultat hypothèse initiale et chronologie de sa justification

Le risque ne dépend pas seulement du rapport entre nombre de paramètres et nombre de lignes. Il dépend de la liberté effective du processus de recherche : combien de décisions pouvaient changer après chaque résultat et quelle dépendance relie les observations. Le nombre brut de trades ne mesure donc pas à lui seul la quantité d’information indépendante qui soutient le modèle.

Symptômes, et non diagnostics automatiques

Un pic très étroit dans la surface des paramètres, des règles difficiles à justifier, un rendement concentré dans quelques opérations et un fort écart entre développement et test sont des signes de fragilité. Aucun n’est une preuve isolée. Un edge réel peut être localisé ; un régime futur peut changer ; un OOS court peut être bruité. Inversement, une surface régulière peut provenir de biais communs à toutes les variantes.

La simplicité est utile comme contrainte, pas comme certificat. « Peu de règles » n’annule pas la sélection ex post, tandis qu’une technique complexe peut généraliser si le protocole, la régularisation et la validation sont adaptés.

Tests multiples et gagnant apparent

Si de nombreuses stratégies dépourvues d’avantage réel sont mesurées, certaines présenteront tout de même des résultats exceptionnels par hasard. Une p-value ou un Sharpe calculé comme si la stratégie était l’unique hypothèse testée sous-estime ce problème. Les méthodes de White, Hansen et Romano-Wolf traitent des comparaisons multiples entre modèles ou règles ; la Probability of Backtest Overfitting étudie la probabilité que la configuration choisie in-sample perde son rang hors échantillon ; le Deflated Sharpe Ratio ajuste l’interprétation du Sharpe à la sélection et aux propriétés non gaussiennes des rendements.

Ces outils possèdent des hypothèses et ne transforment pas une recherche rétrospective en preuve causale. Pour être informatifs, ils exigent au minimum un inventaire crédible des solutions explorées.

Protocole de limitation

  1. Formuler l’hypothèse avant les résultats. Déclarer mécanisme économique, univers, variables, benchmark, métrique principale et critère d’arrêt.
  2. Tenir un registre des essais. Inclure configurations négatives, graines, périodes, actifs, filtres, transformations et métriques consultées.
  3. Séparer sélection et évaluation. Employer training et validation pour les choix ; conserver un test temporel final non consulté.
  4. Respecter la structure des données. Traiter dépendance, labels chevauchants et information point-in-time avec un découpage adapté.
  5. Limiter la liberté justifiable. Régulariser, réduire features et paramètres ou employer des hiérarchies motivées, sans chercher de « nombre magique ».
  6. Corriger l’inférence. Tenir compte des tests multiples, de la non-normalité, de l’autocorrélation et de l’incertitude des métriques.
  7. Soumettre la spécification à des perturbations. Faire varier des hypothèses plausibles sur paramètres, échantillon, coûts et exécution sans ne retenir ex post que les stress réussis.
  8. Conserver une décision lisible. Expliquer pourquoi la stratégie est écartée, étudiée davantage ou candidate à un forward test.

Exemple illustratif

Exemple explicitement illustratif — Un chercheur essaie dix lookbacks, cinq seuils et quatre univers : cela représente déjà deux cents configurations, avant même de compter coûts, périodes et filtres ultérieurs. La configuration au Sharpe historique le plus élevé ne peut être évaluée comme une hypothèse unique formulée à l’avance. Le protocole conserve tous les essais, sélectionne pendant la validation, applique une mesure cohérente avec la comparaison multiple et ne consulte le test final qu’une fois. Les nombres décrivent le mécanisme de sélection, pas un seuil d’acceptation.

Si le test final sert à modifier le lookback ou l’univers, le segment n’est plus intact pour la nouvelle version. L’échec ne démontre pas nécessairement que l’idée est sans valeur ; il indique que la spécification évaluée n’a pas fourni la preuve prévue par le protocole.

Robustesse et OOS ne sont pas des preuves définitives

Tests de stress, plateaux de paramètres, sous-périodes et walk-forward aident à décrire sensibilité et stabilité. Ils ne prouvent pas à eux seuls que l’edge est réel : ils peuvent partager le même look-ahead, le même univers contaminé ou la même erreur d’exécution. Même le test OOS devient une partie du développement lorsqu’il est consulté plusieurs fois.

Le contrôle le plus solide est donc procédural autant que statistique : rendre tous les choix visibles, empêcher l’information future d’entrer dans le modèle et préserver une distinction réelle entre exploration et évaluation.

Limites

  • Aucun indice unique ne mesure toutes les formes de surapprentissage.
  • Les corrections des comparaisons multiples dépendent de l’ensemble des essais et de leur dépendance, souvent seulement partiellement observables.
  • Un bon OOS peut relever du hasard ; un OOS faible peut refléter la variance ou un changement de régime.
  • De nouvelles données temporelles réduisent la réutilisation du passé, sans éliminer les problèmes de données, de coûts, de causalité ou de gouvernance.
  • La réplication indépendante reste distincte de la simple réexécution du même backtest.

Références

Liens connexes