À qui s’adresse cette page — À quiconque doit évaluer une stratégie en respectant l’ordre du temps, sans transformer le futur en information de développement et sans dépendre d’un découpage arbitraire unique.
La validation temporelle évalue une procédure sur des observations postérieures à celles qui ont servi à l’estimer ou à la choisir. La walk-forward analysis répète ce principe à partir d’origines successives : à chaque étape, elle n’emploie que le passé admis par le protocole, produit une décision pour le segment suivant, puis avance dans le temps.
La méthode imite mieux une procédure recalibrée au cours de sa vie opérationnelle, mais n’est pas une preuve définitive. Le résultat dépend de la longueur et du type des fenêtres, de la fréquence de réajustement, de l’horizon des labels, des règles de sélection, des coûts et du nombre de configurations considérées. Si les résultats des folds influencent les choix, ils appartiennent au développement ; les concaténer ne crée pas automatiquement un test final intact.
Principaux plans
| Plan | Manière d’employer le passé | Quand il est informatif | Limite caractéristique |
|---|---|---|---|
| Holdout chronologique | développement d’abord, test final ensuite | décision finale simple avec test préservé | une période unique peut être peu représentative |
| Rolling origin | l’origine de prévision avance ; le training peut s’élargir | évaluer plusieurs décisions successives | résultats dépendants et adaptation itérative possible |
| Expanding window | le training conserve toute l’histoire disponible | processus apprenant de manière cumulative | les données anciennes peuvent mal représenter le régime actuel |
| Rolling window | le training garde une longueur finie | processus qui oublie le passé lointain | choix de la fenêtre et moindre quantité de données |
| Validation croisée bloquée | des blocs temporels préservent la structure locale | comparaisons dans un plan motivé | frontières et dépendance entre blocs doivent être vérifiées |
| Test final prospectif | version gelée sur des événements futurs | contrôle du processus réellement orienté vers l’avant | temps, coût et échantillon initialement limité |
Il n’existe aucun découpage 70/30 universellement correct. Un système intraday aux labels chevauchants, une stratégie mensuelle et un modèle macro disposant de peu de récessions contiennent des quantités d’information et des dépendances très différentes, même avec le même nombre de lignes.
Rolling ou expanding
Avec une origine t, un plan expanding emploie toutes les
observations admises jusqu’à t ; un plan rolling ne garde que les
w dernières. Le premier maximise l’histoire, le second permet au
processus d’oublier des données anciennes. Ce choix exprime une hypothèse de
stabilité ; ce n’est pas un détail technique.
Chaque configuration doit déclarer :
- le début et la fin du training, de la validation et du test pour chaque fold ;
- la fenêtre rolling ou expanding et sa justification ;
- le pas entre les origines et la longueur de l’horizon évalué ;
- la fréquence de refit, de recalibration et de resélection des paramètres ;
- le traitement du warm-up, des données manquantes, des nouveaux instruments et des instruments disparus ;
- l’agrégation des résultats et la dépendance entre folds ;
- la date à laquelle une décision fondée sur les folds est prise.
Si, à chaque étape, le meilleur paramètre est choisi à l’aide du segment suivant, ce segment est une validation, pas un test. Pour estimer honnêtement la procédure, la sélection interne doit être reproduite avec la seule information disponible à cette origine.
Labels chevauchants, gap, purging et embargo
Dans les problèmes financiers, une observation peut employer de l’information sur un intervalle et non sur un seul horodatage. Si un label mesure le rendement des cinq jours suivants, des labels adjacents partagent des jours. Une ligne formellement antérieure au test peut donc contenir des résultats entrant dans son intervalle informationnel.
Le purging retire du training les observations dont les intervalles informationnels croisent le test. Un gap ou embargo laisse une séparation temporelle motivée afin de réduire les contaminations dues au chevauchement ou à la dépendance. Dans la finance, ces outils sont associés à la formulation diffusée par López de Prado ; ce ne sont pas des remèdes automatiques. Leur largeur doit dépendre de l’horizon, de la construction des features, des labels et du processus opérationnel, non d’un pourcentage fixe.
Supprimer des lignes ne corrige ni un prétraitement estimé sur tout l’échantillon, ni un univers construit avec les survivants, ni des révisions futures. Le contrôle doit couvrir toute la chaîne.
Le cas du k-fold aléatoire
Affirmer que le k-fold aléatoire est toujours invalide pour les séries temporelles serait excessif. Bergmeir, Hyndman et Koo montrent les conditions dans lesquelles la validation croisée standard peut convenir à des modèles purement autorégressifs, notamment lorsque les erreurs ne sont pas corrélées. La leçon n’est pas que le mélange est généralement sûr, mais que la validité dépend de la structure du problème.
Dans le trading, ordre causal, transformations estimées, univers variables, labels chevauchants et coûts rendent normalement plus prudent un plan chronologique reproduisant l’usage prévu. Quiconque choisit un plan non chronologique doit démontrer les conditions qui le rendent adéquat et vérifier les résidus, plutôt que d’invoquer seulement le nom de la méthode.
Exemple illustratif
Une procédure est recalibrée au début de chaque mois. Un fold expanding emploie toutes les données disponibles jusqu’à la fin du mois précédent, sélectionne une configuration par une validation interne elle aussi temporelle et génère des positions pour le mois suivant. Douze mois produisent douze segments d’évaluation.
Si l’analyste observe les douze résultats et modifie les features, tout l’ensemble a informé le développement. Il peut décrire l’expérience et répéter le processus sur une nouvelle période, mais ne doit plus présenter ces mois comme un test final jamais vu. L’exemple ne dit pas qu’un mois constitue le bon pas : celui-ci dépend de l’horizon et de la fréquence de la stratégie.
Agréger sans perdre l’incertitude
Additionner les rendements dans une courbe walk-forward montre le parcours d’une procédure simulée, mais ne rend pas les folds indépendants. Il convient de présenter :
- les résultats par fold et agrégés, pas seulement la moyenne ;
- les dates, régimes, instruments et expositions qui concentrent le P&L ;
- les métriques brutes et nettes avec le même benchmark ;
- la distribution des erreurs et la stabilité de la sélection ;
- le turnover, la capacité et la fréquence de recalibration ;
- toutes les configurations considérées dans le processus.
La variance entre folds peut être informative même lorsque la moyenne est positive. Un résultat dominé par une seule origine ou une seule crise appelle une conclusion plus limitée.
Liste de contrôle
- Reconstituer le diagramme temporel complet avant de calculer les métriques.
- Aligner fenêtres et pas sur l’usage réel et l’horizon informationnel.
- Exécuter prétraitement, sélection des features et tuning dans chaque training.
- Appliquer gap ou purging uniquement lorsque la structure des intervalles le justifie.
- Compter toute réutilisation des folds comme information de développement.
- Conserver, si possible, un test final ou une phase prospective distincte.
- Présenter dépendance, dispersion et concentration des résultats.
Références
- Leonard J. Tashman, Out-of-sample tests of forecasting accuracy: an analysis and review — taxonomie et motivation des évaluations rolling-origin hors échantillon.
- Christoph Bergmeir, Rob J. Hyndman et Bonsoo Koo, A note on the validity of cross-validation for evaluating autoregressive time series prediction — conditions précises de validité du k-fold pour les modèles autorégressifs.
- Jeffrey S. Racine, Consistent cross-validatory model-selection for dependent data: hv-block cross-validation — proposition d’une séparation en blocs pour données dépendantes, à employer avec ses hypothèses et les discussions méthodologiques ultérieures.
- Marcos López de Prado, Advances in Financial Machine Learning — table des matières officielle Wiley — référence d’auteur pour purging et embargo ; elle n’est pas présentée comme consensus universel ni comme article fondateur évalué par les pairs.