À qui s’adresse cette page — À quiconque souhaite transformer une idée de trading en simulation contrôlable, en distinguant ce que le modèle aurait pu connaître et négocier de ce qui n’est visible qu’a posteriori.
Un backtest applique à des données historiques une spécification complète de signaux, de portefeuille, d’ordres, de coûts et de contraintes. Il produit un résultat contrefactuel : ce qui se serait passé selon ce modèle si les règles avaient été exécutées pendant la période observée. Ce n’est pas un historique réel, il ne démontre pas l’existence d’une relation causale et ne garantit pas que la distribution future ressemblera à la distribution passée.
Toute conclusion reste conditionnée par l’échantillon, la spécification, les données et les hypothèses opérationnelles déclarées.
La distinction décisive sépare la stratégie du simulateur. La stratégie indique quand prendre un risque ; le simulateur traduit la décision en positions et en rendements. Un signal raisonnable peut paraître excellent à cause d’une erreur d’horodatage, de prix non négociables ou de coûts omis. À l’inverse, un modèle d’exécution excessivement pénalisant peut masquer le comportement que l’on cherche à étudier. Les hypothèses doivent donc être déclarées et vérifiables.
Ce qu’il faut spécifier
| Niveau | Question vérifiable | Erreur évitée |
|---|---|---|
| Données | Quelle valeur était disponible à cet instant précis ? | look-ahead, révisions, biais de survie |
| Signal | Avec quelles variables, quels délais et quels paramètres décide-t-on ? | règles reconstruites après observation du résultat |
| Portefeuille | Comment transforme-t-on les signaux en poids, tailles et limites ? | levier ou concentration implicites |
| Exécution | Quand et à quel prix l’ordre peut-il être exécuté ? | exécutions impossibles sur la même barre |
| Économie | Quels coûts, financements, prêts de titres et opérations sur titres s’appliquent ? | performance brute prise pour une performance réalisable |
| Évaluation | Quelles métriques, quels benchmarks et quels tests avaient été choisis auparavant ? | sélection a posteriori de la lecture la plus favorable |
Les données doivent être point-in-time lorsque leur historique peut changer. Cela concerne la composition des indices, les titres radiés, les fondamentaux avec dates de publication, les séries macroéconomiques révisées et les classifications d’entreprises. Inclure les tickers disparus ne suffit pas s’il manque les rendements de radiation, la composition historique ou le traitement correct des opérations sur le capital.
Causalité : savoir, décider, exécuter
Chaque événement devrait posséder au moins un instant de disponibilité et un instant d’action. Si la clôture de la barre entre dans le signal, une exécution à cette même clôture exige une spécification crédible de l’enchère, du temps de calcul et de l’envoi de l’ordre ; sinon, le premier prix utilisable appartient à un événement ultérieur. Le même principe vaut pour les communiqués, les indicateurs économiques et les données fondamentales : la date de référence ne coïncide pas nécessairement avec celle où l’information devient publique.
Pour les contrats à terme, options, obligations, instruments vendus à découvert ou à effet de levier, il faut aussi des règles cohérentes concernant échéances, roll, multiplicateurs, marges, exercice, assignation, prêt de titres, collatéral et rendement de la trésorerie. Aucun modèle d’exécution unique ne convient à toutes les classes d’actifs.
Protocole minimal reproductible
- Définir la question. Écrire l’hypothèse économique, l’univers, la fréquence, la période, le benchmark et le critère d’évaluation du résultat.
- Geler la spécification. Versionner signaux, paramètres, dimensionnement, contraintes, données et calendrier. Conserver un registre de tous les essais, y compris ceux qui échouent.
- Construire l’horloge. Ordonner disponibilité de l’information, décision, envoi, éventuelle annulation et exécution.
- Simuler le portefeuille. Appliquer les limites de capital, de levier, de liquidité, de turnover et de concentration sans utiliser le futur.
- Estimer l’exécution. Déclarer spread, commissions, slippage, impact, exécutions partielles, financement et coût d’opportunité pertinents.
- Mesurer sans sélectionner a posteriori. Présenter rendement net, risque, drawdown, turnover, exposition, capacité et comparaison avec le benchmark, avec l’incertitude statistique.
- Valider séparément. Réserver des données temporelles non utilisées dans le développement et définir le traitement de la dépendance, des labels qui se chevauchent, du réajustement et des tests finaux.
- Archiver les artefacts. Conserver code, configuration, versions des dépendances, graines, instantanés ou empreintes des données et sorties principales.
Coûts et prix de référence
Les commissions et le spread ne représentent qu’une partie du coût. Une simulation peut devoir intégrer impact de marché, quantité disponible, retard, absence d’exécution, financement, prêt de titres, conversion de devises et fiscalité applicable au périmètre déclaré. L’implementation shortfall compare l’exécution à l’intention au moment de la décision et peut inclure la partie non exécutée ; il ne se confond pas avec une commission fixe ajoutée en fin de calcul.
Lorsque les données le permettent, le modèle de coûts devrait dépendre du côté, de la taille, de la liquidité, de la volatilité, de la plateforme et du type d’ordre. Un scénario de coûts plus sévères est informatif, mais ne répare ni des données contaminées ni des exécutions impossibles.
Exemple illustratif
Exemple explicitement illustratif, et non résultat opérationnel — Une règle quotidienne calcule le signal après la clôture. Le protocole emploie les composantes point-in-time, envoie l’ordre à la séance suivante, limite la participation au volume et impute spread, commissions et impact croissant avec la taille. Les métriques nettes sont comparées à un benchmark de rendement total dans la même devise. Si le chercheur essaie douze variantes de lookback, les douze figurent dans le registre des essais : il serait incorrect de présenter la seule gagnante comme hypothèse initiale.
L’exemple ne détermine pas quels délais ou coûts conviennent à un marché donné. Il montre les éléments qui doivent pouvoir être contestés et recalculés.
Comment lire le résultat
Une courbe ascendante ne constitue pas une validation. Il faut demander si le rendement se concentre dans quelques événements, s’il change sous de petites perturbations raisonnables, s’il résiste à des coûts plausibles, si le benchmark a été choisi ex ante et si la précision estimée est compatible avec le nombre et la dépendance des observations. Le nombre de trades n’est pas automatiquement le nombre d’observations indépendantes.
Le backtest est plus utile comme outil de falsification et de diagnostic que comme machine produisant une prévision ponctuelle. Un résultat négatif peut révéler une hypothèse incohérente ; un résultat positif fait de la stratégie une candidate aux contrôles de robustesse, à la validation hors échantillon et à l’observation prospective, sans la transformer en certitude.
Limites
- Le passé observé peut ne pas contenir les crises, régimes ou microstructures à venir.
- La qualité apparente dépend du nombre de modèles et de paramètres explorés.
- Le slippage et l’impact sont contrefactuels et deviennent plus incertains avec la taille.
- Une réplication avec le même code et les mêmes données vérifie la reproductibilité, mais ne constitue pas une réplication indépendante.
- Monte Carlo et tests de stress décrivent des scénarios construits : ils n’éliminent ni look-ahead, ni biais de survie, ni data snooping, ni erreurs de spécification.
Références
- Halbert White, A Reality Check for Data Snooping, Econometrica, 2000 — inférence lorsque le meilleur modèle ressort de nombreuses spécifications explorées.
- Robert D. Arnott, Campbell R. Harvey et Harry Markowitz, A Backtesting Protocol in the Era of Machine Learning — protocole de recherche, sélection et rareté des données financières.
- Marcos López de Prado, What to Look for in a Backtest — nombre d’essais, longueur du test et caractéristiques à rendre visibles.
- André F. Perold, The Implementation Shortfall: Paper Versus Reality, The Journal of Portfolio Management, 1988 — comparaison du portefeuille théorique et de l’exécution effective.
- Commission européenne, Règlement délégué (UE) 2017/589, RTS 6 — méthodologie, documentation et environnements de test des systèmes algorithmiques dans son périmètre réglementaire.