A quién va dirigido — A quien haya obtenido un resultado histórico favorable y quiera saber cuánto depende de una combinación concreta de datos, parámetros, costes, periodo y ejecución.
La robustez describe en qué medida las conclusiones sobre una estrategia se mantienen cuando cambian, dentro de intervalos plausibles, los supuestos que no deberían determinar por completo su valor. Es una propiedad gradual y condicionada: una estrategia puede ser robusta frente a los parámetros y frágil frente a los costes, o estable en varios periodos pero dependiente de un solo provider de datos.
La robustez no significa inmunidad al cambio y no demuestra la existencia de un edge futuro. Una batería de pruebas se utiliza sobre todo para la falsación: busca revelar qué variaciones plausibles rompen la conclusión. Superarla no garantiza rendimiento futuro. Además, todas las pruebas pueden compartir el mismo look-ahead, survivorship bias o error de fill. Su finalidad es hacer visibles las dependencias del resultado y encontrar puntos de rotura, no conceder un certificado automático de validez.
Robustez, sensibilidad y validación
| Concepto | Pregunta | Qué no demuestra |
|---|---|---|
| Análisis de sensibilidad | ¿Cómo cambia el output al variar un input? | Que los escenarios elegidos sean completos |
| Stress test | ¿Dónde se rompe el sistema bajo condiciones severas pero coherentes? | La probabilidad del escenario |
| Robustez | ¿La conclusión sobrevive a un conjunto justificado de variaciones? | Rendimiento futuro o causalidad |
| Out-of-sample | ¿La especificación generaliza sobre datos no usados para elegirla? | Inmunidad al cambio de régimen y a sesgos comunes |
| Replicación | ¿Un análisis independiente obtiene evidencia compatible? | Identidad de resultados en todas las muestras |
Una meseta de parámetros puede ser preferible a un pico aislado porque muestra menor sensibilidad local, pero no es una prueba. La meseta podría estar generada por datos contaminados o por una familia de variantes casi idénticas. La lógica económica y la corrección de la simulación siguen siendo requisitos previos.
Dimensiones que deben ponerse a prueba
Datos. Comparar, cuando sea posible, fuentes, reglas de limpieza, timestamps, corporate actions, universo point-in-time y tratamiento de valores ausentes. Cambiar de provider puede revelar dependencia de convenciones no documentadas.
Especificación. Variar parámetros y transformaciones dentro de regiones justificadas por el proceso estudiado. La amplitud no debería ser un porcentaje fijo idéntico para cualquier variable: un día, un tick y un decil tienen significados diferentes.
Muestra. Examinar subperiodos, mercados y condiciones sin elegir a posteriori solo las segmentaciones favorables. Eliminar un periodo influyente puede mostrar concentración, pero también reduce la muestra y aumenta la incertidumbre.
Ejecución. Cambiar el retardo de la señal, benchmark de fill, spread, slippage, impacto, participación en volumen, fills parciales y coste de oportunidad según escenarios plausibles para el instrumento y el tamaño. Duplicar siempre las comisiones no es un criterio universal ni cubre la liquidez.
Construcción de cartera. Comprobar apalancamiento, caps, rebalanceo, concentración, borrow, financiación, rendimiento del efectivo e interacción entre posiciones. Deben distinguirse el edge de la señal y el generado por el sizing.
Selección estadística. Registrar todas las variantes y considerar las pruebas múltiples. Ejecutar cientos de stress tests y mostrar solo los superados es una nueva forma de data snooping.
Protocolo de una batería de robustez
- Declarar la conclusión que se somete a stress. Por ejemplo, signo de la expectancy neta, ventaja sobre el benchmark o tolerabilidad del drawdown.
- Enumerar los supuestos materiales. Datos, reloj de eventos, features, parámetros, universo, sizing, costes, liquidez y métricas.
- Vincular cada prueba a un riesgo. Justificar intervalo y dirección del stress mediante propiedades del mercado o incertidumbre de medida.
- Congelar criterios y outputs. Establecer antes qué métricas observar y cómo clasificar resultados favorables, ambiguos o incompatibles.
- Ejecutar pruebas individuales y conjuntas. Las perturbaciones aisladas facilitan el diagnóstico; las combinaciones coherentes muestran interacciones y posibles cliffs.
- Registrar toda la batería. Conservar configuraciones, resultados negativos, semillas y cambios. Cada prueba cuenta en el proceso de selección.
- Separar robustez y prueba final. Los stress tests utilizados para elegir la especificación pertenecen al desarrollo; el OOS final permanece sin consultar.
- Traducir el resultado en límites. Documentar las condiciones en las que el modelo no es fiable, los controles live y las causas de suspensión.
Cómo representar los resultados
Una tabla o mapa de sensibilidad debería mostrar todas las regiones examinadas, no solo el mejor parámetro. Además de la media se necesitan dispersión, drawdown, rotación, exposición, costes y concentración por eventos. Resulta útil distinguir:
- estabilidad del signo, cuando la conclusión cualitativa se mantiene;
- estabilidad del orden, cuando el modelo conserva su ventaja sobre el benchmark o las alternativas;
- estabilidad económica, cuando el margen sigue siendo material después de costes y restricciones;
- estabilidad operativa, cuando fills, datos y controles pueden reproducirse en el proceso real.
No es necesario que cada número permanezca invariable. Una estrategia puede ser robusta aunque muestre la degradación esperada en escenarios más costosos; lo importante es que la conclusión y los límites sean comprensibles y no dependan de un único supuesto oculto.
Ejemplo ilustrativo
Ejemplo declarado como ilustrativo — Una señal de breakout se evalúa con varios retardos ejecutables, fuentes de datos comparables, ventanas de lookback adyacentes y modelos de costes ligados al spread y a la participación en volumen. La rentabilidad desaparece cuando el fill se desplaza al primer evento realmente negociable: esto identifica un problema de causalidad, no una simple «falta de robustez». En otro escenario, el resultado sigue siendo positivo pero muy incierto; la clasificación correcta puede ser «no concluyente», no «superado».
Los valores de los stress deben proceder del mercado y de la incertidumbre del modelo; no existen desplazamientos porcentuales, multiplicadores de costes ni umbrales de profit factor válidos para todas las estrategias.
Monte Carlo y perturbaciones del recorrido
Bootstrap, reordenación y simulaciones Monte Carlo pueden describir cómo cambia una métrica bajo un modelo concreto de dependencia y distribución. Reordenar trades de forma independiente elimina por construcción parte de la secuencia temporal; si se utilizan bloques, la elección de su longitud se convierte en un supuesto. Estas técnicas no crean eventos nunca observados y no corrigen automáticamente leakage, un universo contaminado, impacto infravalorado ni la selección entre numerosas estrategias.
Limitaciones
- La batería es necesariamente incompleta frente a los estados futuros del mundo.
- Los stress elegidos después de ver el resultado pueden convertirse en optimización.
- La estabilidad histórica y la significación estadística son preguntas diferentes.
- Los escenarios extremos no tienen automáticamente una probabilidad interpretable.
- La robustez apoya la gestión del riesgo de modelo; no sustituye validación independiente, controles operativos ni monitorización posterior.
Fuentes
- Robert D. Arnott, Campbell R. Harvey y Harry Markowitz, A Backtesting Protocol in the Era of Machine Learning — protocolo, selección y stress de conclusiones financieras.
- Halbert White, A Reality Check for Data Snooping, Econometrica, 2000 — comparación con el benchmark después de investigar varios modelos.
- David H. Bailey et al., The Probability of Backtest Overfitting — fragilidad de la configuración seleccionada y evaluación fuera de muestra.
- André F. Perold, The Implementation Shortfall: Paper Versus Reality, 1988 — distancia entre una cartera teórica y un resultado realizable mediante la ejecución.
- Board of Governors of the Federal Reserve System, SR 26-2 — Revised Guidance on Model Risk Management, 2026 — gobernanza, validación, limitaciones y monitorización del riesgo de modelo dentro de su ámbito de supervisión.