A quién va dirigido — A quien compara estrategias, parámetros o features sobre el mismo historial y quiere entender cuánto del rendimiento elegido puede ser adaptación al ruido, en lugar de capacidad para generalizar.
El overfitting o sobreajuste se produce cuando una especificación aprende particularidades de la muestra que no se repiten fuera de ella. En trading puede surgir por la complejidad del modelo, pero también por un proceso que parece sencillo: probar muchas reglas, mercados, periodos o métricas y publicar solo la mejor combinación.
El data snooping es el uso repetido de los mismos datos para seleccionar una estrategia o una conclusión. Está estrechamente relacionado con el overfitting, pero no es un sinónimo perfecto: el primero describe el proceso de investigación y selección; el segundo, la escasa generalización de la especificación resultante. Incluso una regla con un único parámetro puede estar sobreajustada si es la ganadora entre miles de intentos no declarados.
De dónde surge
| Fuente de adaptación | Ejemplo | Información que debe registrarse |
|---|---|---|
| Parámetros | Muchos lookbacks, umbrales o stops | Rejilla completa y criterio de elección |
| Reglas | Filtros añadidos después de observar pérdidas | Secuencia de modificaciones |
| Universo | Mercados o valores elegidos porque funcionaron | Universo inicial y exclusiones |
| Periodo | Fecha inicial desplazada hasta mejorar la curva | Todas las ventanas examinadas |
| Métricas | Se muestra Sharpe porque el drawdown es desfavorable | Métricas previstas antes de la prueba |
| Datos y pipeline | Provider, limpieza o fills elegidos a posteriori | Versiones y variantes del simulador |
| Narrativa | La explicación económica nace después del resultado | Hipótesis original y momento de la justificación |
El riesgo no depende solo de la relación entre el número de parámetros y las filas del dataset. Importa la libertad efectiva del proceso de investigación: cuántas decisiones podían cambiar después de cada resultado y cuánta dependencia existe entre las observaciones. Por ello, el número bruto de trades no mide por sí solo cuánta información independiente sustenta el modelo.
Síntomas, no diagnósticos automáticos
Un pico muy estrecho en la superficie de parámetros, reglas difíciles de justificar, rendimiento concentrado en pocas operaciones y una gran diferencia entre desarrollo y prueba son señales de fragilidad. Ninguna constituye una prueba aislada. Un edge real puede estar localizado; el régimen futuro puede cambiar; un OOS breve puede ser ruidoso. A la inversa, una superficie regular puede deberse a sesgos comunes a todas las variantes.
La simplicidad es útil como restricción, no como certificado. «Pocas reglas» no anula la selección a posteriori, mientras que una técnica compleja puede generalizar si el protocolo, la regularización y la validación son adecuados.
Pruebas múltiples y ganador aparente
Si se miden muchas estrategias sin ventaja real, algunas presentarán de todos modos resultados excepcionales por azar. Un p-value o un Sharpe calculado como si la estrategia fuese la única hipótesis probada infravalora este problema. Los métodos de White, Hansen y Romano–Wolf abordan comparaciones múltiples entre modelos o reglas; la Probability of Backtest Overfitting estudia la probabilidad de que la configuración elegida in-sample pierda rango fuera de muestra; el Deflated Sharpe Ratio ajusta la interpretación del Sharpe por selección y por características no gaussianas de los rendimientos.
Estas herramientas tienen supuestos y no convierten una investigación retrospectiva en una prueba causal. Para que aporten información se necesita, como mínimo, un inventario creíble de las alternativas exploradas.
Protocolo de contención
- Formular la hipótesis antes de los resultados. Declarar mecanismo económico, universo, variables, benchmark, métrica principal y regla de parada.
- Mantener un registro de intentos. Incluir configuraciones fallidas, semillas, periodos, activos, filtros, transformaciones y métricas consultadas.
- Separar selección y evaluación. Usar training y validación para las elecciones; conservar una prueba temporal final no consultada.
- Respetar la estructura de los datos. Tratar dependencia, labels solapadas e información point-in-time con un diseño adecuado al problema.
- Limitar la libertad justificable. Regularizar, reducir features y parámetros o utilizar jerarquías motivadas, sin buscar un número mágico.
- Corregir la inferencia. Considerar pruebas múltiples, no normalidad, autocorrelación e incertidumbre de las métricas.
- Perturbar la especificación. Variar supuestos plausibles sobre parámetros, muestra, costes y ejecución sin elegir a posteriori solo los stress tests superados.
- Conservar una decisión legible. Explicar por qué la estrategia se descarta, se estudia de nuevo o se propone para forward test.
Ejemplo ilustrativo
Ejemplo declarado como ilustrativo — Un investigador prueba diez lookbacks, cinco umbrales y cuatro universos: ya son doscientas configuraciones antes de contar costes, periodos y filtros posteriores. La configuración con mayor Sharpe histórico no puede evaluarse como una hipótesis única formulada de antemano. El protocolo conserva todos los intentos, selecciona durante la validación, aplica una medida coherente con la comparación múltiple y consulta la prueba final una sola vez. Los números describen el mecanismo de selección, no un umbral de aceptación.
Si la prueba final se utiliza para cambiar el lookback o el universo, ese segmento deja de ser puro para la nueva versión. El fallo no demuestra necesariamente que la idea carezca de valor; señala que la especificación evaluada no aportó la evidencia prevista por el protocolo.
Robustez y OOS no son pruebas definitivas
Stress tests, mesetas de parámetros, subperiodos y walk-forward ayudan a describir sensibilidad y estabilidad. No demuestran por sí solos que el edge sea real: pueden compartir el mismo look-ahead, el mismo universo contaminado o el mismo error de ejecución. También el OOS pasa a formar parte del desarrollo cuando se consulta repetidamente.
Por tanto, el control más sólido es procedimental, además de estadístico: hacer visibles todas las elecciones, impedir que la información futura entre en el modelo y preservar una separación real entre exploración y evaluación.
Limitaciones
- No existe un único índice que mida todas las formas de overfitting.
- Las correcciones por comparaciones múltiples dependen del conjunto de intentos y de su dependencia, a menudo solo parcialmente observables.
- Un buen OOS puede ser suerte; uno débil puede reflejar varianza o cambio de régimen.
- Los nuevos datos temporales reducen la reutilización del pasado, pero no eliminan problemas de datos, costes, causalidad o gobernanza.
- La replicación independiente sigue siendo distinta de la mera repetición del mismo backtest.
Fuentes
- Halbert White, A Reality Check for Data Snooping, Econometrica, 2000 — evaluación del mejor modelo tras investigar numerosas alternativas.
- Ryan Sullivan, Allan Timmermann y Halbert White, Data-Snooping, Technical Trading Rule Performance, and the Bootstrap, The Journal of Finance, 1999 — aplicación directa a reglas técnicas de trading.
- David H. Bailey et al., The Probability of Backtest Overfitting — selección in-sample y pérdida de rango fuera de muestra.
- Campbell R. Harvey, Yan Liu y Heqing Zhu, …and the Cross-Section of Expected Returns, The Review of Financial Studies, 2016 — pruebas múltiples en la investigación sobre rendimientos esperados.
- David H. Bailey y Marcos López de Prado, The Deflated Sharpe Ratio — corrección por sesgo de selección y no normalidad al interpretar el Sharpe.