A quién va dirigido — A quien compara muchas estrategias, mercados, features o parámetros y corre el riesgo de atribuir habilidad a un ganador producido por el azar.
El data snooping se produce cuando el mismo conjunto de datos se utiliza repetidamente para explorar, seleccionar y evaluar reglas, mientras que la inferencia final ignora el proceso de investigación. El problema de las pruebas múltiples es la consecuencia estadística: al aumentar el número de hipótesis probadas, crece la probabilidad de que al menos una parezca convincente por suerte.
No es necesario alterar los resultados de forma consciente. Probar diez ventanas, cinco filtros, varios universos, costes y fechas iniciales crea una familia de candidatos. Publicar solo la combinación con el mayor Sharpe la trata como si hubiera sido elegida antes de observar los datos. La incertidumbre así calculada es demasiado pequeña.
Overfitting y data snooping no son idénticos
| Problema | Unidad principal | Ejemplo |
|---|---|---|
| Overfitting del modelo | Una configuración demasiado adaptada a la muestra | Muchas reglas capturan ruido local |
| Data snooping | Proceso de investigación repetido sobre los mismos datos | Mercado, ventana y métrica se eligen a posteriori |
| Pruebas múltiples | Familia de hipótesis comparadas | Al menos un resultado supera el umbral por azar |
| Sesgo de publicación | Resultados que llegan a hacerse visibles | Se publican sobre todo los éxitos |
| Grados de libertad del investigador | Decisiones analíticas flexibles | Exclusiones, transformaciones y benchmark cambian tras el resultado |
Un modelo sencillo puede seleccionarse mediante data snooping; un modelo complejo puede hacer overfitting incluso en un único recorrido de estimación. A menudo ambos problemas se acumulan.
Por qué importa el número de intentos
Supongamos, como ejemplo puramente didáctico, que cada prueba tiene una
probabilidad α de superar un umbral bajo la hipótesis nula y que las
pruebas son independientes. La probabilidad de que al menos una entre
m pruebas lo supere es:
1 − (1 − α)ᵐEn una investigación real, los candidatos suelen estar correlacionados, por lo que esta fórmula no describe exactamente el problema. Sí muestra por qué es incorrecto evaluar al ganador como única prueba. La correlación entre estrategias no vuelve irrelevante la selección: cambia la distribución del máximo y exige métodos coherentes.
Los «intentos» incluyen también decisiones informales: mirar el gráfico y cambiar la fecha inicial, eliminar un mercado, transformar una feature o elegir la métrica después de conocer el resultado. Si esas decisiones no se registran, ninguna corrección puede reconstruir perfectamente su número.
Registro de experimentos
Un registro útil conserva para cada intento:
- identificador y timestamp;
- hipótesis y justificación;
- versión de código, datos y configuración;
- universo, periodo, benchmark y costes;
- features, parámetros y restricciones;
- métricas previstas antes de la prueba;
- resultado completo, aunque sea negativo;
- decisión tomada y su motivo;
- relación con intentos anteriores.
El registro no elimina el data snooping. Sin embargo, hace medible el espacio de investigación e impide que los fracasos desaparezcan. Algunos métodos pueden exigir agrupar variantes casi idénticas, pero la regla de agrupación debe declararse y no puede elegirse para mejorar el resultado corregido.
Herramientas estadísticas: problema y finalidad
| Herramienta | Pregunta que aborda | Qué no demuestra |
|---|---|---|
| Reality Check de White | ¿El mejor entre muchos modelos supera un benchmark teniendo en cuenta la búsqueda? | Que el modelo seguirá siendo estable o invertible |
| SPA de Hansen | ¿Existe capacidad predictiva superior, con mayor potencia en ciertos contextos? | Ausencia de leakage o costes realistas |
| Correcciones FWER / stepwise | ¿Cómo controlar la probabilidad de al menos un falso rechazo? | Equivalencia económica de los candidatos |
| False discovery rate | ¿Qué proporción esperada de descubrimientos falsos se tolera en una familia? | Validez causal del mecanismo |
| Deflated Sharpe Ratio | ¿El Sharpe observado sigue siendo excepcional considerando selección y no normalidad? | Un track record real o una garantía futura |
| Probability of Backtest Overfitting | ¿Con qué frecuencia puede degradarse fuera de muestra la selección in-sample en el diseño elegido? | Corrección de los datos o universalidad de la estimación |
Cada herramienta requiere inputs y supuestos. Aplicar una fórmula después de ocultar la mitad de los intentos produce precisión aparente, no inferencia honesta.
Un out-of-sample puede consumirse
La primera prueba sobre un segmento puede estar fuera de la muestra de desarrollo. Si el resultado induce a cambiar la estrategia y a ejecutar de nuevo el mismo segmento, ese periodo ha entrado en el ciclo de selección. El problema no desaparece al cambiar la etiqueta por «validation» después de varias iteraciones: hay que declarar la historia y conservar nueva información para una evaluación posterior.
Una comparación pública también puede transferir información. Elegir una estrategia porque muchas publicaciones muestran que funcionó sobre los mismos datos históricos reduce la independencia de un nuevo backtest en ese periodo. Esto no vuelve inútil la investigación, pero limita la fuerza de la confirmación.
Ejemplo ilustrativo
Un investigador prueba 200 variantes de una señal y selecciona la que tiene mayor Sharpe. Después comunica un intervalo y un p-value como si esa variante hubiera sido la única. El error no consiste en haber explorado: la exploración puede generar ideas. El error es utilizar la inferencia de una prueba preespecificada para un ganador seleccionado a partir de los datos.
Un proceso más transparente registra las 200 variantes, separa exploración y confirmación, compara una baseline, aplica un método adecuado a la familia de pruebas y conserva datos no utilizados o una evaluación prospectiva. El número 200 es ilustrativo; la materialidad depende de la dependencia entre candidatos y del diseño.
Protocolo para reducir el riesgo
- Preespecificar hipótesis, métricas principales, benchmark y criterio de decisión.
- Conservar cada intento y cada modificación informada por los datos.
- Separar los entornos de exploración, selección y confirmación.
- Utilizar baselines sencillas para medir el valor incremental.
- Corregir la inferencia por la familia de comparaciones cuando proceda.
- Comprobar sensibilidad sin elegir a posteriori solo los stress tests superados.
- Presentar la distribución de los candidatos, no únicamente el máximo.
- Limitar la conclusión a la muestra, los supuestos y el uso realmente examinados.
La simplicidad y las mesetas de parámetros son señales diagnósticas útiles, no pruebas de ausencia de snooping. Una región completa puede parecer estable porque todos sus parámetros explotan el mismo sesgo de los datos.
Fuentes
- Halbert White, A Reality Check for Data Snooping — prueba del mejor modelo cuando la especificación se elige investigando los datos.
- Ryan Sullivan, Allan Timmermann y Halbert White, Data-Snooping, Technical Trading Rule Performance, and the Bootstrap — aplicación del problema a un amplio universo de reglas técnicas.
- Campbell R. Harvey, Yan Liu y Heqing Zhu, …and the Cross-Section of Expected Returns — implicaciones de las pruebas múltiples en la investigación sobre rendimientos esperados.
- Joseph P. Romano y Michael Wolf, Stepwise Multiple Testing as Formalized Data Snooping — procedimientos stepwise para inferencia múltiple dependiente.
- David H. Bailey y Marcos López de Prado, The Deflated Sharpe Ratio — ajuste del Sharpe por selección y características no normales de los rendimientos.