Saltar al contenido
Recorrido formativo Plata Método repetible

Data snooping y pruebas múltiples

Error de selección que aparece cuando se prueban muchas estrategias, features o umbrales sobre los mismos datos y solo se presenta el mejor resultado.

A quién va dirigido — A quien compara muchas estrategias, mercados, features o parámetros y corre el riesgo de atribuir habilidad a un ganador producido por el azar.

El data snooping se produce cuando el mismo conjunto de datos se utiliza repetidamente para explorar, seleccionar y evaluar reglas, mientras que la inferencia final ignora el proceso de investigación. El problema de las pruebas múltiples es la consecuencia estadística: al aumentar el número de hipótesis probadas, crece la probabilidad de que al menos una parezca convincente por suerte.

No es necesario alterar los resultados de forma consciente. Probar diez ventanas, cinco filtros, varios universos, costes y fechas iniciales crea una familia de candidatos. Publicar solo la combinación con el mayor Sharpe la trata como si hubiera sido elegida antes de observar los datos. La incertidumbre así calculada es demasiado pequeña.

Overfitting y selección entre muchos intentosEl ganador in-sample también incorpora la suerte de la investigación. Números y superficies ilustrativos; toda especificación probada pertenece a la selección.Overfitting y selección entre muchos intentosEl ganador in-sample también incorpora la suerte de la investigaciónNúmeros y superficies ilustrativos; toda especificación probada pertenece a la selección.Espacio de pruebas16 configuraciones probadas · un pico aislado0.20.40.1-0.10.30.81.90.20.10.60.70.1-0.20.10.30.02Ganador seleccionadoEl máximo histórico no estima sin sesgo el rendimientofuturo.3Test independienteUna evaluación no usada en selección mide la degradaciónOOS.4Inferencia con multiplicidadLa conclusión considera intentos, dependencia y regla deselección.Cyclepedia · diagrama didáctico condicionado, no previsión ni promesa
El resultado seleccionado hereda toda la historia de la investigación: las variantes descartadas y las decisiones informadas por los datos no desaparecen.

Overfitting y data snooping no son idénticos

Problema Unidad principal Ejemplo
Overfitting del modelo Una configuración demasiado adaptada a la muestra Muchas reglas capturan ruido local
Data snooping Proceso de investigación repetido sobre los mismos datos Mercado, ventana y métrica se eligen a posteriori
Pruebas múltiples Familia de hipótesis comparadas Al menos un resultado supera el umbral por azar
Sesgo de publicación Resultados que llegan a hacerse visibles Se publican sobre todo los éxitos
Grados de libertad del investigador Decisiones analíticas flexibles Exclusiones, transformaciones y benchmark cambian tras el resultado

Un modelo sencillo puede seleccionarse mediante data snooping; un modelo complejo puede hacer overfitting incluso en un único recorrido de estimación. A menudo ambos problemas se acumulan.


Por qué importa el número de intentos

Supongamos, como ejemplo puramente didáctico, que cada prueba tiene una probabilidad α de superar un umbral bajo la hipótesis nula y que las pruebas son independientes. La probabilidad de que al menos una entre m pruebas lo supere es:

1 − (1 − α)ᵐ

En una investigación real, los candidatos suelen estar correlacionados, por lo que esta fórmula no describe exactamente el problema. Sí muestra por qué es incorrecto evaluar al ganador como única prueba. La correlación entre estrategias no vuelve irrelevante la selección: cambia la distribución del máximo y exige métodos coherentes.

Los «intentos» incluyen también decisiones informales: mirar el gráfico y cambiar la fecha inicial, eliminar un mercado, transformar una feature o elegir la métrica después de conocer el resultado. Si esas decisiones no se registran, ninguna corrección puede reconstruir perfectamente su número.


Registro de experimentos

Un registro útil conserva para cada intento:

  • identificador y timestamp;
  • hipótesis y justificación;
  • versión de código, datos y configuración;
  • universo, periodo, benchmark y costes;
  • features, parámetros y restricciones;
  • métricas previstas antes de la prueba;
  • resultado completo, aunque sea negativo;
  • decisión tomada y su motivo;
  • relación con intentos anteriores.

El registro no elimina el data snooping. Sin embargo, hace medible el espacio de investigación e impide que los fracasos desaparezcan. Algunos métodos pueden exigir agrupar variantes casi idénticas, pero la regla de agrupación debe declararse y no puede elegirse para mejorar el resultado corregido.


Herramientas estadísticas: problema y finalidad

Herramienta Pregunta que aborda Qué no demuestra
Reality Check de White ¿El mejor entre muchos modelos supera un benchmark teniendo en cuenta la búsqueda? Que el modelo seguirá siendo estable o invertible
SPA de Hansen ¿Existe capacidad predictiva superior, con mayor potencia en ciertos contextos? Ausencia de leakage o costes realistas
Correcciones FWER / stepwise ¿Cómo controlar la probabilidad de al menos un falso rechazo? Equivalencia económica de los candidatos
False discovery rate ¿Qué proporción esperada de descubrimientos falsos se tolera en una familia? Validez causal del mecanismo
Deflated Sharpe Ratio ¿El Sharpe observado sigue siendo excepcional considerando selección y no normalidad? Un track record real o una garantía futura
Probability of Backtest Overfitting ¿Con qué frecuencia puede degradarse fuera de muestra la selección in-sample en el diseño elegido? Corrección de los datos o universalidad de la estimación

Cada herramienta requiere inputs y supuestos. Aplicar una fórmula después de ocultar la mitad de los intentos produce precisión aparente, no inferencia honesta.


Un out-of-sample puede consumirse

La primera prueba sobre un segmento puede estar fuera de la muestra de desarrollo. Si el resultado induce a cambiar la estrategia y a ejecutar de nuevo el mismo segmento, ese periodo ha entrado en el ciclo de selección. El problema no desaparece al cambiar la etiqueta por «validation» después de varias iteraciones: hay que declarar la historia y conservar nueva información para una evaluación posterior.

Una comparación pública también puede transferir información. Elegir una estrategia porque muchas publicaciones muestran que funcionó sobre los mismos datos históricos reduce la independencia de un nuevo backtest en ese periodo. Esto no vuelve inútil la investigación, pero limita la fuerza de la confirmación.


Ejemplo ilustrativo

Un investigador prueba 200 variantes de una señal y selecciona la que tiene mayor Sharpe. Después comunica un intervalo y un p-value como si esa variante hubiera sido la única. El error no consiste en haber explorado: la exploración puede generar ideas. El error es utilizar la inferencia de una prueba preespecificada para un ganador seleccionado a partir de los datos.

Un proceso más transparente registra las 200 variantes, separa exploración y confirmación, compara una baseline, aplica un método adecuado a la familia de pruebas y conserva datos no utilizados o una evaluación prospectiva. El número 200 es ilustrativo; la materialidad depende de la dependencia entre candidatos y del diseño.


Protocolo para reducir el riesgo

  1. Preespecificar hipótesis, métricas principales, benchmark y criterio de decisión.
  2. Conservar cada intento y cada modificación informada por los datos.
  3. Separar los entornos de exploración, selección y confirmación.
  4. Utilizar baselines sencillas para medir el valor incremental.
  5. Corregir la inferencia por la familia de comparaciones cuando proceda.
  6. Comprobar sensibilidad sin elegir a posteriori solo los stress tests superados.
  7. Presentar la distribución de los candidatos, no únicamente el máximo.
  8. Limitar la conclusión a la muestra, los supuestos y el uso realmente examinados.

La simplicidad y las mesetas de parámetros son señales diagnósticas útiles, no pruebas de ausencia de snooping. Una región completa puede parecer estable porque todos sus parámetros explotan el mismo sesgo de los datos.


Fuentes

Páginas relacionadas