Recorrido formativo Plata Método repetible

Overfitting

Ajuste al ruido histórico y selección entre numerosos intentos: cómo reconocer, medir y contener el overfitting en sistemas de trading.

A quién va dirigido — A quien compara estrategias, parámetros o features sobre el mismo historial y quiere entender cuánto del rendimiento elegido puede ser adaptación al ruido, en lugar de capacidad para generalizar.

El overfitting o sobreajuste se produce cuando una especificación aprende particularidades de la muestra que no se repiten fuera de ella. En trading puede surgir por la complejidad del modelo, pero también por un proceso que parece sencillo: probar muchas reglas, mercados, periodos o métricas y publicar solo la mejor combinación.

El data snooping es el uso repetido de los mismos datos para seleccionar una estrategia o una conclusión. Está estrechamente relacionado con el overfitting, pero no es un sinónimo perfecto: el primero describe el proceso de investigación y selección; el segundo, la escasa generalización de la especificación resultante. Incluso una regla con un único parámetro puede estar sobreajustada si es la ganadora entre miles de intentos no declarados.

Overfitting y selección entre muchos intentosEl ganador in-sample también incorpora la suerte de la investigación. Números y superficies ilustrativos; toda especificación probada pertenece a la selección.Overfitting y selección entre muchos intentosEl ganador in-sample también incorpora la suerte de la investigaciónNúmeros y superficies ilustrativos; toda especificación probada pertenece a la selección.Espacio de pruebas16 configuraciones probadas · un pico aislado0.20.40.1-0.10.30.81.90.20.10.60.70.1-0.20.10.30.02Ganador seleccionadoEl máximo histórico no estima sin sesgo el rendimientofuturo.3Test independienteUna evaluación no usada en selección mide la degradaciónOOS.4Inferencia con multiplicidadLa conclusión considera intentos, dependencia y regla deselección.Cyclepedia · diagrama didáctico condicionado, no previsión ni promesa
Cuantas más alternativas se exploran, más fácil resulta encontrar por azar una curva atractiva; el denominador correcto incluye también los intentos descartados.

De dónde surge

Fuente de adaptación Ejemplo Información que debe registrarse
Parámetros Muchos lookbacks, umbrales o stops Rejilla completa y criterio de elección
Reglas Filtros añadidos después de observar pérdidas Secuencia de modificaciones
Universo Mercados o valores elegidos porque funcionaron Universo inicial y exclusiones
Periodo Fecha inicial desplazada hasta mejorar la curva Todas las ventanas examinadas
Métricas Se muestra Sharpe porque el drawdown es desfavorable Métricas previstas antes de la prueba
Datos y pipeline Provider, limpieza o fills elegidos a posteriori Versiones y variantes del simulador
Narrativa La explicación económica nace después del resultado Hipótesis original y momento de la justificación

El riesgo no depende solo de la relación entre el número de parámetros y las filas del dataset. Importa la libertad efectiva del proceso de investigación: cuántas decisiones podían cambiar después de cada resultado y cuánta dependencia existe entre las observaciones. Por ello, el número bruto de trades no mide por sí solo cuánta información independiente sustenta el modelo.

Síntomas, no diagnósticos automáticos

Un pico muy estrecho en la superficie de parámetros, reglas difíciles de justificar, rendimiento concentrado en pocas operaciones y una gran diferencia entre desarrollo y prueba son señales de fragilidad. Ninguna constituye una prueba aislada. Un edge real puede estar localizado; el régimen futuro puede cambiar; un OOS breve puede ser ruidoso. A la inversa, una superficie regular puede deberse a sesgos comunes a todas las variantes.

La simplicidad es útil como restricción, no como certificado. «Pocas reglas» no anula la selección a posteriori, mientras que una técnica compleja puede generalizar si el protocolo, la regularización y la validación son adecuados.

Pruebas múltiples y ganador aparente

Si se miden muchas estrategias sin ventaja real, algunas presentarán de todos modos resultados excepcionales por azar. Un p-value o un Sharpe calculado como si la estrategia fuese la única hipótesis probada infravalora este problema. Los métodos de White, Hansen y Romano–Wolf abordan comparaciones múltiples entre modelos o reglas; la Probability of Backtest Overfitting estudia la probabilidad de que la configuración elegida in-sample pierda rango fuera de muestra; el Deflated Sharpe Ratio ajusta la interpretación del Sharpe por selección y por características no gaussianas de los rendimientos.

Estas herramientas tienen supuestos y no convierten una investigación retrospectiva en una prueba causal. Para que aporten información se necesita, como mínimo, un inventario creíble de las alternativas exploradas.

Protocolo de contención

  1. Formular la hipótesis antes de los resultados. Declarar mecanismo económico, universo, variables, benchmark, métrica principal y regla de parada.
  2. Mantener un registro de intentos. Incluir configuraciones fallidas, semillas, periodos, activos, filtros, transformaciones y métricas consultadas.
  3. Separar selección y evaluación. Usar training y validación para las elecciones; conservar una prueba temporal final no consultada.
  4. Respetar la estructura de los datos. Tratar dependencia, labels solapadas e información point-in-time con un diseño adecuado al problema.
  5. Limitar la libertad justificable. Regularizar, reducir features y parámetros o utilizar jerarquías motivadas, sin buscar un número mágico.
  6. Corregir la inferencia. Considerar pruebas múltiples, no normalidad, autocorrelación e incertidumbre de las métricas.
  7. Perturbar la especificación. Variar supuestos plausibles sobre parámetros, muestra, costes y ejecución sin elegir a posteriori solo los stress tests superados.
  8. Conservar una decisión legible. Explicar por qué la estrategia se descarta, se estudia de nuevo o se propone para forward test.

Ejemplo ilustrativo

Ejemplo declarado como ilustrativo — Un investigador prueba diez lookbacks, cinco umbrales y cuatro universos: ya son doscientas configuraciones antes de contar costes, periodos y filtros posteriores. La configuración con mayor Sharpe histórico no puede evaluarse como una hipótesis única formulada de antemano. El protocolo conserva todos los intentos, selecciona durante la validación, aplica una medida coherente con la comparación múltiple y consulta la prueba final una sola vez. Los números describen el mecanismo de selección, no un umbral de aceptación.

Si la prueba final se utiliza para cambiar el lookback o el universo, ese segmento deja de ser puro para la nueva versión. El fallo no demuestra necesariamente que la idea carezca de valor; señala que la especificación evaluada no aportó la evidencia prevista por el protocolo.

Robustez y OOS no son pruebas definitivas

Stress tests, mesetas de parámetros, subperiodos y walk-forward ayudan a describir sensibilidad y estabilidad. No demuestran por sí solos que el edge sea real: pueden compartir el mismo look-ahead, el mismo universo contaminado o el mismo error de ejecución. También el OOS pasa a formar parte del desarrollo cuando se consulta repetidamente.

Por tanto, el control más sólido es procedimental, además de estadístico: hacer visibles todas las elecciones, impedir que la información futura entre en el modelo y preservar una separación real entre exploración y evaluación.

Limitaciones

  • No existe un único índice que mida todas las formas de overfitting.
  • Las correcciones por comparaciones múltiples dependen del conjunto de intentos y de su dependencia, a menudo solo parcialmente observables.
  • Un buen OOS puede ser suerte; uno débil puede reflejar varianza o cambio de régimen.
  • Los nuevos datos temporales reducen la reutilización del pasado, pero no eliminan problemas de datos, costes, causalidad o gobernanza.
  • La replicación independiente sigue siendo distinta de la mera repetición del mismo backtest.

Fuentes

Páginas relacionadas