Saltar al contenido
Recorrido formativo Plata Método repetible

Validación de series temporales y walk-forward

Diseños cronológicos rolling y expanding para separar desarrollo y evaluación respetando dependencia, horizonte informativo y secuencia real de decisiones.

A quién va dirigido — A quien deba evaluar una estrategia respetando el orden temporal, sin convertir el futuro en información de desarrollo ni depender de un único split arbitrario.

La validación temporal evalúa un procedimiento sobre observaciones posteriores a las utilizadas para estimarlo o elegirlo. El walk-forward analysis repite este principio en orígenes sucesivos: en cada paso utiliza solo el pasado permitido por el protocolo, produce una decisión para el segmento siguiente y después avanza en el tiempo.

El método imita mejor un procedimiento que se recalibra durante su vida operativa, pero no constituye una prueba definitiva. El resultado depende de la longitud y el tipo de las ventanas, la frecuencia de refit, el horizonte de las labels, las reglas de selección, los costes y el número de configuraciones consideradas. Si los resultados de los folds influyen en las elecciones, forman parte del desarrollo; concatenarlos no crea automáticamente una prueba final no contaminada.

Splits temporales y walk-forwardHoldout, rolling y expanding responden a preguntas distintas. Proporciones y ventanas ilustrativas; dependencia, label horizon y régimen guían el diseño.Splits temporales y walk-forwardHoldout, rolling y expanding responden a preguntas distintasProporciones y ventanas ilustrativas; dependencia, label horizon y régimen guían el diseño.Holdout fijoDesarrollo y evaluación final se separan; cadaconsulta consume el test.Rolling windowTrain y test avanzan con una memoria de longitudconstante.Expanding windowEl train acumula historia mientras cada test quedadespués en el tiempo.Test final intactoMantiene evaluación separada de la seleccióncuando la muestra lo permite.Cyclepedia · diagrama didáctico condicionado, no previsión ni promesa
Cada ventana responde a una pregunta diferente; tamaño, paso y buffer deben reflejar el proceso informativo, no un porcentaje universal.

Diseños principales

Diseño Cómo utiliza el pasado Cuándo aporta información Limitación característica
Holdout cronológico Desarrollo primero, prueba final después Decisión final sencilla con una prueba preservada Un solo periodo puede ser poco representativo
Rolling origin El origen de previsión avanza; el training puede crecer Evaluar varias decisiones sucesivas Resultados dependientes y posible adaptación iterativa
Expanding window El training conserva todo el historial disponible Proceso que aprende de manera acumulativa Los datos remotos pueden no representar el régimen actual
Rolling window El training mantiene una longitud finita Proceso que olvida el pasado remoto Elección de la ventana y menor cantidad de datos
Validación cruzada bloqueada Los bloques temporales conservan la estructura local Comparaciones bajo un diseño justificado Deben comprobarse las fronteras y la dependencia entre bloques
Prueba final prospectiva Versión congelada sobre eventos futuros Control de un proceso realmente hacia delante Tiempo, coste y muestra inicialmente limitada

No existe un split 70/30 universalmente correcto. Un sistema intradía con labels solapadas, una estrategia mensual y un modelo macro con pocas recesiones contienen cantidades de información y dependencias muy diferentes, aunque el dataset tenga el mismo número de filas.


Rolling o expanding

Con origen t, un diseño expanding utiliza todas las observaciones permitidas hasta t; un diseño rolling usa solo las últimas w. El primero maximiza el historial; el segundo permite al proceso olvidar datos remotos. La elección expresa una hipótesis sobre la estabilidad, no un mero detalle técnico.

Cada configuración debe declarar:

  • inicio y fin de training, validation y test en cada fold;
  • ventana rolling o expanding y su justificación;
  • paso entre orígenes y longitud del horizonte evaluado;
  • frecuencia de refit, recalibración y nueva selección de parámetros;
  • tratamiento de warm-up, valores ausentes, instrumentos nuevos e instrumentos desaparecidos;
  • agregación de resultados y dependencia entre folds;
  • fecha en la que se toma una decisión basada en los folds.

Si en cada paso se elige el mejor parámetro utilizando el segmento siguiente, ese segmento es validation, no test. Para obtener una estimación honesta del procedimiento, la selección interna debe reproducirse usando solo la información disponible en ese origen.


Labels solapadas, gap, purging y embargo

En los problemas financieros, una observación puede utilizar información sobre un intervalo, no sobre un único timestamp. Si una label mide el rendimiento de los cinco días siguientes, las labels adyacentes comparten días. Por ello, una fila formalmente anterior al test puede contener resultados incluidos en su intervalo informativo.

El purging elimina del training las observaciones cuyos intervalos de información intersectan el test. Un gap o embargo deja una separación temporal justificada para reducir contaminaciones asociadas al solapamiento o la dependencia. En finanzas, estas herramientas se asocian a la formulación divulgada por López de Prado; no son una solución automática. Su amplitud debe depender del horizonte, la construcción de las features, las labels y el proceso operativo, no de un porcentaje fijo.

Eliminar filas no corrige un preprocesamiento estimado sobre toda la muestra, un universo construido con supervivientes ni revisiones futuras. El control debe abarcar todo el pipeline.


El caso del k-fold aleatorio

Afirmar que el k-fold aleatorio es siempre inválido para las series temporales sería demasiado categórico. Bergmeir, Hyndman y Koo muestran condiciones en las que la validación cruzada estándar puede ser válida para modelos puramente autorregresivos, en especial cuando los errores no presentan correlación. La lección no es que mezclar observaciones sea seguro en general, sino que la validez depende de la estructura del problema.

En trading, el orden causal, las transformaciones estimadas, los universos cambiantes, las labels solapadas y los costes suelen hacer más prudente un diseño cronológico que reproduzca el uso previsto. Quien elija un diseño no cronológico debe demostrar las condiciones que lo hacen adecuado y comprobar los residuos, no limitarse a invocar el nombre del método.


Ejemplo ilustrativo

Un procedimiento se recalibra al principio de cada mes. Un fold expanding utiliza todos los datos disponibles hasta el final del mes anterior, selecciona una configuración mediante una validación interna también temporal y genera posiciones para el mes siguiente. Doce meses producen doce segmentos de evaluación.

Si el analista observa los doce resultados y modifica las features, todo el conjunto ha informado el desarrollo. Puede describir el experimento y repetir el proceso sobre un nuevo periodo, pero no debe seguir presentando esos meses como prueba final nunca vista. El ejemplo no establece que un mes sea el paso correcto: depende del horizonte y la frecuencia de la estrategia.


Agregar sin perder la incertidumbre

Sumar los rendimientos en una curva walk-forward muestra el recorrido de un procedimiento simulado, pero no convierte los folds en independientes. Conviene informar de:

  • resultados por fold y agregados, no solo la media;
  • fechas, regímenes, instrumentos y exposiciones que concentran el P&L;
  • métricas brutas y netas con el mismo benchmark;
  • distribución de los errores y estabilidad de la selección;
  • rotación, capacidad y frecuencia de recalibración;
  • todas las configuraciones consideradas en el proceso.

La varianza entre folds puede aportar información incluso cuando la media es positiva. Un resultado dominado por un solo origen o una sola crisis exige una conclusión más limitada.


Checklist

  1. Reconstruir el diagrama temporal completo antes de calcular métricas.
  2. Alinear ventanas y paso con el uso real y el horizonte informativo.
  3. Ejecutar preprocesamiento, selección de features y tuning dentro de cada training.
  4. Aplicar gap o purging solo cuando lo justifique la estructura de los intervalos.
  5. Contar cada reutilización de folds como información de desarrollo.
  6. Conservar, si es posible, una prueba final o una fase prospectiva separada.
  7. Informar de dependencia, dispersión y concentración de resultados.

Fuentes

Páginas relacionadas