Saltar al contenido
Recorrido formativo Plata Método repetible

Robustez

Estabilidad de una estrategia ante supuestos plausibles sobre datos, parámetros, ejecución y regímenes: una batería diagnóstica, no una prueba de validez.

A quién va dirigido — A quien haya obtenido un resultado histórico favorable y quiera saber cuánto depende de una combinación concreta de datos, parámetros, costes, periodo y ejecución.

La robustez describe en qué medida las conclusiones sobre una estrategia se mantienen cuando cambian, dentro de intervalos plausibles, los supuestos que no deberían determinar por completo su valor. Es una propiedad gradual y condicionada: una estrategia puede ser robusta frente a los parámetros y frágil frente a los costes, o estable en varios periodos pero dependiente de un solo provider de datos.

La robustez no significa inmunidad al cambio y no demuestra la existencia de un edge futuro. Una batería de pruebas se utiliza sobre todo para la falsación: busca revelar qué variaciones plausibles rompen la conclusión. Superarla no garantiza rendimiento futuro. Además, todas las pruebas pueden compartir el mismo look-ahead, survivorship bias o error de fill. Su finalidad es hacer visibles las dependencias del resultado y encontrar puntos de rotura, no conceder un certificado automático de validez.

Batería de robustezLa estrategia se perturba sobre ejes con motivación económica. Los tests se definen antes del resultado; superarlos no certifica estabilidad futura.Batería de robustezLa estrategia se perturba sobre ejes con motivación económicaLos tests se definen antes del resultado; superarlos no certifica estabilidad futura.ParámetroscercanosBuscar regionescoherentes, no unúnico máximo puntual.ReglasalternativasPequeñasimplementacionesplausibles nodeberían invertirtoda conclusión.SubperiodosLa performance sesepara sin elegirsolo ventanasfavorables.RegímenesTendencia,volatilidad yliquidez muestranheterogeneidad.Activos ysedesTransferibilidad yespecificidad delmercado sedistinguen.Costes ycapacidadFricciones másseveras peroplausibles estresanel neto.Retrasos ymissingDelay, señalesomitidas y fillsparciales prueban laimplementación.Datos y modeloFuentes, revisiones ysupuestosalternativos exponenriesgo de modelo.Cyclepedia · diagrama didáctico condicionado, no previsión ni promesa
Cada stress examina una vulnerabilidad diferente; ninguna prueba aislada cubre toda la cadena del backtest.

Robustez, sensibilidad y validación

Concepto Pregunta Qué no demuestra
Análisis de sensibilidad ¿Cómo cambia el output al variar un input? Que los escenarios elegidos sean completos
Stress test ¿Dónde se rompe el sistema bajo condiciones severas pero coherentes? La probabilidad del escenario
Robustez ¿La conclusión sobrevive a un conjunto justificado de variaciones? Rendimiento futuro o causalidad
Out-of-sample ¿La especificación generaliza sobre datos no usados para elegirla? Inmunidad al cambio de régimen y a sesgos comunes
Replicación ¿Un análisis independiente obtiene evidencia compatible? Identidad de resultados en todas las muestras

Una meseta de parámetros puede ser preferible a un pico aislado porque muestra menor sensibilidad local, pero no es una prueba. La meseta podría estar generada por datos contaminados o por una familia de variantes casi idénticas. La lógica económica y la corrección de la simulación siguen siendo requisitos previos.

Dimensiones que deben ponerse a prueba

Datos. Comparar, cuando sea posible, fuentes, reglas de limpieza, timestamps, corporate actions, universo point-in-time y tratamiento de valores ausentes. Cambiar de provider puede revelar dependencia de convenciones no documentadas.

Especificación. Variar parámetros y transformaciones dentro de regiones justificadas por el proceso estudiado. La amplitud no debería ser un porcentaje fijo idéntico para cualquier variable: un día, un tick y un decil tienen significados diferentes.

Muestra. Examinar subperiodos, mercados y condiciones sin elegir a posteriori solo las segmentaciones favorables. Eliminar un periodo influyente puede mostrar concentración, pero también reduce la muestra y aumenta la incertidumbre.

Ejecución. Cambiar el retardo de la señal, benchmark de fill, spread, slippage, impacto, participación en volumen, fills parciales y coste de oportunidad según escenarios plausibles para el instrumento y el tamaño. Duplicar siempre las comisiones no es un criterio universal ni cubre la liquidez.

Construcción de cartera. Comprobar apalancamiento, caps, rebalanceo, concentración, borrow, financiación, rendimiento del efectivo e interacción entre posiciones. Deben distinguirse el edge de la señal y el generado por el sizing.

Selección estadística. Registrar todas las variantes y considerar las pruebas múltiples. Ejecutar cientos de stress tests y mostrar solo los superados es una nueva forma de data snooping.

Protocolo de una batería de robustez

  1. Declarar la conclusión que se somete a stress. Por ejemplo, signo de la expectancy neta, ventaja sobre el benchmark o tolerabilidad del drawdown.
  2. Enumerar los supuestos materiales. Datos, reloj de eventos, features, parámetros, universo, sizing, costes, liquidez y métricas.
  3. Vincular cada prueba a un riesgo. Justificar intervalo y dirección del stress mediante propiedades del mercado o incertidumbre de medida.
  4. Congelar criterios y outputs. Establecer antes qué métricas observar y cómo clasificar resultados favorables, ambiguos o incompatibles.
  5. Ejecutar pruebas individuales y conjuntas. Las perturbaciones aisladas facilitan el diagnóstico; las combinaciones coherentes muestran interacciones y posibles cliffs.
  6. Registrar toda la batería. Conservar configuraciones, resultados negativos, semillas y cambios. Cada prueba cuenta en el proceso de selección.
  7. Separar robustez y prueba final. Los stress tests utilizados para elegir la especificación pertenecen al desarrollo; el OOS final permanece sin consultar.
  8. Traducir el resultado en límites. Documentar las condiciones en las que el modelo no es fiable, los controles live y las causas de suspensión.

Cómo representar los resultados

Una tabla o mapa de sensibilidad debería mostrar todas las regiones examinadas, no solo el mejor parámetro. Además de la media se necesitan dispersión, drawdown, rotación, exposición, costes y concentración por eventos. Resulta útil distinguir:

  • estabilidad del signo, cuando la conclusión cualitativa se mantiene;
  • estabilidad del orden, cuando el modelo conserva su ventaja sobre el benchmark o las alternativas;
  • estabilidad económica, cuando el margen sigue siendo material después de costes y restricciones;
  • estabilidad operativa, cuando fills, datos y controles pueden reproducirse en el proceso real.

No es necesario que cada número permanezca invariable. Una estrategia puede ser robusta aunque muestre la degradación esperada en escenarios más costosos; lo importante es que la conclusión y los límites sean comprensibles y no dependan de un único supuesto oculto.

Ejemplo ilustrativo

Ejemplo declarado como ilustrativo — Una señal de breakout se evalúa con varios retardos ejecutables, fuentes de datos comparables, ventanas de lookback adyacentes y modelos de costes ligados al spread y a la participación en volumen. La rentabilidad desaparece cuando el fill se desplaza al primer evento realmente negociable: esto identifica un problema de causalidad, no una simple «falta de robustez». En otro escenario, el resultado sigue siendo positivo pero muy incierto; la clasificación correcta puede ser «no concluyente», no «superado».

Los valores de los stress deben proceder del mercado y de la incertidumbre del modelo; no existen desplazamientos porcentuales, multiplicadores de costes ni umbrales de profit factor válidos para todas las estrategias.

Monte Carlo y perturbaciones del recorrido

Bootstrap, reordenación y simulaciones Monte Carlo pueden describir cómo cambia una métrica bajo un modelo concreto de dependencia y distribución. Reordenar trades de forma independiente elimina por construcción parte de la secuencia temporal; si se utilizan bloques, la elección de su longitud se convierte en un supuesto. Estas técnicas no crean eventos nunca observados y no corrigen automáticamente leakage, un universo contaminado, impacto infravalorado ni la selección entre numerosas estrategias.

Limitaciones

  • La batería es necesariamente incompleta frente a los estados futuros del mundo.
  • Los stress elegidos después de ver el resultado pueden convertirse en optimización.
  • La estabilidad histórica y la significación estadística son preguntas diferentes.
  • Los escenarios extremos no tienen automáticamente una probabilidad interpretable.
  • La robustez apoya la gestión del riesgo de modelo; no sustituye validación independiente, controles operativos ni monitorización posterior.

Fuentes

Páginas relacionadas