A quién va dirigido — A quien quiera entender cómo se pasa de una intuición a una estrategia especificada, simulada y monitorizable; a quien deba evaluar críticamente un backtest; a quien ya gestione investigación cuantitativa, ejecución o riesgo.
El trading sistemático toma decisiones mediante reglas explícitas y repetibles. No coincide necesariamente con el trading automático: una regla puede ejecutarse manualmente. Tampoco coincide con el trading cuantitativo, que pone el énfasis en datos, mediciones y modelos, ni con el trading algorítmico, que incluye también algoritmos dedicados únicamente a la ejecución. Estas áreas se solapan, pero responden a preguntas diferentes.
El núcleo de la disciplina no es una curva ascendente ni un bot. Es una cadena de afirmaciones controlables: qué se plantea como hipótesis, qué podía conocerse en cada instante, qué orden habría sido posible enviar, cuánto habría costado, cómo se eligió el modelo y qué evidencia haría cambiar la decisión. Un backtest es una simulación histórica condicionada por estos supuestos; no es un track record real, una previsión ni una prueba definitiva de beneficio futuro.
Las cuatro fases del capítulo
| Fase | Pregunta decisiva | Páginas principales |
|---|---|---|
| 1. Especificar | ¿la estrategia está descrita antes de ver el resultado? | |
| 2. Simular | ¿los datos, el reloj y la ejecución estaban realmente disponibles? | |
| 3. Validar | ¿el resultado sobrevive a datos no utilizados, dependencia y selección? | |
| 4. Gobernar | ¿el proceso funciona hacia delante y sabe cuándo detenerse? |
Las fases no son una escalera que produzca una certeza cada vez mayor. Cada una elimina o hace visible una clase de error. Un forward test puede revelar un problema de proceso, pero un buen resultado breve no demuestra que la distribución futura sea igual al pasado. El live introduce además impacto, colas operativas, comportamiento humano y cambios de régimen que una simulación solo puede representar parcialmente.
Primera distinción: cuatro términos cercanos
| Término | Propiedad que lo define | Ejemplo | No implica |
|---|---|---|---|
| Sistemático | decisiones determinadas por reglas declaradas | rebalanceo mensual con criterios prefijados | código ni alta frecuencia |
| Cuantitativo | hipótesis expresadas y evaluadas con datos y modelos | señal transversal estimada sobre un universo | ejecución automática |
| Algorítmico | un procedimiento de software decide o ejecuta acciones | algoritmo que fracciona una orden a lo largo del tiempo | presencia de alfa |
| Automático | el sistema realiza acciones sin confirmación para cada evento | envío y gestión de órdenes mediante API | validez del modelo |
La distinción protege de dos equívocos. Primero: automatizar una estrategia no la hace correcta. Segundo: un algoritmo de ejecución puede mejorar la forma de negociar una orden sin generar la señal que decidió la posición. El informe de la SEC sobre trading algorítmico documenta precisamente la pluralidad de usos, beneficios y riesgos de los algoritmos en los mercados modernos.
Del mecanismo a la estrategia
Las familias clásicas —trend following, momentum transversal, reversión a la media, carry, valor relativo, market making y event-driven— son categorías de mecanismos, no recetas de rendimiento. Una estrategia concreta debe especificar universo, observables, timestamps, transformaciones, señales, construcción de posiciones, restricciones, riesgo, órdenes, costes, benchmark y reglas de monitorización.
Dos sistemas llamados «momentum» pueden tener exposiciones y riesgos opuestos. Uno puede comparar instrumentos entre sí y otro observar la serie histórica de cada instrumento; uno puede ser long-only y otro long-short; uno puede operar a diario y otro mensualmente. El nombre de la familia no sustituye la especificación ni demuestra que una prima histórica pueda capturarse después de costes.
El contrato de un backtest legible
Un resultado riguroso permite que un lector competente reconstruya al menos estos elementos:
- Protocolo de investigación — hipótesis, universo, periodo, frecuencia, benchmark, métricas, costes y criterio de decisión definidos antes de la evaluación.
- Registro de pruebas — variantes exitosas y fallidas, modificaciones, fecha y motivo de cada elección; el número de intentos forma parte de la evidencia.
- Datos point-in-time — disponibilidad efectiva, retardo de publicación, revisiones, composición histórica del universo, delistings y acciones corporativas.
- Reloj causal — no se confunden el timestamp de la información, el cálculo de la señal, el envío de la orden y la primera ejecución posible.
- Economía de la ejecución — comisiones, spread, slippage, impacto, capacidad, préstamo, financiación, roll, margen y ejecuciones parciales cuando correspondan.
- Separación de decisiones — desarrollo, selección y evaluación final no utilizan de manera oculta la misma muestra.
- Dependencia e incertidumbre — operaciones solapadas, autocorrelación, grupos de exposición y número efectivo de observaciones se hacen visibles.
- Reproducibilidad — código, configuración, versiones, semillas e instantánea o hash de los datos son identificables.
Ningún porcentaje universal establece la partición correcta entre in-sample y out-of-sample; ningún número fijo de operaciones hace fiable una métrica; ningún valor de Sharpe o profit factor demuestra por sí solo una ventaja. Las elecciones dependen del horizonte, la estructura de dependencia, la heterogeneidad de los regímenes, la rotación, el número de modelos probados y la materialidad económica.
Validación: qué puede decir
La validación puede mostrar que una implementación es coherente con la especificación, que el resultado no depende visiblemente de una única elección, que ciertas prestaciones aparecieron también en periodos no utilizados para construir el modelo y que los costes o escenarios declarados no eliminan inmediatamente el efecto. También puede cuantificar cuánta incertidumbre permanece.
No puede convertir una relación histórica en una ley inmutable. El data snooping favorece al mejor entre muchos intentos; el régimen puede cambiar; el mercado puede reaccionar a la capacidad utilizada; las fuentes y la microestructura pueden variar. Métodos como Reality Check, Deflated Sharpe Ratio, bootstrap, pruebas walk-forward o probability of backtest overfitting abordan problemas específicos bajo supuestos concretos: no son sellos universales de calidad.
Una vez que un resultado out-of-sample influye en variables, parámetros, universo o reglas, ese segmento ha entrado en el proceso de investigación. Seguir llamándolo «nunca visto» altera el significado de la evidencia. Es preferible conservar una prueba final realmente intacta o declarar con transparencia el carácter iterativo del análisis.
De la investigación al live
| Entorno | Qué observa bien | Qué no reproduce plenamente |
|---|---|---|
| Backtest | lógica, historia disponible y escenarios modelizados | regímenes futuros, impacto real, errores no modelizados |
| Paper trading | flujo, timing, órdenes simuladas y operativa cotidiana | prioridad real, capacidad, presión económica |
| Shadow mode | señales y órdenes teóricas sobre datos live sin envío | interacción efectiva con el mercado y el bróker |
| Micro-live | ejecuciones, costes y controles con capital limitado | comportamiento a la escala objetivo |
| Producción | proceso económico efectivo | contrafactual cierto sobre lo que habría sucedido en otro lugar |
La transición no debe ser automática. Primero se definen responsabilidades, límites, escalado, criterios de suspensión y procedimiento de rollback. En live se separan al menos cuatro diagnósticos: variación estadística compatible con el modelo, deterioro de la señal, problema de ejecución o datos y cambio de régimen. Una serie de pérdidas, por sí sola, no identifica qué causa está presente.
La guía SR 26-2 de la Reserva Federal está dirigida a las organizaciones bancarias bajo su supervisión. Se cita aquí por principios transferibles —fin y uso previsto, validación, monitorización, documentación y revisión crítica efectiva—, no como obligación regulatoria universal para cualquier trader o fondo.
Recorrido recomendado
Primera lectura: Trading cuantitativo → Especificación → Backtest → Out-of-sample → Forward test.
Profundización profesional: datos point-in-time → leakage y supervivencia → costes y capacidad → validación temporal → pruebas múltiples → dependencia de la muestra → robustez y bootstrap → métricas → gobernanza live.
Este capítulo reconstruye el conocimiento público y clásico del trading sistemático. El Método Emiciclo es un nivel distinto y posterior: no se proyecta retrospectivamente sobre las definiciones, los estudios ni los procedimientos aquí descritos.
Fuentes
- U.S. Securities and Exchange Commission, Staff Report on Algorithmic Trading in U.S. Capital Markets — taxonomía, usos, beneficios y riesgos del trading algorítmico; es un informe del personal, no una posición adoptada por la Comisión.
- Joseph Simonian, CFA Institute Research Foundation, Investment Model Validation: A Guide for Practitioners — marco práctico sobre backtests, validación, benchmarking, simulación y documentación.
- Halbert White, A Reality Check for Data Snooping — inferencia cuando una regla se elige después de comparar muchas.
- David H. Bailey et al., The Probability of Backtest Overfitting — marco para estimar el riesgo de seleccionar una configuración ganadora en el historial, pero frágil.
- Federal Reserve, SR 26-2 — Supervisory Guidance on Model Risk Management — fuente sectorial vigente sobre gobernanza, validación, monitorización y documentación de modelos.