A quién va dirigido — A quien quiera verificar con datos actuales un flujo de trading, la gestión de órdenes y los procedimientos operativos sin exponer capital, sabiendo qué aspectos del mercado real permanecen fuera de la prueba.
El paper trading es un entorno en el que las decisiones y las órdenes se registran o simulan sin generar la exposición económica normal de una operación real. Puede utilizar cotizaciones actuales, una reproducción histórica o el motor de simulación de un bróker. Sirve para comprobar que datos, señales, dimensionamiento, instrucciones, alertas y diario funcionan en la secuencia prevista. Sin embargo, su P&L sigue siendo hipotético.
Hay que mantener separados tres conceptos. Out-of-sample describe la relación entre los datos y el desarrollo: una muestra es OOS si no guio las elecciones del modelo. Forward test describe una evaluación prospectiva de una versión congelada. Paper, shadow y micro-live describen, en cambio, el entorno o la forma de implementación. Un forward test puede ejecutarse en paper, shadow o micro-live; ninguno de los tres términos es sinónimo de los demás.
Cuatro entornos, preguntas distintas
| Entorno | ¿Llega una orden al mercado? | Qué observa bien | Límite distintivo |
|---|---|---|---|
| Paper trading | No | Reglas, interfaz, contabilidad simulada, rutinas | Las ejecuciones y el P&L dependen del simulador |
| Shadow mode | No | Flujo automático completo y decisiones en tiempo real | La orden sombra no interactúa con el libro ni con el bróker |
| Micro-live | Sí, con exposición reducida | Enrutamiento, rechazos, ejecuciones, conciliación real | El impacto y la presión no escalan linealmente |
| Live con el tamaño previsto | Sí | Proceso económico dentro del perímetro efectivo | Capital en riesgo; ya no es una prueba sin coste |
El shadow mode suele ser una variante más controlada del paper: el sistema produce la orden que habría enviado y conserva timestamps y motivos, pero un bloqueo impide el enrutamiento. El micro-live utiliza órdenes reales de pequeño tamaño. Reducir el tamaño limita la exposición, pero puede cambiar la prioridad, la probabilidad de ejecución, el impacto y el comportamiento humano; no replica automáticamente la escala objetivo.
Qué puede verificar
Una prueba paper bien construida puede mostrar si:
- los feeds llegan con los timestamps, la frecuencia y los símbolos esperados;
- las variables y señales se calculan sin utilizar datos que aún no estaban disponibles;
- el dimensionamiento, los límites, los calendarios y las acciones corporativas se aplican correctamente;
- las órdenes, cancelaciones y modificaciones siguen la máquina de estados prevista;
- el sistema gestiona aperturas, cierres, sesiones reducidas, datos ausentes y reinicios;
- logs, alertas, diario y conciliación permiten reconstruir cada decisión;
- el operador sigue las listas de control, autorizaciones y escalados acordados.
También puede producir evidencia prospectiva sobre el comportamiento de la estrategia si la versión se congeló antes de comenzar. Esta evidencia no debe confundirse con una medición completa de la negociabilidad.
Qué no reproduce fielmente
Un simulador no ocupa realmente una posición en la cola del libro y su orden no modifica la liquidez disponible. Las ejecuciones parciales, la latencia, el impacto de mercado y la selección adversa pueden aproximarse, pero no observarse como en una orden real. También pueden faltar o simplificarse los rechazos del bróker, límites de crédito, disponibilidad del préstamo, reclamaciones de valores, márgenes, liquidación y costes de financiación.
El dinero virtual no reproduce íntegramente los incentivos, la presión, la responsabilidad ni las consecuencias de una pérdida real. La Interpretive Notice NFA 9025 lo explicita dentro de su ámbito: el rendimiento hipotético no representa trading efectivo ni puede incorporar por completo liquidez, slippage y capacidad para seguir el programa cuando hay pérdidas. Es una norma sobre la comunicación promocional de los miembros de la NFA, no un criterio universal de validación; el principio de cautela sobre el rendimiento simulado sigue siendo pertinente.
Protocolo operativo
- Definir el objetivo. Separar la comprobación del flujo, la formación procedimental y la evaluación prospectiva de la estrategia.
- Identificar la versión. Congelar código, configuración, universo, datos, dimensionamiento, costes, benchmark y criterios de salida de la prueba.
- Describir el entorno. Registrar proveedor, bróker o simulador, modelo de ejecución, latencia, horarios, tipos de orden y diferencias conocidas frente al live.
- Utilizar el reloj normal. Nada de rebobinar, eliminar señales retrospectivamente o sustituir precios después de conocer el resultado.
- Probar también los fallos. Simular feed detenido, precio obsoleto, orden rechazada, ejecución parcial, reinicio, pérdida de conexión y duplicación de mensajes cuando corresponda.
- Conciliar cada evento. Comparar intención, orden sombra, ejecución simulada, posición, efectivo, coste y log; clasificar las diferencias.
- Registrar desviaciones e intervenciones. Una corrección material crea una versión nueva; el periodo anterior no se elimina.
- Decidir según el objetivo. «Flujo verificado», «evidencia insuficiente» y «problema operativo abierto» son resultados distintos del P&L.
No existe una duración universal
Cuatro semanas, un número determinado de operaciones o un mes rentable no son criterios generales. La duración útil depende de la frecuencia de las señales y de la necesidad de encontrar sesiones, eventos y casos operativos relevantes. Una estrategia intradía puede producir muchas órdenes correlacionadas sin cubrir un solo evento infrecuente; una estrategia mensual puede exigir más tiempo de calendario y aun así aportar pocas observaciones.
Los criterios de finalización deberían establecerse antes: cobertura de los tipos de orden, conciliaciones sin anomalías materiales, gestión correcta de casos de error y cantidad de información compatible con la pregunta estadística. El beneficio simulado, por sí solo, no es un criterio de promoción.
Ejemplo ilustrativo
Ejemplo expresamente ilustrativo — Una estrategia genera órdenes limitadas en shadow mode. La prueba descubre que, después de un reinicio, dos señales se envían dos veces y que el simulador considera ejecutada toda la cantidad en cuanto el precio toca el límite. El primer problema es operativo; el segundo es un supuesto de ejecución. Ambos se corrigen en una versión nueva, conservando logs y resultados anteriores. Ninguna duración ni cantidad del ejemplo constituye un umbral de validación.
Un micro-live posterior puede verificar el enrutamiento y la conciliación con órdenes reales reducidas. Sin embargo, no demuestra que costes y capacidad permanezcan iguales con el tamaño previsto: la transición exige límites, monitorización y escalado.
Limitaciones
- La calidad depende del modelo del simulador y de los datos disponibles.
- La ausencia de capital en riesgo cambia incentivos y comportamiento.
- El paper no demuestra liquidez, préstamo ni capacidad a la escala objetivo.
- Un resultado prospectivo sigue expuesto a una muestra pequeña, un régimen particular y pruebas múltiples.
- Corregir el flujo no autoriza a reescribir retrospectivamente la historia de la versión probada.
Fuentes
- National Futures Association, Interpretive Notice 9025 — Use of Promotional Material Containing Hypothetical Performance Results — límites de la retrospectiva, la liquidez, el slippage y la ausencia de riesgo real; aplicable dentro de su ámbito NFA.
- U.S. Securities and Exchange Commission, Staff Report on Algorithmic Trading in U.S. Capital Markets, 2020 — estructura de los mercados, automatización y efectos de la interacción real entre órdenes y centros de negociación.
- Joseph Simonian, CFA Institute Research Foundation, Investment Model Validation: A Guide for Practitioners, 2024 — validación proactiva y límites de los modelos de inversión.
- Comisión Europea, Reglamento Delegado (UE) 2017/589, RTS 6 — pruebas, entornos separados de producción, controles y despliegue dentro del ámbito de la UE del trading algorítmico al que se aplica.