A quién va dirigido — A quien interpreta win rate, expectancy, profit factor o Sharpe ratio y necesita entender cuánta información sustenta realmente la estimación, más allá del simple recuento de operaciones.
El sample size o tamaño de la muestra es el número de observaciones utilizadas para estimar una cantidad. Sin embargo, en trading no coincide necesariamente con el número de trades. Operaciones simultáneas expuestas al mismo factor, señales solapadas, rendimientos autocorrelacionados o muchas posiciones nacidas del mismo evento pueden contener información muy repetida.
La pregunta útil no es «¿cuántos trades hacen falta?», sino: ¿con qué precisión puede estimarse esta métrica, bajo qué dependencias y para qué decisión? No existe un umbral universal que estabilice las métricas. El tamaño necesario cambia con la dispersión y asimetría de los payoffs, la frecuencia de pérdidas extremas, la autocorrelación, el horizonte, la heterogeneidad de los regímenes, el número de estrategias probadas y el grado de incertidumbre aceptable.
Observación, trade y unidad informativa
| Recuento | Qué mide | Por qué puede engañar |
|---|---|---|
| Trades | Aperturas y cierres según el registro operativo | Varios trades pueden compartir señal, periodo o riesgo |
| Barras | Intervalos de precio en el dataset | Las barras pueden estar autocorrelacionadas o solaparse con labels |
| Días de rendimiento | Observaciones de la serie de la cartera | Las posiciones multiday inducen dependencia y smoothing |
| Eventos | Anuncios, rebalanceos u oportunidades distintas | Los eventos de un mismo régimen pueden no ser independientes |
| Estrategias probadas | Alternativas que entraron en la selección | Aumentan la probabilidad de elegir un ganador casual |
La unidad debe ser coherente con la métrica. El win rate se refiere a
resultados por trade; el Sharpe suele calcularse sobre rendimientos periódicos;
el drawdown depende de todo el recorrido. Convertir cada métrica en una regla
basada en el mismo N elimina diferencias importantes.
Dependencia y muestra efectiva
Bajo supuestos de independencia e idéntica distribución, el error estándar de
la media disminuye en proporción a 1/√N. Esta relación es una referencia
teórica, no un permiso automático. Con dependencia serial, la varianza de la
media incluye también las autocovarianzas. Una representación diagnóstica,
válida bajo condiciones concretas de estacionariedad y truncamiento, es:
N_eff ≈ N / (1 + 2 × Σ ρ_k)donde ρ_k representa la autocorrelación en los retardos considerados. No es
una fórmula universal para «corregir» cualquier backtest: hace visible por qué
el N bruto y la información efectiva pueden divergir. Dependencia negativa,
colas pesadas, regímenes y estadísticas no lineales requieren tratamientos
diferentes.
Para estimar la incertidumbre pueden emplearse errores estándar coherentes con la dependencia, bootstrap por bloques o simulaciones construidas sobre el proceso estudiado. El método y la longitud de los bloques deben justificarse. Remuestrear trades como si fueran independientes no repara automáticamente la estructura temporal.
La precisión depende de la métrica
Para un win rate idealizado como proporción binomial, la incertidumbre también depende del valor de la probabilidad estimada. Pero los trades reales pueden no ser independientes y el win rate ignora el tamaño de ganancias y pérdidas. Expectancy y profit factor son sensibles a las colas; unos pocos payoffs excepcionales pueden dominarlos. La mayor pérdida y el drawdown observados son extremos de la muestra, no límites garantizados para el futuro.
El Sharpe ratio exige especial cautela: frecuencia, autocorrelación, asimetría y curtosis afectan a la anualización y a la inferencia. La longitud necesaria para sostener que un Sharpe supera un benchmark depende del Sharpe de referencia, el nivel de confianza, la distribución y la dependencia. Un número fijo de operaciones no responde a esta pregunta.
Regímenes, cobertura y representatividad
Una muestra larga puede ser poco representativa si contiene una sola microestructura o un único régimen; una más corta puede ser relevante, pero muy imprecisa. La cobertura debe describirse por tiempo, activo, volatilidad, liquidez, dirección de la exposición y condiciones de mercado, sin multiplicar subgrupos hasta que aparezca un resultado favorable.
La segmentación reduce a su vez el número de observaciones en cada celda. Los resultados por régimen deberían acompañarse de intervalos de incertidumbre y del número de segmentaciones consultadas. No es correcto seleccionar a posteriori solo el régimen en el que la estrategia parece eficaz.
Protocolo para evaluar la adecuación
- Definir la decisión. Establecer qué magnitud debe estimarse y con qué precisión útil, en vez de buscar un mínimo abstracto.
- Elegir la unidad. Declarar trade, rendimiento periódico, evento u otra observación coherente con la métrica.
- Mapear las dependencias. Comprobar solapamiento de posiciones, autocorrelación, clusters por activo y factores comunes.
- Examinar la distribución. Informar de dispersión, asimetría, colas, concentración de beneficios y sensibilidad a outliers.
- Medir la incertidumbre. Usar intervalos o distribuciones muestrales con un método compatible con la estructura de los datos.
- Considerar la selección. Registrar todas las estrategias, ventanas y métricas probadas; una muestra grande no anula el data snooping.
- Comprobar la cobertura. Enumerar periodos y condiciones ausentes, además de los presentes.
- Actualizar sin desplazar las reglas. Definir de antemano la cadencia y el criterio de revisión; si cambian las reglas, comienza una nueva versión del modelo y cambia el perímetro de la evidencia.
Ejemplo ilustrativo
Ejemplo declarado como ilustrativo — Una cartera registra 240 trades, pero muchas posiciones se abren el mismo día sobre valores expuestos al mismo factor. El recuento de 240 no describe 240 pruebas independientes. El análisis utiliza rendimientos diarios de la cartera, examina autocorrelación y clusters temporales, comunica intervalos compatibles con esa dependencia y muestra cuánto depende el resultado de unos pocos días extremos. Ninguna cifra del ejemplo constituye un umbral recomendado.
Incluso una muestra amplia puede sostener únicamente una conclusión limitada: por ejemplo, que la métrica media histórica se estima con cierta incertidumbre dentro del perímetro observado. No certifica estabilidad estructural ni rendimiento futuro.
Limitaciones
- El tamaño muestral efectivo suele estimarse, no observarse directamente.
- Más datos históricos pueden incluir procesos que ya han cambiado.
- Intervalos estrechos no corrigen look-ahead, survivorship bias ni errores en costes y fills.
- Un criterio de parada elegido después de ver los resultados altera la inferencia.
- «Esperar más trades» no sustituye la suspensión inmediata cuando aparecen fallos lógicos, operativos o de control del riesgo.
Fuentes
- Andrew W. Lo, The Statistics of Sharpe Ratios, Financial Analysts Journal, 2002 — autocorrelación, distribución e inferencia del Sharpe ratio.
- David H. Bailey y Marcos López de Prado, The Sharpe Ratio Efficient Frontier, Journal of Risk, 2012 — longitud del track record, confianza y características distributivas.
- Campbell R. Harvey, Yan Liu y Heqing Zhu, …and the Cross-Section of Expected Returns, The Review of Financial Studies, 2016 — número de pruebas y umbrales de evidencia en la selección financiera.
- Francis X. Diebold y Roberto S. Mariano, Comparing Predictive Accuracy, Journal of Business & Economic Statistics, 1995 — comparación entre errores predictivos con estructura temporal.
- Leonard J. Tashman, Out-of-sample tests of forecasting accuracy: an analysis and review, 2000 — múltiples muestras de prueba, rolling origin y representatividad temporal.