Sample size

Tamaño e información efectiva de la muestra en trading: dependencia, precisión de las métricas, regímenes y número de observaciones sin umbrales universales.

A quién va dirigido — A quien interpreta win rate, expectancy, profit factor o Sharpe ratio y necesita entender cuánta información sustenta realmente la estimación, más allá del simple recuento de operaciones.

El sample size o tamaño de la muestra es el número de observaciones utilizadas para estimar una cantidad. Sin embargo, en trading no coincide necesariamente con el número de trades. Operaciones simultáneas expuestas al mismo factor, señales solapadas, rendimientos autocorrelacionados o muchas posiciones nacidas del mismo evento pueden contener información muy repetida.

La pregunta útil no es «¿cuántos trades hacen falta?», sino: ¿con qué precisión puede estimarse esta métrica, bajo qué dependencias y para qué decisión? No existe un umbral universal que estabilice las métricas. El tamaño necesario cambia con la dispersión y asimetría de los payoffs, la frecuencia de pérdidas extremas, la autocorrelación, el horizonte, la heterogeneidad de los regímenes, el número de estrategias probadas y el grado de incertidumbre aceptable.

Muestra, dependencia e información efectivaEl número de filas u operaciones no equivale siempre a observaciones independientes. No hay umbral universal: horizonte, overlap, clusters y distribución fijan la incertidumbre.Muestra, dependencia e información efectivaEl número de filas u operaciones no equivale siempre a observaciones independientesNo hay umbral universal: horizonte, overlap, clusters y distribución fijan la incertidumbre.Observaciones casi independientesLa información nueva crece más rápido condependencia débil.Clusters temporalesOperaciones próximas comparten régimen,volatilidad y shocks.Operaciones solapadasHorizontes compartidos reutilizan los mismosrendimientos.Información efectivaIntervalos y decisiones reflejan dependencia y noestacionariedad.Cyclepedia · diagrama didáctico condicionado, no previsión ni promesa
Cien filas no implican cien experimentos independientes: la estructura de dependencia determina cuánta información añade cada observación.

Observación, trade y unidad informativa

Recuento Qué mide Por qué puede engañar
Trades Aperturas y cierres según el registro operativo Varios trades pueden compartir señal, periodo o riesgo
Barras Intervalos de precio en el dataset Las barras pueden estar autocorrelacionadas o solaparse con labels
Días de rendimiento Observaciones de la serie de la cartera Las posiciones multiday inducen dependencia y smoothing
Eventos Anuncios, rebalanceos u oportunidades distintas Los eventos de un mismo régimen pueden no ser independientes
Estrategias probadas Alternativas que entraron en la selección Aumentan la probabilidad de elegir un ganador casual

La unidad debe ser coherente con la métrica. El win rate se refiere a resultados por trade; el Sharpe suele calcularse sobre rendimientos periódicos; el drawdown depende de todo el recorrido. Convertir cada métrica en una regla basada en el mismo N elimina diferencias importantes.

Dependencia y muestra efectiva

Bajo supuestos de independencia e idéntica distribución, el error estándar de la media disminuye en proporción a 1/√N. Esta relación es una referencia teórica, no un permiso automático. Con dependencia serial, la varianza de la media incluye también las autocovarianzas. Una representación diagnóstica, válida bajo condiciones concretas de estacionariedad y truncamiento, es:

N_eff ≈ N / (1 + 2 × Σ ρ_k)

donde ρ_k representa la autocorrelación en los retardos considerados. No es una fórmula universal para «corregir» cualquier backtest: hace visible por qué el N bruto y la información efectiva pueden divergir. Dependencia negativa, colas pesadas, regímenes y estadísticas no lineales requieren tratamientos diferentes.

Para estimar la incertidumbre pueden emplearse errores estándar coherentes con la dependencia, bootstrap por bloques o simulaciones construidas sobre el proceso estudiado. El método y la longitud de los bloques deben justificarse. Remuestrear trades como si fueran independientes no repara automáticamente la estructura temporal.

La precisión depende de la métrica

Para un win rate idealizado como proporción binomial, la incertidumbre también depende del valor de la probabilidad estimada. Pero los trades reales pueden no ser independientes y el win rate ignora el tamaño de ganancias y pérdidas. Expectancy y profit factor son sensibles a las colas; unos pocos payoffs excepcionales pueden dominarlos. La mayor pérdida y el drawdown observados son extremos de la muestra, no límites garantizados para el futuro.

El Sharpe ratio exige especial cautela: frecuencia, autocorrelación, asimetría y curtosis afectan a la anualización y a la inferencia. La longitud necesaria para sostener que un Sharpe supera un benchmark depende del Sharpe de referencia, el nivel de confianza, la distribución y la dependencia. Un número fijo de operaciones no responde a esta pregunta.

Regímenes, cobertura y representatividad

Una muestra larga puede ser poco representativa si contiene una sola microestructura o un único régimen; una más corta puede ser relevante, pero muy imprecisa. La cobertura debe describirse por tiempo, activo, volatilidad, liquidez, dirección de la exposición y condiciones de mercado, sin multiplicar subgrupos hasta que aparezca un resultado favorable.

La segmentación reduce a su vez el número de observaciones en cada celda. Los resultados por régimen deberían acompañarse de intervalos de incertidumbre y del número de segmentaciones consultadas. No es correcto seleccionar a posteriori solo el régimen en el que la estrategia parece eficaz.

Protocolo para evaluar la adecuación

  1. Definir la decisión. Establecer qué magnitud debe estimarse y con qué precisión útil, en vez de buscar un mínimo abstracto.
  2. Elegir la unidad. Declarar trade, rendimiento periódico, evento u otra observación coherente con la métrica.
  3. Mapear las dependencias. Comprobar solapamiento de posiciones, autocorrelación, clusters por activo y factores comunes.
  4. Examinar la distribución. Informar de dispersión, asimetría, colas, concentración de beneficios y sensibilidad a outliers.
  5. Medir la incertidumbre. Usar intervalos o distribuciones muestrales con un método compatible con la estructura de los datos.
  6. Considerar la selección. Registrar todas las estrategias, ventanas y métricas probadas; una muestra grande no anula el data snooping.
  7. Comprobar la cobertura. Enumerar periodos y condiciones ausentes, además de los presentes.
  8. Actualizar sin desplazar las reglas. Definir de antemano la cadencia y el criterio de revisión; si cambian las reglas, comienza una nueva versión del modelo y cambia el perímetro de la evidencia.

Ejemplo ilustrativo

Ejemplo declarado como ilustrativo — Una cartera registra 240 trades, pero muchas posiciones se abren el mismo día sobre valores expuestos al mismo factor. El recuento de 240 no describe 240 pruebas independientes. El análisis utiliza rendimientos diarios de la cartera, examina autocorrelación y clusters temporales, comunica intervalos compatibles con esa dependencia y muestra cuánto depende el resultado de unos pocos días extremos. Ninguna cifra del ejemplo constituye un umbral recomendado.

Incluso una muestra amplia puede sostener únicamente una conclusión limitada: por ejemplo, que la métrica media histórica se estima con cierta incertidumbre dentro del perímetro observado. No certifica estabilidad estructural ni rendimiento futuro.

Limitaciones

  • El tamaño muestral efectivo suele estimarse, no observarse directamente.
  • Más datos históricos pueden incluir procesos que ya han cambiado.
  • Intervalos estrechos no corrigen look-ahead, survivorship bias ni errores en costes y fills.
  • Un criterio de parada elegido después de ver los resultados altera la inferencia.
  • «Esperar más trades» no sustituye la suspensión inmediata cuando aparecen fallos lógicos, operativos o de control del riesgo.

Fuentes

Páginas relacionadas