Saltar al contenido
Recorrido formativo Plata Método repetible

Métricas y benchmarks de backtest

Cómo interpretar rendimiento, riesgo, drawdown, costes, capacidad e incertidumbre declarando la serie, la frecuencia, la anualización y el término de comparación.

A quién va dirigido — A quien deba interpretar el informe de una estrategia sin depender de una sola cifra y quiera comparar resultados con unidades, costes y riesgos coherentes.

Las métricas de backtest resumen aspectos distintos de una simulación: rendimiento, variabilidad, pérdida de cola, trayectoria, calidad de las operaciones, implementación e incertidumbre. Un benchmark define el término de comparación. Ninguna métrica aislada establece que una estrategia posea una ventaja ni que sea adecuada para un inversor.

El contrato precede a la cifra: serie de rendimientos, frecuencia, divisa, capital, apalancamiento, tratamiento del efectivo, reinversión, costes, datos ausentes, periodo y benchmark. Cambiar una de estas convenciones puede cambiar el resultado sin modificar una sola operación.

Métricas y benchmarks de backtestRendimiento, recorrido, implementación e incertidumbre permanecen separados. Sin valores ilustrativos: toda medida declara unidades, frecuencia, capital y costes.Métricas y benchmarks de backtestRendimiento, recorrido, implementación e incertidumbre permanecen separadosSin valores ilustrativos: toda medida declara unidades, frecuencia, capital y costes.RendimientoTotal, anualizado oexcess return exigeflujos y compoundingcoherentes.ExpectancyMedia por operación ounidad de riesgodepende de laobservación.Volatilidad ydownsideEstimador, frecuenciay distribucióndeterminan elsignificado.Sharpe /SortinoNumerador, benchmark,anualización yautocorrelación sedeclaran.Drawdown yrecuperaciónMedidaspath-dependent de laventana observada, nolímites futuros.Turnover ycostesConectan señalteórica y resultadoeconómicamenteimplementable.Exposición ycapacidadLeverage,concentración yescala explicanrendimiento y riesgo.Benchmark eincertidumbreComparación,intervalos e intentosacompañan laestimación.Cyclepedia · diagrama didáctico condicionado, no previsión ni promesa
Una ficha de resultados combina familias de métricas y conserva las convenciones necesarias para interpretarlas.

Familias de medidas

Familia Ejemplos Pregunta Limitación
Rendimiento rendimiento acumulado, CAGR, rendimiento medio, exceso de rendimiento ¿cuánto creció el capital bajo la convención declarada? no describe la trayectoria ni el riesgo
Variabilidad volatilidad, desviación a la baja ¿cuánto fluctúan los rendimientos? penaliza o ignora movimientos según la definición
Ajustadas al riesgo Sharpe, Sortino, information ratio ¿cuánto rendimiento se asocia con la medida de riesgo elegida? sensibles a la dependencia, la distribución y el benchmark
Trayectoria drawdown máximo, duración, tiempo de recuperación, Calmar ¿qué pérdida de máximo a mínimo aparece en la muestra? una trayectoria no identifica la distribución futura
Cola cuantiles, Expected Shortfall, peor periodo ¿qué sucede en las peores observaciones o escenarios? pocos eventos y riesgo de modelo vuelven incierta la estimación
Basadas en operaciones expectancy, profit factor, porcentaje de aciertos, payoff ratio ¿cómo se distribuyen los resultados por operación definida? operaciones solapadas y definición de la unidad
Implementación rotación, spread, slippage, impacto, capacidad ¿qué parte del rendimiento bruto puede capturarse? los costes dependen del tamaño y del estado del mercado
Incertidumbre error estándar, intervalos, bootstrap, resultados por fold ¿qué precisión y estabilidad tiene la estimación? depende de los supuestos del método

Una métrica puede tener varias definiciones. El «rendimiento anual» puede ser una media aritmética anualizada o una tasa compuesta; Sortino puede utilizar objetivos y denominadores diferentes; el profit factor depende de cómo se agreguen operaciones, costes y posiciones. La fórmula y la convención deben ser visibles.


Sharpe: fórmula y anualización

Para excesos de rendimiento xₜ = rₜ − rᶠₜ, una estimación muestral sencilla es:

Sharpe = media(xₜ) / desviación_estándar(xₜ)

La frecuencia de la serie forma parte de la medida. Multiplicar una ratio de Sharpe diaria por la raíz cuadrada del número de periodos solo es exacto bajo condiciones restrictivas sobre dependencia y escala temporal. Lo demuestra que, con autocorrelación, rendimientos suavizados o posiciones solapadas, la conversión ingenua puede inducir a errores materiales.

Deben declararse la tasa libre de riesgo o tasa mínima, su fuente, divisa, convención de cómputo de días y tratamiento de los días sin negociación. Una ratio de Sharpe bruta no es comparable con una neta; una ratio sin apalancamiento no equivale a otra con un perfil de exposición diferente.


Drawdown y métricas basadas en operaciones

El drawdown máximo es la mayor caída desde un máximo anterior en la curva de capital dentro de la muestra. Depende de la trayectoria y de las fechas de inicio y final. Dos estrategias con la misma distribución marginal pueden tener drawdowns distintos porque los rendimientos se producen en otro orden. La duración y el tiempo de recuperación añaden información que la magnitud por sí sola no muestra.

El porcentaje de aciertos, el payoff medio, la expectancy y el profit factor describen las operaciones según una segmentación elegida. Si una posición se escala mediante varias órdenes, el número de «operaciones» cambia con la regla de agrupación. Muchas operaciones expuestas al mismo shock no son observaciones independientes. Presentar un profit factor superior a un umbral como prueba autónoma de ventaja ignora muestra, dependencia, selección y colas.


Cuatro tipos de benchmark

Benchmark Comparación Advertencia
Efectivo / libre de riesgo remunera el capital que no se pone en riesgo divisa, duración y tipo deben ser coherentes
Índice o cartera de mercado representa una oportunidad invertible o un mandato price return y total return no son equivalentes
Referencia de estrategia mide el valor incremental frente a una regla sencilla debe utilizar los mismos datos, costes, universo y apalancamiento
Benchmark de ejecución compara el precio obtenido con el precio de llegada, VWAP u otra referencia evalúa la ejecución, no el alfa de la señal

El benchmark debe corresponder a la pregunta y, preferiblemente, elegirse antes del resultado. Una estrategia market-neutral no queda bien explicada únicamente por un índice long-only; una estrategia de timing puede compararse tanto con el efectivo como con una exposición pasiva, mostrando además beta y capital empleado. Las comparaciones con índices y carteras deben alinear dividendos, rebalanceo, divisa y costes.

Los Principles for Financial Benchmarks de IOSCO se refieren a benchmarks financieros y a su gobernanza. Ayudan a explicar integridad, metodología y conflictos, pero no convierten cualquier referencia interna en un benchmark regulado.


Bruto, neto y capacidad

Un informe útil construye un puente conciliable:

resultado bruto − comisiones − spread − slippage − impacto − préstamo/financiación/roll = resultado neto simulado

Estas partidas no son constantes universales. El impacto y la probabilidad de ejecución dependen de la cantidad, la urgencia, el mercado, la profundidad y el régimen. Mostrar varios niveles de tamaño y supuestos justificados ayuda a distinguir el rendimiento teórico de la capacidad económicamente alcanzable.

La rotación sin unidades es ambigua. El informe debe declarar si utiliza compras, ventas, la mitad de la suma absoluta, pesos o nocional, y durante qué intervalo. Lo mismo se aplica al uso del margen, a la exposición bruta y neta y al capital inactivo.


Selección e incertidumbre

La ratio de Sharpe del mejor resultado entre muchos intentos tiene una distribución diferente de la de una estrategia preespecificada. Dentro de su modelo, la Deflated Sharpe Ratio considera la no normalidad y la selección entre pruebas. El Reality Check y otros métodos abordan comparaciones múltiples. Estas herramientas exigen un registro creíble de candidatos y no corrigen filtraciones de datos ni errores de ejecución.

Los intervalos y procedimientos bootstrap deben respetar la dependencia. El número de filas u operaciones no equivale automáticamente al número de observaciones independientes. Además de una estimación puntual, resulta útil mostrar resultados por periodo, instrumento, régimen y fold, así como sensibilidad a costes y especificaciones.


Ejemplo ilustrativo

Dos informes declaran una ratio de Sharpe de 1,2. El primero utiliza rendimientos netos diarios, una tasa coherente con la divisa y una corrección por autocorrelación; el segundo utiliza un P&L bruto mensual suavizado y anualizado bajo una convención no declarada. Las dos cifras no son comparables.

Una ficha adecuada informa de fórmula, serie, frecuencia, muestra, costes, benchmark, exposición e incertidumbre. El valor 1,2 es meramente ilustrativo y no constituye un umbral de calidad.


Ficha mínima reproducible

  1. Periodo, universo point-in-time, zona horaria y frecuencia.
  2. Definición de rendimientos, divisa, capital, apalancamiento y reinversión.
  3. Resultados brutos, puente de costes y resultados netos.
  4. Benchmark y referencias elegidos, incluidos dividendos y costes.
  5. Medidas de rendimiento, variabilidad, drawdown/cola, operaciones e implementación.
  6. Rotación, capacidad y concentración de beneficios.
  7. Dependencia, número de intentos y método de incertidumbre.
  8. Resultados por segmento y versiones de código y datos.

El propósito no es acumular indicadores. Es impedir que una cifra elegante oculte la convención que la produjo.


Fuentes

Enlaces