A quién va dirigido — A quien deba interpretar el informe de una estrategia sin depender de una sola cifra y quiera comparar resultados con unidades, costes y riesgos coherentes.
Las métricas de backtest resumen aspectos distintos de una simulación: rendimiento, variabilidad, pérdida de cola, trayectoria, calidad de las operaciones, implementación e incertidumbre. Un benchmark define el término de comparación. Ninguna métrica aislada establece que una estrategia posea una ventaja ni que sea adecuada para un inversor.
El contrato precede a la cifra: serie de rendimientos, frecuencia, divisa, capital, apalancamiento, tratamiento del efectivo, reinversión, costes, datos ausentes, periodo y benchmark. Cambiar una de estas convenciones puede cambiar el resultado sin modificar una sola operación.
Familias de medidas
| Familia | Ejemplos | Pregunta | Limitación |
|---|---|---|---|
| Rendimiento | rendimiento acumulado, CAGR, rendimiento medio, exceso de rendimiento | ¿cuánto creció el capital bajo la convención declarada? | no describe la trayectoria ni el riesgo |
| Variabilidad | volatilidad, desviación a la baja | ¿cuánto fluctúan los rendimientos? | penaliza o ignora movimientos según la definición |
| Ajustadas al riesgo | Sharpe, Sortino, information ratio | ¿cuánto rendimiento se asocia con la medida de riesgo elegida? | sensibles a la dependencia, la distribución y el benchmark |
| Trayectoria | drawdown máximo, duración, tiempo de recuperación, Calmar | ¿qué pérdida de máximo a mínimo aparece en la muestra? | una trayectoria no identifica la distribución futura |
| Cola | cuantiles, Expected Shortfall, peor periodo | ¿qué sucede en las peores observaciones o escenarios? | pocos eventos y riesgo de modelo vuelven incierta la estimación |
| Basadas en operaciones | expectancy, profit factor, porcentaje de aciertos, payoff ratio | ¿cómo se distribuyen los resultados por operación definida? | operaciones solapadas y definición de la unidad |
| Implementación | rotación, spread, slippage, impacto, capacidad | ¿qué parte del rendimiento bruto puede capturarse? | los costes dependen del tamaño y del estado del mercado |
| Incertidumbre | error estándar, intervalos, bootstrap, resultados por fold | ¿qué precisión y estabilidad tiene la estimación? | depende de los supuestos del método |
Una métrica puede tener varias definiciones. El «rendimiento anual» puede ser una media aritmética anualizada o una tasa compuesta; Sortino puede utilizar objetivos y denominadores diferentes; el profit factor depende de cómo se agreguen operaciones, costes y posiciones. La fórmula y la convención deben ser visibles.
Sharpe: fórmula y anualización
Para excesos de rendimiento xₜ = rₜ − rᶠₜ, una estimación muestral
sencilla es:
Sharpe = media(xₜ) / desviación_estándar(xₜ)La frecuencia de la serie forma parte de la medida. Multiplicar una ratio de Sharpe diaria por la raíz cuadrada del número de periodos solo es exacto bajo condiciones restrictivas sobre dependencia y escala temporal. Lo demuestra que, con autocorrelación, rendimientos suavizados o posiciones solapadas, la conversión ingenua puede inducir a errores materiales.
Deben declararse la tasa libre de riesgo o tasa mínima, su fuente, divisa, convención de cómputo de días y tratamiento de los días sin negociación. Una ratio de Sharpe bruta no es comparable con una neta; una ratio sin apalancamiento no equivale a otra con un perfil de exposición diferente.
Drawdown y métricas basadas en operaciones
El drawdown máximo es la mayor caída desde un máximo anterior en la curva de capital dentro de la muestra. Depende de la trayectoria y de las fechas de inicio y final. Dos estrategias con la misma distribución marginal pueden tener drawdowns distintos porque los rendimientos se producen en otro orden. La duración y el tiempo de recuperación añaden información que la magnitud por sí sola no muestra.
El porcentaje de aciertos, el payoff medio, la expectancy y el profit factor describen las operaciones según una segmentación elegida. Si una posición se escala mediante varias órdenes, el número de «operaciones» cambia con la regla de agrupación. Muchas operaciones expuestas al mismo shock no son observaciones independientes. Presentar un profit factor superior a un umbral como prueba autónoma de ventaja ignora muestra, dependencia, selección y colas.
Cuatro tipos de benchmark
| Benchmark | Comparación | Advertencia |
|---|---|---|
| Efectivo / libre de riesgo | remunera el capital que no se pone en riesgo | divisa, duración y tipo deben ser coherentes |
| Índice o cartera de mercado | representa una oportunidad invertible o un mandato | price return y total return no son equivalentes |
| Referencia de estrategia | mide el valor incremental frente a una regla sencilla | debe utilizar los mismos datos, costes, universo y apalancamiento |
| Benchmark de ejecución | compara el precio obtenido con el precio de llegada, VWAP u otra referencia | evalúa la ejecución, no el alfa de la señal |
El benchmark debe corresponder a la pregunta y, preferiblemente, elegirse antes del resultado. Una estrategia market-neutral no queda bien explicada únicamente por un índice long-only; una estrategia de timing puede compararse tanto con el efectivo como con una exposición pasiva, mostrando además beta y capital empleado. Las comparaciones con índices y carteras deben alinear dividendos, rebalanceo, divisa y costes.
Los Principles for Financial Benchmarks de IOSCO se refieren a benchmarks financieros y a su gobernanza. Ayudan a explicar integridad, metodología y conflictos, pero no convierten cualquier referencia interna en un benchmark regulado.
Bruto, neto y capacidad
Un informe útil construye un puente conciliable:
resultado bruto − comisiones − spread − slippage − impacto − préstamo/financiación/roll = resultado neto simuladoEstas partidas no son constantes universales. El impacto y la probabilidad de ejecución dependen de la cantidad, la urgencia, el mercado, la profundidad y el régimen. Mostrar varios niveles de tamaño y supuestos justificados ayuda a distinguir el rendimiento teórico de la capacidad económicamente alcanzable.
La rotación sin unidades es ambigua. El informe debe declarar si utiliza compras, ventas, la mitad de la suma absoluta, pesos o nocional, y durante qué intervalo. Lo mismo se aplica al uso del margen, a la exposición bruta y neta y al capital inactivo.
Selección e incertidumbre
La ratio de Sharpe del mejor resultado entre muchos intentos tiene una distribución diferente de la de una estrategia preespecificada. Dentro de su modelo, la Deflated Sharpe Ratio considera la no normalidad y la selección entre pruebas. El Reality Check y otros métodos abordan comparaciones múltiples. Estas herramientas exigen un registro creíble de candidatos y no corrigen filtraciones de datos ni errores de ejecución.
Los intervalos y procedimientos bootstrap deben respetar la dependencia. El número de filas u operaciones no equivale automáticamente al número de observaciones independientes. Además de una estimación puntual, resulta útil mostrar resultados por periodo, instrumento, régimen y fold, así como sensibilidad a costes y especificaciones.
Ejemplo ilustrativo
Dos informes declaran una ratio de Sharpe de 1,2. El primero utiliza rendimientos netos diarios, una tasa coherente con la divisa y una corrección por autocorrelación; el segundo utiliza un P&L bruto mensual suavizado y anualizado bajo una convención no declarada. Las dos cifras no son comparables.
Una ficha adecuada informa de fórmula, serie, frecuencia, muestra, costes, benchmark, exposición e incertidumbre. El valor 1,2 es meramente ilustrativo y no constituye un umbral de calidad.
Ficha mínima reproducible
- Periodo, universo point-in-time, zona horaria y frecuencia.
- Definición de rendimientos, divisa, capital, apalancamiento y reinversión.
- Resultados brutos, puente de costes y resultados netos.
- Benchmark y referencias elegidos, incluidos dividendos y costes.
- Medidas de rendimiento, variabilidad, drawdown/cola, operaciones e implementación.
- Rotación, capacidad y concentración de beneficios.
- Dependencia, número de intentos y método de incertidumbre.
- Resultados por segmento y versiones de código y datos.
El propósito no es acumular indicadores. Es impedir que una cifra elegante oculte la convención que la produjo.
Fuentes
- William F. Sharpe, The Sharpe Ratio — definición, interpretación y relaciones de la medida.
- Andrew W. Lo, The Statistics of Sharpe Ratios — distribución y limitaciones de la anualización en presencia de dependencia.
- David H. Bailey y Marcos López de Prado, The Deflated Sharpe Ratio — ajuste por sesgo de selección y rendimientos no normales dentro del modelo propuesto.
- International Organization of Securities Commissions, Principles for Financial Benchmarks — principios para la gobernanza, calidad y metodología de los benchmarks dentro de su ámbito.
- Joseph Simonian, CFA Institute Research Foundation, Investment Model Validation: A Guide for Practitioners — uso conjunto de rendimiento, benchmarks, estrés e incertidumbre en la validación.