Backtesting

Sharpe deflactado al elegir un backtest

El Sharpe deflactado comprueba si el backtest elegido resiste el número de pruebas, una muestra corta y retornos no normales.

El problema no empieza cuando calculas el Sharpe. Empieza cuando pruebas una colección de estrategias y presentas a la ganadora como si hubiese aparecido a la primera.

El Sharpe deflactado pone ese proceso sobre la mesa. Comprueba si el resultado elegido sigue siendo convincente después de considerar la amplitud de la búsqueda, la longitud de la muestra y una distribución de retornos con asimetría o colas gruesas. No mejora el backtest; reduce la confianza que no se ha ganado.

Primero cuenta la investigación que no salió publicada

Una selección de backtests es un torneo, aunque la web enseñe una sola curva. Cambiar mercados, filtros, timeframes, entradas o parámetros produce candidatos. Cuantos más candidatos haya, más fácil resulta encontrar uno que destaque por azar.

El ratio de Sharpe no guarda esa historia. Resume retorno excedente y volatilidad en la serie observada, pero no sabe cuántas alternativas quedaron fuera de la captura. Tampoco resuelve por sí solo la incertidumbre de una muestra corta ni el efecto de retornos alejados de una distribución normal.

Por eso conviene separar dos asuntos. La diferencia entre métricas por trade y por día aclara qué serie alimenta el ratio. El ajuste por selección pregunta cuánto crédito merece el mejor resultado de toda la búsqueda.

Qué información necesita un Sharpe deflactado

David H. Bailey y Marcos López de Prado presentaron el método en The Deflated Sharpe Ratio. La idea es elevar la exigencia cuando el proceso de investigación daba muchas oportunidades para encontrar un ganador afortunado.

No basta con entregar el Sharpe observado. Hace falta conservar el contexto:

DatoLo que revela
Sharpe observadoLa fuerza de la serie seleccionada
Número de pruebasLa amplitud de la búsqueda
Dispersión entre pruebasCuánto variaban los candidatos
Longitud del historialLa cantidad de evidencia independiente
Asimetría y kurtosisLa distancia entre los retornos y una forma normal simple

Una búsqueda más ancha hace subir el listón. Un historial corto o irregular aumenta la incertidumbre de la estimación. El ajuste no demuestra que la estrategia sea mala; impide tratar una victoria estadística barata como una prueba sólida.

Antes de calcular nada, deja un rastro

La herramienta práctica no empieza con una fórmula. Empieza con un registro que no borra los intentos incómodos.

Ese registro debe conservar la familia de estrategia y su lógica, cada variante probada, una base comparable para las métricas y la regla usada para escoger. También debe identificar qué datos quedaron realmente fuera del proceso hasta el final.

Un flujo defendible puede quedar así:

  1. Escribe la lógica y el criterio de selección antes de optimizar.
  2. Guarda cada cambio de mercado, timeframe, filtro, regla y parámetro.
  3. Calcula todos los candidatos sobre una serie y una base de Sharpe comparables.
  4. Cierra la selección antes de abrir el bloque out-of-sample.
  5. Reporta el diagnóstico ajustado junto al resultado final fuera de muestra.
  6. Conserva también los descartes, porque son parte de la evidencia.

Las variantes casi idénticas están correlacionadas. Su número efectivo no siempre coincide con la cantidad de archivos. Esa dificultad debe quedar documentada; borrarla del relato solo vuelve optimista el ajuste.

En una estrategia para prop firm tampoco basta con coronar al Sharpe más alto. La presión sobre la pérdida diaria, el drawdown de equity flotante y la ruta hasta el objetivo pueden ordenar a los candidatos de otra manera. La página de fondeo explica por qué esas restricciones pertenecen a la especificación antes de empezar a buscar.

PBO mira la selección desde otro ángulo

La Probability of Backtest Overfitting, o PBO, estudia la estabilidad del mecanismo que escoge al ganador. No es otro nombre para el Sharpe deflactado.

Bailey, Borwein, López de Prado y Zhu propusieron la PBO mediante validación cruzada combinatoria simétrica en The Probability of Backtest Overfitting. El procedimiento cambia qué bloques cronológicos sirven para seleccionar y cuáles sirven para evaluar. Después observa si el campeón in-sample acaba por debajo del centro del grupo out-of-sample.

ComprobaciónPregunta centralRiesgo que intenta descubrir
Sharpe deflactado¿La cifra elegida resiste la amplitud de la búsqueda?Inflación por pruebas múltiples y retornos no normales
PBO¿El método de selección elige ganadores que fallan fuera de muestra?Inestabilidad del proceso de selección
Hold-out¿La estrategia congelada funciona sobre datos intactos?Ajuste al periodo de desarrollo

Las tres comprobaciones se complementan. El hold-out conserva evidencia que nadie usó para diseñar. La PBO examina la máquina de selección. El Sharpe deflactado cuestiona la fuerza estadística atribuida al resultado final.

Los fallos que ninguna deflación arregla

Un Sharpe deflactado favorable no limpia datos contaminados. No elimina look-ahead bias, costes ausentes, timestamps incorrectos, survivorship bias ni cambios realizados después de mirar el hold-out.

Tampoco reconstruye los experimentos que no se guardaron. Si solo queda la configuración ganadora, la presión real de selección ya no puede medirse con credibilidad.

El diagnóstico tiene sentido dentro de un proceso más amplio: datos limpios, ejecución realista, reglas decididas antes del test y evidencia out-of-sample intacta. realbacktesting detalla esas capas en la página de metodología. Poder reproducir un informe nativo de cTrader demuestra qué se ejecutó; no demuestra que la búsqueda previa fuese estrecha u honesta.

Dudas habituales

¿Un Sharpe alto demuestra que hay sobreajuste?

No. Describe un rendimiento ajustado por volatilidad fuerte dentro de la muestra medida. El riesgo de sobreajuste depende también de la búsqueda, la incertidumbre, la forma de los retornos y el comportamiento out-of-sample.

¿Cada cambio de parámetro cuenta como una prueba?

Cada candidato considerado forma parte de la investigación, incluidos cambios de reglas, filtros, mercados, timeframes o parámetros. Cuando las variantes se parecen mucho, el recuento efectivo exige más cuidado, pero no permite ocultarlas.

¿Basta con reservar un hold-out?

No. El hold-out evalúa una estrategia ya congelada. El Sharpe deflactado examina si la selección anterior infló la historia, y la PBO estudia si ese proceso selecciona de forma estable.

¿Se puede recuperar el cálculo sin los descartes?

No de forma creíble. Un historial incompleto reduce artificialmente la presión de selección y presenta más certeza de la que existió.

La conclusión testaruda: el mejor Sharpe de la carpeta solo se convierte en evidencia cuando la carpeta entera entra en el test.

Publicado Jul 23, 2026 · realbacktesting · Contenido educativo y comentario de mercado — no es asesoramiento financiero. El trading conlleva riesgo; los resultados pasados no garantizan resultados futuros.