Backtesting

Intervalos de confianza para la expectativa

Un intervalo de confianza deja ver si la expectativa de un backtest está bien estimada o descansa sobre una muestra demasiado incierta.

Una media positiva queda muy bien en el informe. El problema es que sigue siendo una sola media, calculada con la única muestra que ya conoces.

Un intervalo de confianza para la expectativa acota la incertidumbre de ese promedio mediante un procedimiento definido. No demuestra que exista una ventaja permanente. Te obliga a mostrar cuánto puede moverse la estimación sin cambiar de muestra histórica.

La cifra central oculta la pregunta importante

La expectativa resume el resultado medio por trade cuando todos los resultados usan la misma unidad. Puede calcularse directamente como media o descomponerse así:

expectancy = (win rate × average win) − (loss rate × average loss)

La operación describe lo observado. No responde con qué precisión conoces la expectativa del proceso que produjo esos trades.

Según la explicación del NIST sobre intervalos de confianza, una estadística muestral aproxima un parámetro desconocido y el intervalo cuantifica la incertidumbre de esa aproximación. Aplicado a un backtest, el parámetro depende del mercado, de la ejecución y de las reglas concretas del sistema. No es una constante grabada en piedra.

Una auditoría estadística tampoco limpia datos contaminados. Si hubo look-ahead, costes omitidos o selección posterior del mejor sistema, el intervalo solo dará apariencia de precisión a un punto de partida defectuoso.

Cómo leer el 95% sin engañarte

El 95% pertenece al procedimiento, no a una probabilidad posterior asignada al intervalo ya obtenido. Si repitieras el muestreo del mismo proceso muchas veces y construyeras el intervalo siempre igual, aproximadamente el 95% de esos intervalos cubriría el parámetro buscado.

El NIST aclara esta lectura al tratar los límites para una media: una vez calculado, el intervalo concreto contiene el parámetro o no lo contiene. Lo que tiene una tasa de cobertura es el método.

En la práctica, interesa distinguir cuatro casos:

Lo que vesLectura prudenteError frecuente
Todo el intervalo queda por encima de 0Los datos son compatibles con expectativa positiva bajo esos supuestosTomarlo como garantía
El intervalo cruza 0La muestra no separa con claridad una ventaja de la ausencia de ventajaDeclarar inútil la estrategia
El intervalo es estrechoHay más precisión dentro del modelo elegidoSuponer que no existe sesgo
El intervalo es anchoFalta evidencia para fijar bien el promedioDescartar la media como falsa

El límite inferior no es el peor retorno que tendrás. Tampoco es un objetivo. Solo pertenece al análisis de esa muestra.

El bootstrap empieza antes del ordenador

En un bootstrap tomas observaciones de la muestra original con reemplazo. Algunas aparecen varias veces y otras desaparecen en cada remuestreo. Después vuelves a calcular la estadística.

La guía de bootstrap del NIST explica que la colección de estadísticas remuestreadas aproxima su distribución muestral. En este caso, cada repetición produce otra expectativa.

Un esquema percentil básico queda así:

define one clean return series
resample it with replacement at the original sample length
calculate expectancy for each resample
sort the bootstrap expectancies
take the 2.5 and 97.5 percentiles for a 95% interval

Lo delicado no es ordenar los resultados. Es decidir qué constituye una observación independiente.

Si varias posiciones comparten movimiento, si el sizing cambia o si las pérdidas llegan por grupos, barajar trades individuales borra parte del mecanismo. Un block bootstrap conserva fragmentos contiguos y respeta algo de esa memoria. La elección debe apoyarse en cómo opera el sistema, no en cuál deja un gráfico más cómodo.

El artículo sobre autocorrelación en backtests desarrolla precisamente ese problema: el orden puede contener riesgo que un shuffle elimina.

Trades, días o bloques

No existe una unidad universal para remuestrear. La unidad correcta es la que responde a tu pregunta sin romper la dependencia relevante.

Para expectativa por operación, los retornos de trades pueden servir cuando cada trade representa una observación razonable. En un portfolio con posiciones simultáneas, los retornos diarios suelen conservar mejor la exposición común y los días sin actividad. Si un evento genera varias entradas relacionadas, quizá el bloque económico sea más honesto que cada fila por separado.

Antes de calcular nada, deja fijado:

  • La unidad de retorno o de riesgo usada en toda la serie.
  • El tratamiento de spread, comisión, slippage y swap.
  • Los trades perdedores y los periodos inactivos que corresponden a la unidad elegida.
  • La separación entre datos de diseño y datos intactos de validación.
  • La regla de remuestreo y el motivo para usarla.

Cambiar después la longitud del bloque, excluir sesiones o redefinir retornos hasta que el intervalo deje de cruzar 0 es sobreajuste. El envoltorio estadístico no lo vuelve más respetable.

Lo que no cabe dentro del intervalo

El bootstrap recicla lo que ocurrió. Si la muestra nunca vio un shock de liquidez o un régimen concreto, el remuestreo no puede fabricarlo de manera creíble. Las colas poco observadas siguen estando poco observadas.

También presupone cierta continuidad del proceso. Un cambio de ejecución, lógica o estructura de mercado puede hacer que el historial antiguo ya no represente al sistema actual. En ese caso, un intervalo estrecho puede contestar con precisión una pregunta caducada.

La dependencia añade otra trampa. Si las filas están agrupadas por señales solapadas, su cantidad exagera la información independiente. Los bloques reducen ese problema solo si su diseño recoge la dependencia que importa.

Y todavía queda la selección. El intervalo de un ganador no incorpora automáticamente todos los candidatos descartados antes de elegirlo. Para esa otra capa sirve una prueba consciente de la búsqueda, como el deflated Sharpe ratio.

En una cuenta de prop firm manda el recorrido

Aunque el intervalo de expectativa quede por encima de 0, las pérdidas pueden concentrarse dentro de una ventana incompatible con las reglas de la cuenta. La media y el camino de la equity son problemas distintos.

Por eso la incertidumbre de la expectativa debe leerse junto al drawdown, las rachas, la exposición y el tiempo hasta el fondeo. La página de fondeo detalla esas restricciones; ningún intervalo sustituye su análisis.

realbacktesting publica sus supuestos de ejecución, datos y validación en la metodología. Hacerlos visibles permite revisar el resultado. No convierte un backtest histórico en una promesa de trading en real.

Dudas habituales

¿Cruzar 0 invalida el backtest?

No. Indica que esa muestra y ese procedimiento no distinguen limpiamente una expectativa positiva de una nula. Puede hacer falta más evidencia o una unidad de análisis mejor, no una conclusión automática.

¿El bootstrap evita asumir normalidad?

Puede construir un intervalo desde la distribución empírica sin imponer retornos normales. Aun así, hereda todo lo que falte en la muestra y todos los supuestos del remuestreo.

¿Conviene remuestrear trades o días?

Depende de qué riesgo quieras conservar. Los trades responden mejor a la expectativa por operación cuando son unidades creíbles; los días o bloques suelen representar mejor portfolios solapados.

¿Sirve para anticipar el resultado en real?

No. Mide incertidumbre muestral bajo un modelo histórico. El futuro añade regímenes, costes y ejecución que el intervalo no conoce.

La conclusión testaruda: publicar expectativa sin un rango de incertidumbre es entregar una medida sin decir cuánto puede fallar.

Publicado Jul 27, 2026 · realbacktesting · Contenido educativo y comentario de mercado — no es asesoramiento financiero. El trading conlleva riesgo; los resultados pasados no garantizan resultados futuros.