Antes de interpretar las métricas, comprueba qué estás midiendo
Yo no empezaría por el beneficio neto ni por el win rate.
Primero preguntaría: ¿estos números representan una prueba suficientemente seria como para que merezca la pena analizarlos?
Hay tres comprobaciones básicas.
¿La muestra tiene suficiente información?
Un profit factor calculado sobre 12 operaciones y otro calculado sobre 500 no tienen el mismo peso, aunque ambos enseñen exactamente el mismo número.
Aquí no voy a volver a desarrollar el problema del tamaño de muestra porque ya tiene su propia lección. Si necesitas repasarlo, vuelve a cuántas operaciones necesita un backtest.
Lo importante ahora es entender la consecuencia: cuanto más débil sea la muestra, menos confianza puedes depositar en todas las métricas que vienen después.
Un win rate de 60% significa cosas muy distintas si proviene de 10 operaciones o de cientos de observaciones repartidas entre diferentes periodos de mercado.
¿Los resultados incluyen costes realistas?
Comisiones, spread y slippage pueden parecer pequeños vistos operación por operación.
Pero una estrategia con una ventaja media muy estrecha puede perderla por completo cuando introduces fricción de ejecución.
Imagina que tu backtest obtiene una expectativa bruta de +0.08R por trade.
Si los costes reales equivalen, en promedio, a 0.10R por operación, el sistema que parecía positivo pasa a una expectativa neta aproximada de -0.02R.
No cambió la entrada.
Cambió algo mucho más básico: el backtest estaba midiendo una realidad que probablemente no podías ejecutar.
Cuando llegue el momento de contrastar la operativa en un entorno de ejecución, puedes consultar Pepperstone desde nuestro enlace. Antes de operar con dinero real, revisa siempre las condiciones aplicables, los costes y las características de los instrumentos que vayas a utilizar.
¿Estás mirando In-Sample o datos que el sistema no utilizó para ajustarse?
Una estrategia puede verse magnífica sobre los mismos datos que utilizaste para construirla.
Eso no demuestra que haya capturado una relación que pueda repetirse.
Por eso necesitas saber de qué parte del proceso proviene el reporte. La distinción entre datos utilizados para desarrollar el modelo y datos reservados para comprobarlo se explica en profundidad en In-Sample vs Out-of-Sample.
Aquí quédate con esto:
las métricas no detectan por sí mismas un backtest mal construido.
Puedes calcular perfectamente un profit factor, una expectativa y un drawdown sobre datos contaminados por look-ahead bias, sobreajuste o mala calidad. Las matemáticas estarán bien. La evidencia no.
La cadena que explica de dónde sale la rentabilidad
Una vez que el backtest merece ser leído, yo separaría sus métricas en preguntas.
| Métrica | Qué pregunta responde | Qué no te dice por sí sola |
|---|---|---|
| Win rate | ¿Con qué frecuencia ganas? | Cuánto ganas frente a cuánto pierdes |
| Payoff ratio | ¿Qué tamaño tiene el ganador medio frente al perdedor medio? | Con qué frecuencia ocurre cada uno |
| Expectancy | ¿Cuál es el resultado medio esperado por operación en la muestra? | Cómo de irregular fue el recorrido |
| Profit factor | ¿Cuánto beneficio bruto generaste por cada unidad de pérdida bruta? | Cómo se distribuyeron esas ganancias y pérdidas |
| Beneficio neto | ¿Cuánto terminó ganando o perdiendo la simulación? | Cuánto riesgo fue necesario asumir |
| Equity curve y drawdown | ¿Cómo llegaste hasta el resultado final? | Por qué cada operación se comportó así |
| MAE/MFE | ¿Qué ocurrió dentro de las operaciones antes de cerrarlas? | Si el sistema completo es robusto |
El error es interpretar cada columna como si fuera independiente.
No lo es.
Un ejemplo: cómo encajan win rate, payoff, expectancy y profit factor
Supongamos un sistema hipotético con estos resultados, ya expresados después de los costes que hayas decidido modelar:
- 200 operaciones.
- 90 ganadoras.
- 110 perdedoras.
- Ganancia media: +1.8R.
- Pérdida media: -1R.
Aquí utilizo R como la cantidad de riesgo inicial planificada por operación. Si 1R fueran 1,000 MXN, una ganancia de +1.8R equivaldría a 1,800 MXN.
El win rate sería:
90 / 200 = 45%
Puedes profundizar en cómo leer ese dato en la lección sobre win rate en trading.
Pero 45% todavía no te dice si el sistema gana dinero.
Necesitamos saber cuánto gana cuando acierta.
El payoff ratio sería:
1.8R / 1R = 1.8
Es decir, el ganador medio es 1.8 veces el tamaño del perdedor medio. La lógica completa está en payoff ratio en trading.
Ahora las dos piezas empiezan a trabajar juntas.
La expectativa del sistema sería:
Expectancy = (probabilidad de ganar × ganancia media) − (probabilidad de perder × pérdida media)
En nuestro ejemplo:
Expectancy = (0.45 × 1.8R) − (0.55 × 1R)
Expectancy = 0.26R por operación
Eso no significa que la siguiente operación vaya a ganar 0.26R.
Significa que, en la muestra analizada, el promedio obtenido por operación fue equivalente a +0.26R.
Si quieres profundizar en esa diferencia, tienes la lección específica sobre expectancy en trading.
Podemos comprobar la misma historia desde otro ángulo.
Los 90 ganadores producen:
90 × 1.8R = 162R de beneficio bruto
Los 110 perdedores producen:
110 × 1R = 110R de pérdida bruta
Entonces:
Profit Factor = beneficio bruto / pérdida bruta
Profit Factor = 162R / 110R ≈ 1.47
Y el resultado neto sería:
162R − 110R = +52R
Como hay 200 operaciones:
52R / 200 = +0.26R por operación
Volvimos a la misma expectativa.
Eso me interesa mucho más que memorizar fórmulas: las métricas deberían ser distintas ventanas sobre la misma realidad económica.
Puedes ver en detalle cómo funciona esta métrica en profit factor en trading.
Un win rate alto puede esconder una expectativa negativa
Ahora cambiemos el ejemplo.
Imagina un sistema que gana el 80% de las veces.
Suena espectacular.
Pero supongamos que:
- gana +0.4R cuando acierta;
- pierde -2R cuando falla.
Su esperanza sería:
(0.80 × 0.4R) − (0.20 × 2R)
0.32R − 0.40R = -0.08R
Tiene 80% de aciertos y expectativa negativa.
Esta es una de las razones por las que obsesionarse con el porcentaje de operaciones ganadoras suele llevar a conclusiones equivocadas.
El win rate no es bueno ni malo de forma aislada.
Tiene que ser compatible con el tamaño de tus ganancias y pérdidas.
Y hay un matiz práctico importante: puedes aumentar artificialmente el win rate acercando mucho el take profit o permitiendo pérdidas mucho mayores. El porcentaje de acierto sube, pero eso no significa que hayas mejorado el sistema.
El beneficio neto te dice dónde terminaste, no cómo llegaste
Supongamos dos backtests.
Los dos terminan con +30R.
¿Son equivalentes?
No necesariamente.
El primero podría haber recorrido algo parecido a esto:
0 → +8R → +15R → +12R → +22R → +30R
El segundo:
0 → -18R → -25R → -12R → +4R → +30R
El destino es igual.
El viaje no.
Y para un trader, el camino importa muchísimo.
Una estrategia puede ser rentable en el periodo estudiado y, aun así, necesitar un tamaño de posición tan agresivo o sufrir caídas tan profundas que su aplicación práctica sea problemática.
Por eso debes mirar el resultado junto con la equity curve o curva de capital.
Yo observaría al menos:
- si el crecimiento se reparte razonablemente en el tiempo;
- si todo el beneficio depende de una fase muy concreta;
- si existen largos periodos de estancamiento;
- cuánto duran y cuánto profundizan los drawdowns;
- si una o dos operaciones explican una parte desproporcionada del resultado;
- si el comportamiento cambia radicalmente entre periodos.
Una curva ascendente no demuestra por sí sola que exista un edge estable.
También puede ser producto de una muestra débil, una racha extraordinaria, sobreajuste o un régimen de mercado particularmente favorable.
El drawdown pone precio al camino
El drawdown mide la caída desde un máximo previo de la curva de capital hasta un mínimo posterior.
Imagina que una cuenta simulada pasa de 100,000 MXN a 125,000 MXN y después retrocede hasta 105,000 MXN.
La caída desde el máximo es:
125,000 − 105,000 = 20,000 MXN
En porcentaje:
20,000 / 125,000 = 16%
El dato importante no es solamente que después pueda recuperarse.
Es que para obtener el resultado final del backtest tuviste que soportar, al menos históricamente, ese recorrido.
Y aquí tendría mucho cuidado con una interpretación habitual:
el maximum drawdown histórico no es una estimación fiable del máximo drawdown futuro.
Solo es el peor drawdown que apareció en esa muestra concreta.
El futuro puede producir uno mayor.
Por eso tampoco tiene sentido dimensionar una estrategia pensando que “como nunca cayó más de 16% en el backtest, 16% es mi peor escenario”.
No lo sabes.
MAE y MFE te ayudan a abrir la caja negra de cada operación
Las métricas agregadas resumen el sistema.
Pero a veces necesitas bajar de nivel y preguntarte qué ocurre dentro de cada trade.
Ahí entran MAE y MFE, precisamente la lección de la que venimos.
Puedes encontrar, por ejemplo, que muchas operaciones ganadoras sufren primero una excursión adversa enorme.
O que numerosos trades recorren +2R a favor y terminan cerrando en +0.3R.
Eso no implica automáticamente que debas mover el stop o cambiar la salida. Hacerlo mirando el pasado sin volver a probar el sistema sería una forma bastante fácil de sobreoptimizarlo.
Pero sí te da una pregunta útil que investigar:
¿la lógica de entrada y salida está aprovechando razonablemente el comportamiento que el backtest está mostrando?
Ese es exactamente el tipo de pregunta para la que sirven las métricas: no para decirte automáticamente qué cambiar, sino para decirte dónde merece la pena investigar.
No ignores cómo se distribuyen los resultados
Dos backtests pueden tener exactamente la misma expectativa y esconder distribuciones muy diferentes.
Imagina:
Sistema A
Tiene cientos de operaciones relativamente parecidas entre sí y el beneficio se distribuye a lo largo del periodo.
Sistema B
La mayoría de operaciones están cerca de cero y tres trades extraordinarios generan casi todo el beneficio.
La expectativa media podría coincidir.
El riesgo de depender de un resultado excepcional, no.
Por eso, cuando tengas el reporte delante, busca también:
- operación ganadora más grande;
- operación perdedora más grande;
- porcentaje del beneficio bruto explicado por los mayores ganadores;
- rachas consecutivas de pérdidas;
- tiempo medio dentro de la operación;
- resultados separados por largos y cortos cuando tenga sentido;
- comportamiento por periodos.
No necesitas optimizar ninguna de estas cifras.
Primero solo quieres entender qué estructura hay detrás del promedio.
¿Y Sharpe, Sortino y otras métricas avanzadas?
Dependiendo del software aparecerán más números: Sharpe ratio, Sortino ratio, recovery factor, CAGR, exposición, tiempo en mercado, margen utilizado y varios más.
Pueden ser útiles.
Pero yo no empezaría por ellos si todavía no eres capaz de explicar con claridad:
win rate + payoff → expectancy
y después relacionar esa expectativa con:
profit factor + curva de capital + drawdown + distribución de trades.
El Sharpe intenta relacionar retorno y variabilidad. El Sortino parte de una lógica parecida, pero busca penalizar específicamente la variabilidad negativa según su formulación.
Pueden aportar otra capa de análisis, pero antes necesitas entender qué entradas utiliza el cálculo, qué periodo se está midiendo y qué supuestos incorpora la plataforma.
Un ratio sofisticado no arregla una comprensión floja de las métricas básicas.
Haz una prueba de coherencia entre todas las métricas
Esta es probablemente la parte que más me interesa que aprendas de esta lección.
Cuando veo un reporte, no quiero encontrar “la mejor métrica”.
Quiero detectar inconsistencias que merecen una explicación.
Por ejemplo:
Win rate muy alto + payoff muy bajo
Puede ser perfectamente posible. La pregunta es si la combinación todavía deja expectativa suficiente después de costes.
Profit factor positivo + resultado dependiente de pocos trades
El sistema ganó más en sus ganadores de lo que perdió en sus perdedores, pero quizá el resultado depende demasiado de unos cuantos outliers.
Buen beneficio neto + drawdown enorme
Puede haber rentabilidad histórica, pero a cambio de un recorrido de riesgo difícil de sostener.
Curva muy suave + muestra pequeña
La apariencia visual puede transmitir más seguridad de la que realmente permite la evidencia.
Resultados excelentes In-Sample + deterioro fuerte Out-of-Sample
La hipótesis cambia: ya no estás preguntando cuánto ganó el modelo histórico, sino cuánto de ese comportamiento sobrevivió a datos que no participaron en su construcción.
Expectancy positiva antes de costes + negativa después de costes
Tu ventaja teórica era menor que la fricción necesaria para ejecutarla.
Estas contradicciones no son errores del reporte.
Son exactamente lo que el reporte te está ayudando a descubrir.
Mi orden para leer un reporte de backtesting
Si tienes una pantalla llena de números y no sabes por dónde empezar, yo seguiría este orden:
- Muestra y periodo. ¿Cuántas operaciones hay y qué mercado temporal cubren?
- Calidad del test. ¿Los datos, costes y reglas representan razonablemente lo que intentas probar?
- Win rate y payoff. ¿Cómo está construido el resultado económico de cada operación?
- Expectancy y profit factor. ¿Qué producen conjuntamente ganadores y perdedores?
- Equity curve y drawdown. ¿Cómo fue el camino hasta obtener ese resultado?
- Distribución de trades. ¿El beneficio está repartido o depende de unos pocos resultados?
- MAE y MFE. ¿Qué comportamiento muestran las operaciones antes de su cierre?
- In-Sample frente a Out-of-Sample. ¿La relación continúa cuando sales de los datos utilizados para construirla?
Después de eso puedes pasar a ratios secundarios y análisis más especializados.
No al revés.
Tres errores que pueden arruinar la interpretación
El primero es buscar una métrica que decida por ti.
No existe.
El segundo es comparar sistemas utilizando números que no están en las mismas condiciones.
Una expectancy calculada en R no es directamente lo mismo que una expresada en dólares con position sizing variable. Un backtest con costes no debería enfrentarse como si fuera equivalente a otro que los ignora.
Y el tercero es empezar a modificar reglas cada vez que encuentras una métrica que no te gusta.
Ahí empieza el overfitting o sobreajuste.
Una métrica te ayuda a formular una pregunta. Después esa pregunta necesita convertirse en una nueva hipótesis y volver a probarse correctamente.
No debes editar el pasado hasta conseguir un reporte bonito.
Si estás utilizando una plataforma de trading para llevar después tus pruebas a demo o comprobar cómo se comporta la ejecución fuera del backtest, puedes revisar Pepperstone aquí. La idea no es sustituir el proceso estadístico por una plataforma, sino utilizarla cuando llegue el momento de contrastar cómo se traduce tu sistema a condiciones de ejecución más realistas.
Interpretar un backtest no es todavía decidir si es bueno
Esta distinción es importante dentro del curso.
Aquí hemos aprendido qué están diciendo los números cuando los observas juntos.
Todavía no hemos decidido si 1.47 de profit factor es suficiente, si un drawdown concreto es tolerable, si la muestra ofrece suficiente confianza o si el sistema merece pasar a la siguiente fase.
Porque esas decisiones dependen del tipo de estrategia, costes, frecuencia, mercado, riesgo asumido, estabilidad y contexto estadístico.
No quiero darte un atajo del estilo:
“Profit factor superior a X = buen sistema”.
Sería sencillo.
Y también sería una mala forma de evaluar un backtest.
Eso es precisamente lo que trabajamos en la siguiente lección: cómo saber si un backtest es bueno.
Antes de avanzar, deberías ser capaz de mirar un reporte y explicar con tus propias palabras de dónde salen sus ganancias, qué riesgo recorrió para conseguirlas y qué limitaciones tiene la evidencia que estás viendo.
Ese es el verdadero objetivo de aprender métricas.
No coleccionar ratios.
Entender el sistema.






