Por qué 30 operaciones pueden engañarte tanto
Imagina que pruebas un sistema y obtienes estos resultados:
30 operaciones, 18 ganadoras y 12 perdedoras.
Su win rate histórico sería del 60%.
A primera vista puede parecer bastante convincente. El problema es que con una muestra tan pequeña todavía existe muchísimo ruido estadístico.
Podrías repetir el mismo experimento con un proceso cuya probabilidad real de acertar estuviera cerca del 50% y, simplemente por azar, observar temporalmente un 60%, un 65% o algo bastante inferior.
Eso no significa que las 30 operaciones no sirvan para nada. Sirven para comprobar muchas cosas: si las reglas están correctamente definidas, si el setup aparece con una frecuencia razonable, si has cometido errores al programarlo o registrar operaciones y si la hipótesis merece seguir investigándose.
Lo que no haría es confundir ese primer filtro con una demostración de edge en trading.
La estadística explica por qué. La incertidumbre de una estimación disminuye aproximadamente con la raíz cuadrada del tamaño de la muestra. En términos prácticos, duplicar las operaciones no reduce a la mitad el error: para conseguir aproximadamente la mitad de incertidumbre necesitas cuadruplicar la muestra.
Por eso pasar de 25 a 100 trades cambia mucho más la calidad de la información de lo que puede parecer.
Entonces, ¿100 operaciones son suficientes para un backtest?
Yo usaría 100 operaciones como un primer punto de control serio, no como un sello de aprobación.
Esta tabla resume cómo interpretaría distintos tamaños de muestra. Son referencias prácticas, no umbrales estadísticos universales:
| Número de operaciones | Cómo lo interpretaría |
|---|---|
| Menos de 30 | Muestra muy pequeña. Útil sobre todo para detectar errores y ver si la idea merece seguirse probando. |
| 30-50 | Exploratoria. Ya puedes observar patrones, pero las métricas pueden moverse muchísimo con unas pocas operaciones adicionales. |
| Alrededor de 100 | Primer punto razonable para empezar a estudiar estadísticas con más seriedad. Sigue existiendo una incertidumbre importante. |
| 200-300 | La estimación empieza a ser bastante más informativa en muchos sistemas relativamente simples y con trades poco dependientes entre sí. |
| 500 o más | Mucho mejor para estrategias ruidosas, de edge pequeño o alta frecuencia. Aun así, cantidad no sustituye calidad, independencia ni variedad de mercado. |
| 1,000+ | Puede ser necesario cuando la ventaja esperada es muy pequeña frente a la dispersión de resultados. No convierte automáticamente el sistema en robusto. |
La clave está en la última columna. El número tiene que interpretarse junto con cómo se generaron esas operaciones.
Doscientos trades no significan lo mismo en todos los sistemas.
Mira lo que ocurre con un win rate del 50%
Hay una forma bastante intuitiva de verlo.
Supongamos que haces un backtest y exactamente la mitad de las operaciones son ganadoras. Si tratáramos cada trade como una observación independiente de ganar o perder, el intervalo de incertidumbre alrededor de ese 50% se va estrechando conforme aumenta la muestra.
Aproximadamente:
| Operaciones | Ganadoras | Win rate observado | Intervalo aproximado del 95% |
|---|---|---|---|
| 30 | 15 | 50% | 33% – 67% |
| 100 | 50 | 50% | 40% – 60% |
| 200 | 100 | 50% | 43% – 57% |
| 400 | 200 | 50% | 45% – 55% |
| 1,000 | 500 | 50% | 47% – 53% |
El cálculo utiliza un intervalo binomial y sirve para ilustrar la relación entre tamaño de muestra e incertidumbre. No necesitas memorizar la fórmula. NIST documenta precisamente cómo el tamaño de muestra afecta a la precisión con la que puede estimarse una proporción.
Fíjate en las primeras dos filas.
Con 30 trades, observar un 50% de aciertos deja un margen enorme. Con 100 ya sabemos bastante más, pero todavía estamos lejos de conocer la tasa real con precisión.
Y aquí aparece otro problema: el win rate ni siquiera te dice por sí solo si el sistema gana dinero.
Puedes acertar 70% de las operaciones y perder si las pérdidas son mucho mayores que las ganancias. También puedes acertar 40% y tener una expectativa positiva si tus ganancias compensan suficientemente las pérdidas.
Por eso el tamaño de muestra tiene que estudiarse sobre las métricas que realmente importan, no únicamente sobre el porcentaje de aciertos.
La variabilidad de tus resultados cambia muchísimo la muestra necesaria
Aquí está una de las partes que más se suelen pasar por alto.
Supongamos dos sistemas.
El primero produce resultados bastante uniformes: sus ganancias y pérdidas suelen estar cerca de +1R y -1R.
El segundo pierde pequeñas cantidades muchas veces y, de vez en cuando, captura una ganancia de +5R, +8R o +10R.
Incluso aunque ambos tengan una expectativa histórica parecida, el segundo necesita normalmente más observaciones para que su promedio se estabilice, porque una pequeña cantidad de operaciones extraordinarias tiene mucho peso sobre el resultado final.
Puedes verlo matemáticamente a través de la incertidumbre de una media:
Error estándar ≈ desviación estándar de los resultados / √n
Cuanto mayor sea la dispersión de los trades, mayor muestra necesitas para estimar el promedio con la misma precisión. El principio es el mismo que utiliza la estadística para construir intervalos de confianza sobre una media.
Supongamos un ejemplo hipotético.
Un sistema muestra una expectancy de +0.20R por operación, pero la desviación estándar de sus resultados es 1.50R.
Con 100 operaciones:
Error estándar = 1.50 / √100 = 0.15R
Un intervalo aproximado del 95% estaría alrededor de:
0.20R ± 0.30R
Es decir, aproximadamente entre -0.10R y +0.50R.
Todavía existe bastante incertidumbre sobre si la expectativa subyacente es realmente positiva.
Ahora supongamos exactamente el mismo promedio y dispersión, pero con 400 operaciones:
Error estándar = 1.50 / √400 = 0.075R
El intervalo aproximado se estrecharía hasta algo cercano a:
+0.05R a +0.35R
Mismo backtest medio. Mucha más información.
No tomaría estos intervalos como una certificación matemática del sistema porque los retornos de trading no siempre son independientes, normales ni estables. Pero el ejemplo deja clara la relación importante:
cuanto menor sea tu edge respecto al ruido de los resultados, más muestra necesitas.
Antes de contar trades, decide qué estás contando
Parece obvio, pero no siempre lo es.
Imagina que una entrada abre una posición y después sales en cuatro parciales.
¿Has realizado una operación o cuatro?
Para estudiar el resultado de esa señal, yo normalmente consideraría todo el ciclo de posición como una observación, porque los cuatro cierres proceden de la misma decisión inicial. Contarlos como cuatro trades independientes inflaría artificialmente la muestra.
Algo parecido ocurre con un sistema que abre simultáneamente EUR/USD, GBP/USD y AUD/USD ante la misma condición relacionada con el dólar. Técnicamente pueden aparecer tres operaciones distintas en el historial. Estadísticamente, sin embargo, pueden compartir gran parte del mismo riesgo.
O piensa en una estrategia que escala una posición mediante cinco órdenes. Cinco ejecuciones no significan necesariamente cinco experimentos independientes.
Por eso, antes de hacer el test, necesitas reglas de sistema suficientemente precisas como para saber qué representa una observación.
Contar órdenes no es necesariamente lo mismo que contar información nueva.
Esta distinción es todavía más importante cuando comparas un backtesting manual con uno automático, porque una plataforma puede entregarte miles de filas perfectamente ordenadas sin que todas representen miles de observaciones independientes.
500 operaciones del mismo mercado pueden enseñarte menos que 200 bien distribuidas
El número de trades tampoco puede separarse completamente del tiempo y de las condiciones de mercado.
Imagina un sistema tendencial con 500 operaciones realizadas durante un periodo extraordinariamente favorable para las tendencias.
Tienes mucha muestra sobre una pregunta:
¿Cómo se comportó este sistema durante ese entorno?
Pero quizá sabes muy poco sobre otra:
¿Qué ocurre cuando el mercado deja de comportarse así?
Por eso me interesa que la muestra incluya situaciones suficientemente distintas para representar lo que la estrategia afirma poder operar: periodos de mayor y menor volatilidad, condiciones tendenciales y laterales cuando corresponda, sesiones diferentes si el horario forma parte de la estrategia y, sobre todo, suficientes años cuando la frecuencia operativa lo requiera.
No necesitas meter a la fuerza todos los posibles regímenes en cada backtest. Depende de la hipótesis del sistema.
Si tu sistema está diseñado específicamente para operar tendencias fuertes, una etapa lateral no tiene por qué generar la misma cantidad de señales. Lo que no puedes hacer es probarlo únicamente durante un bull market excepcional y después concluir que has demostrado una ventaja general.
Más trades dentro del mismo tipo de mercado aumentan cantidad. No necesariamente aumentan diversidad de evidencia.
Una muestra enorme tampoco arregla un backtest mal construido
Este punto merece dejarlo muy claro.
Puedes tener 10,000 operaciones y seguir teniendo un backtest malo.
Si has utilizado información futura, datos deficientes, costes irreales o has cambiado las reglas conforme veías los resultados, aumentar el número de trades no repara el problema.
Y hay otra situación especialmente peligrosa: probar cientos de variantes y quedarte con la que mejor funcionó.
Imagina que pruebas 200 combinaciones distintas de parámetros y después muestras solamente la mejor. Aunque esa configuración tenga 500 operaciones, parte de su espectacular resultado puede venir simplemente de que elegiste al ganador entre muchísimos candidatos.
La investigación sobre backtest overfitting estudia exactamente este problema: seleccionar estrategias a partir de muchas pruebas aumenta el riesgo de confundir ajuste al histórico con capacidad real para generalizar.
Más adelante tenemos una lección específica sobre overfitting en trading. Aquí basta con una regla:
el tamaño de muestra mide una parte de la evidencia; no compensa un proceso de investigación sesgado.
¿Cómo decidir cuántas operaciones necesitas en tu propio backtest?
Yo empezaría por definir qué quieres estimar.
Si solo estás intentando comprobar que las reglas funcionan mecánicamente, unas decenas de operaciones pueden ser suficientes para detectar errores importantes.
Si quieres estimar un win rate con cierta estabilidad, necesitarás bastante más.
Si quieres saber si una expectativa pequeña de +0.10R o +0.15R puede distinguirse razonablemente del ruido, probablemente necesitarás todavía más.
Y si estás intentando estimar fenómenos poco frecuentes —una racha de pérdidas extrema, un drawdown excepcional o el comportamiento del sistema durante una crisis— el número necesario puede ser enorme. Esos eventos, precisamente porque son raros, aparecen pocas veces.
Por eso el tamaño de muestra debería surgir de cuatro variables:
| Variable | Qué cambia |
|---|---|
| Magnitud del edge | Un efecto pequeño necesita más observaciones para distinguirse del ruido. |
| Variabilidad de los trades | Cuanto más dispersos sean los resultados, más tarda en estabilizarse la media. |
| Dependencia entre operaciones | Trades muy correlacionados aportan menos información independiente de la que su número sugiere. |
| Precisión que necesitas | No necesitas la misma evidencia para descartar una idea que para arriesgar capital basándote en ella. |
Para mí, esta tabla es bastante más útil que repetir “haz 100 trades” como una regla universal.
Una forma práctica de trabajar sin obsesionarte con el número perfecto
Antes de iniciar el backtest, fija el periodo histórico, las reglas, los costes que vas a modelar y qué vas a considerar una operación.
Después ejecuta todas las señales que cumplan esas condiciones.
No pares porque llegaste a 100 y el equity curve se veía bonita.
Tampoco sigas añadiendo años únicamente porque en la operación 137 el resultado pasó de positivo a negativo y quieres “darle otra oportunidad”.
El final del test debería estar definido por tu diseño de investigación, no por si el resultado te gusta.
Una práctica razonable es utilizar las primeras decenas de trades para depurar la metodología y, una vez que las reglas estén congeladas, generar la mayor muestra limpia que tenga sentido para ese sistema.
Si después de 100 operaciones las estadísticas todavía cambian radicalmente cada vez que añades 20 trades, eso ya te está diciendo algo importante: todavía tienes mucha incertidumbre.
Si con 500 continúan cambiando violentamente, el problema puede ser todavía más profundo: quizá el payoff es extremadamente variable, las operaciones están muy correlacionadas, la estrategia depende mucho del régimen o la ventaja es demasiado pequeña para detectarla con claridad.
¿Y si mi estrategia solo genera 30 operaciones en diez años?
Entonces tienes 30 operaciones.
No tienes que fabricar 300.
Este problema aparece mucho en sistemas de largo plazo, swing trading muy selectivo o setups extremadamente concretos.
Cambiar las reglas para generar más señales únicamente porque “necesitas 100 operaciones” significa que ya no estás testeando el mismo sistema.
Puedes ampliar el histórico si existen datos suficientemente fiables. También puedes estudiar otros instrumentos si la hipótesis original realmente afirma que las mismas reglas son aplicables a ellos.
Pero hay que tener cuidado.
Si desarrollaste el sistema exclusivamente sobre EUR/USD, no puedes añadir de repente Bitcoin, oro y Nasdaq únicamente para aumentar el contador y después tratarlos como si procedieran exactamente del mismo proceso.
A veces la respuesta intelectualmente correcta es menos cómoda:
“Tengo poca muestra y, por tanto, mi nivel de confianza en esta estimación debe ser menor.”
Eso es mucho mejor que fabricar precisión.
Cómo usar una plataforma de backtesting sin dejar que la herramienta decida por ti
Una plataforma automatizada puede generar cientos o miles de operaciones en minutos. Eso elimina muchísimo trabajo mecánico, pero no responde la pregunta estadística por ti.
MetaTrader 5, por ejemplo, incorpora un Strategy Tester que permite ejecutar Expert Advisors sobre datos históricos, y Pepperstone ofrece MT5 junto con otras plataformas que incluyen funciones de backtesting y acceso a históricos según su documentación oficial.
Si estás construyendo un sistema automatizado o semiautomatizado, puedes revisar Pepperstone y las condiciones disponibles desde nuestro enlace. También puedes consultar la promoción que esté disponible en el momento de abrir la cuenta.
La herramienta te ayuda a producir la muestra. No convierte una muestra mala en buena.
Además, si posteriormente pasas de la simulación a operar CFDs, recuerda que estás trabajando con productos apalancados y con riesgo elevado. El propio broker advierte expresamente de ese riesgo.
Cinco errores que hacen que “500 trades” valgan mucho menos de lo que parece
| Error | Qué ocurre realmente |
|---|---|
| Contar parciales como operaciones independientes | Inflas artificialmente el tamaño de muestra. |
| Añadir posiciones muy correlacionadas como si fueran experimentos distintos | El número de filas crece más rápido que la información nueva. |
| Detener el backtest cuando las métricas ya se ven bien | El propio resultado empieza a decidir la muestra. |
| Probar muchos parámetros y enseñar solo el mejor | Aumenta el riesgo de seleccionar ruido histórico. |
| Ignorar comisiones, spread o slippage | Obtienes más observaciones de un sistema que quizá ni siquiera existe en condiciones ejecutables. |
Por eso un buen backtest no se evalúa diciendo simplemente:
“Tuvo 427 operaciones.”
Quiero saber qué representan esas 427 operaciones.
La regla que yo usaría
Si estás empezando a construir sistemas, no intentaría encontrar una cifra perfecta que te permita dejar de pensar.
Utilizaría este criterio:
Con menos de 50 operaciones, trataría prácticamente cualquier conclusión sobre rendimiento como preliminar. Alrededor de 100 empezaría a estudiar las métricas con más atención. Con 200-300 tendría mucha más información si las operaciones son razonablemente independientes y la muestra cubre bien el comportamiento que pretende representar el sistema. Y si el edge es pequeño o los resultados son muy variables, asumiría desde el principio que puedo necesitar 500, 1,000 o más.
Pero incluso 1,000 trades no sustituyen unas reglas limpias, datos correctos, costes realistas y un proceso que no haya elegido retrospectivamente la configuración ganadora.
Eso es lo importante.
No busques un número que “valide” tu estrategia.
Busca suficiente evidencia para saber cuánto puedes confiar —y cuánto no— en lo que estás viendo.
El siguiente problema aparece cuando decides qué datos usar para desarrollar y cuáles para comprobar
Una vez tienes claro por qué el tamaño de muestra importa, aparece una pregunta distinta.
Si utilizas todo tu histórico para descubrir reglas, ajustar parámetros y decidir qué versión del sistema te gusta, ¿con qué datos independientes vas a comprobar después que no te limitaste a adaptarte al pasado?
Eso ya no es un problema de cantidad. Es un problema de cómo divides y utilizas la muestra.
Por eso el siguiente paso del curso es entender la diferencia entre In-Sample y Out-of-Sample.
Y si quieres practicar con una plataforma que permita trabajar con históricos y backtesting automatizado, puedes consultar aquí Pepperstone, sus plataformas y la promoción disponible mediante nuestro enlace. Antes de pasar a dinero real, revisa siempre las condiciones aplicables a tu residencia, los costes y el riesgo del producto.






