Casi todo el mundo que se toma en serio el trading acaba haciendo lo mismo: coge una idea, la pasa por datos históricos y mira la curva de capital que sale. Si sube limpia de izquierda a derecha, la estrategia parece validada. Luego la pone a funcionar con dinero real y, en pocas semanas, se comporta como si fuera otra. No es mala suerte. Es lo esperable, porque un backtest es una herramienta muy fácil de engañar, y la persona a la que más fácil le resulta engañar es la que lo ha construido.
Este artículo no va de qué plataforma usar ni de cómo programar una simulación. Va de lo que pasa por debajo: por qué una curva bonita dice mucho menos de lo que parece, cuáles son las trampas concretas que la inflan y qué comprobaciones separan una estrategia con algo de ventaja de una que solo se ha ajustado al pasado.
1. Qué pregunta responde de verdad un backtest
Un backtest responde a una pregunta muy estrecha: si hubiera aplicado exactamente estas reglas sobre exactamente estos datos, qué habría pasado. No responde a la que de verdad te interesa, que es qué pasará a partir de mañana. Entre una y otra hay un salto que solo se puede dar si se cumplen dos condiciones: que las reglas capturen algo que se repite en el mercado, y que la simulación reproduzca con honestidad lo que habría ocurrido al operar.
Por eso conviene cambiar la forma de usarlo. Un backtest no sirve para demostrar que una estrategia funciona; sirve para descartar las que no funcionan. Si una idea no gana ni siquiera en el pasado, con todas las ventajas que da conocer lo que ya ocurrió, no hay motivo para pensar que ganará en el futuro. Si gana, lo único que sabes es que todavía no la has refutado. Parece un matiz, pero cambia por completo cómo se leen los resultados.
2. Sobreajuste: el ruido también tiene forma
La trampa más común y la más difícil de ver es el sobreajuste. Ocurre cuando ajustas los parámetros de una estrategia hasta que encajan con los datos que tienes, incluidas las casualidades que no volverán a repetirse.
Piensa en un cruce de medias. Puedes probar una EMA rápida de entre 5 y 50 periodos contra una lenta de entre 20 y 200. Solo con eso ya son miles de combinaciones, y si además pruebas varias temporalidades y distintos niveles de stop, la cifra se multiplica. Alguna de ellas saldrá espectacular. La pregunta es si sale espectacular porque ha encontrado algo real o porque, entre miles de intentos, alguno tenía que caer en el sitio justo.
La aritmética es brutal. Imagina mil estrategias que no tienen ninguna ventaja: cada operación es una moneda al aire, con la misma ganancia que pérdida. Pasas cada una por 100 operaciones. De media acertarán 50, con una desviación típica de 5. Pero la mejor de las mil, por puro azar, rondará las 66 operaciones ganadoras: un 66% de aciertos y un saldo de unas 32 veces el riesgo por operación. Una estrategia así, presentada sola, parece excelente. Y no tiene nada dentro. En la práctica las combinaciones de parámetros vecinos se parecen entre sí y no son mil pruebas independientes, lo que suaviza el efecto, pero no lo elimina.
Hay señales que delatan un sobreajuste:
- Muchos parámetros para pocas operaciones: cada filtro, umbral o excepción que añades es una forma más de adaptar las reglas al pasado. Una estrategia con ocho parámetros ajustados sobre 60 operaciones está describiendo esas 60 operaciones, no el mercado.
- Un pico aislado en vez de una meseta: si la EMA de 21 da un resultado magnífico pero la de 19 y la de 23 dan pérdidas, no has encontrado una ventaja, has encontrado un accidente. Una idea robusta funciona razonablemente bien en un rango amplio de valores, aunque ninguno sea el óptimo.
- Reglas con nombre y apellidos: "no operar los martes de agosto" o "salir si el RSI pasa de 73" suelen ser parches puestos para esquivar operaciones concretas que salieron mal. Si no sabes explicar por qué la regla tiene sentido antes de ver los datos, sospecha.
- Una curva demasiado limpia: los mercados son ruidosos. Una estrategia real tiene rachas malas, periodos planos y meses que no se entienden. Una curva sin baches suele ser la huella de haber quitado todo lo que molestaba.
3. Sesgo de supervivencia: probar solo con los que siguen vivos
La segunda trampa está en los datos, no en las reglas. Si decides probar una estrategia sobre "las 20 principales altcoins" y descargas la lista de las 20 principales de hoy, estás probando sobre las que han sobrevivido y han crecido hasta ahí. Las que estaban en esa lista hace tres años y se hundieron no aparecen.
El efecto es enorme en cripto, donde la mortalidad de los proyectos es altísima. LUNA estuvo entre las diez mayores criptomonedas por capitalización y en mayo de 2022 perdió prácticamente todo su valor en pocos días. FTT, el token de FTX, siguió un camino parecido en noviembre de ese mismo año. Una estrategia de compra de altcoins probada sobre la lista actual nunca las habrá tenido en cartera, así que nunca habrá sufrido esas caídas. El resultado sale mejor de lo que habría sido, y no por mérito de la estrategia.
- Universo fijado en el pasado: la lista de activos sobre la que operas debe ser la que habrías podido elegir en cada momento, no la que conoces hoy.
- Pares desaparecidos: muchos exchanges borran de sus datos históricos los pares que dejaron de cotizar. Si tu fuente no los incluye, el sesgo viene de serie aunque no lo hayas buscado.
- También fuera de cripto: probar sobre los componentes actuales de un índice bursátil tiene el mismo problema, porque las empresas que cayeron del índice ya no están en la lista.
4. Mirar el futuro sin darte cuenta
La tercera trampa es usar, sin querer, información que en el momento de la decisión no existía. Se llama sesgo de anticipación y es muy fácil de cometer, porque en un fichero de datos todo el pasado y todo el futuro están a la vista a la vez.
- Decidir con el cierre y entrar al cierre: si la regla es "compra cuando la vela cierre por encima de la media" y la simulación compra a ese mismo precio de cierre, está haciendo algo imposible. Hasta que la vela no ha cerrado no sabes que cumple la condición; lo realista es entrar en la apertura de la siguiente, a un precio que puede ser distinto.
- Stop y objetivo en la misma vela: si una vela diaria toca tanto tu stop como tu objetivo, los datos no dicen cuál llegó primero. Muchas simulaciones asumen el orden favorable. Si tu estrategia tiene muchos casos así, necesitas datos de una temporalidad menor para saberlo.
- Indicadores que se repintan: algunos indicadores recalculan sus valores pasados cuando llegan datos nuevos. En el gráfico histórico sus señales parecen perfectas porque se han dibujado conociendo lo que vino después.
- Datos que se publican tarde: una cifra macro o un dato on-chain fechado un día puede no haberse conocido hasta horas o días después. Usarlo en la fecha a la que se refiere es operar con el periódico de mañana.
5. Los costes que la simulación no ve
Una simulación que ejecuta cada orden al precio exacto de la vela, sin comisiones y a cualquier tamaño, está describiendo un mercado que no existe. En la realidad pagas comisión al entrar y al salir, cruzas el spread y sufres deslizamiento, como se detalla en el artículo sobre spread y slippage. Y un stop no se ejecuta al precio que pusiste: se convierte en una orden a mercado que, en un hueco de precio o en un movimiento rápido, puede llenarse bastante más lejos, algo que se explica al comparar los tipos de orden. Si operas con futuros perpetuos, además, pagas o cobras la financiación cada pocas horas.
El efecto depende sobre todo de cuántas operaciones haces. Supón una estrategia que, sin costes, gana de media un 0,25% por operación. Si pagas un 0,10% de comisión como tomador en la entrada y otro 0,10% en la salida, y pierdes otro 0,05% entre spread y deslizamiento, el margen neto por operación es cero. Con 300 operaciones al año, la simulación sin costes mostraría unos 75 puntos porcentuales de ganancia sumada; la operativa real, nada, antes incluso de contar los errores de ejecución. La ventaja existía, pero era más pequeña que el peaje.
La consecuencia es incómoda: cuanto más rápida es una estrategia, más importa modelar bien los costes, y más probable es que un backtest optimista la haya dado por buena cuando no lo es. Si tu simulación no tiene una línea de costes explícita, no tienes un backtest, tienes un borrador.
6. Cómo validar sin engañarte
No existe un método que garantice que una estrategia funcionará. Lo que sí existe es un conjunto de comprobaciones que ponen las cosas difíciles a las estrategias que solo se han ajustado al pasado. Cuantas supera, más confianza merece.
- Datos reservados que no se tocan: separa una parte de la historia, por ejemplo el último 30%, y no la mires mientras diseñas. Cuando la estrategia esté cerrada, la pruebas ahí una sola vez. La clave está en "una sola vez": si ves que falla, retocas y vuelves a probar sobre los mismos datos, ya los has convertido en datos de ajuste y la prueba deja de valer.
- Prueba en ventanas móviles: el llamado walk-forward repite esa idea a lo largo del tiempo. Ajustas los parámetros con, por ejemplo, doce meses de datos, los aplicas sin cambiarlos a los tres meses siguientes, avanzas la ventana y repites. El resultado que cuenta es el de los tramos que la estrategia no había visto.
- Suficientes operaciones: con pocas operaciones la estadística no dice nada. Con 50 operaciones y un 50% real de aciertos, el porcentaje observado puede salir, con un margen del 95%, en cualquier punto entre el 36% y el 64%. Con 400 operaciones ese margen se estrecha a unos 5 puntos arriba o abajo. Una estrategia validada con 30 operaciones es una anécdota.
- Distintos regímenes de mercado: casi cualquier estrategia compradora funcionó en la subida de 2021. La prueba de verdad es cómo se comporta en la caída de 2022 y en los meses laterales. Si solo gana en un tipo de mercado, lo que tienes es una apuesta sobre ese mercado, y tienes que saberlo.
- Compararla con no hacer nada: una estrategia que gana un 40% en un periodo en que simplemente mantener el activo daba un 90% no ha aportado nada, salvo quizá menos caídas. Mide siempre contra esa referencia.
- Otros activos parecidos: si una lógica funciona en BTC pero no en ningún otro activo de comportamiento similar, lo más probable es que se haya ajustado a la historia concreta de BTC.
- Operar en pequeño antes de operar en serio: el último filtro es el mercado real, con tamaño reducido o en simulación en tiempo real. Es lento, pero es la única prueba en la que los costes, los retrasos y tus propias decisiones son los de verdad.
7. Qué mirar en los resultados, y qué engaña
El rendimiento total es la cifra que más se enseña y la que menos informa. Dos estrategias con el mismo resultado final pueden ser completamente distintas de vivir. Las métricas que dicen algo útil son otras:
- Caída máxima desde un pico: el drawdown indica cuánto habrías tenido que aguantar sin abandonar. Es la cifra que decide si una estrategia es soportable con tu capital y tu cabeza, y encaja directamente con la gestión del riesgo y el tamaño de posición.
- Esperanza por operación, ya con costes: lo que gana o pierde de media cada operación después de pagar todo. Si está muy cerca de cero, cualquier empeoramiento en la ejecución la vuelve negativa.
- Tiempo en pérdidas: cuántos meses seguidos pasó la estrategia sin superar su máximo anterior. Una curva que gana al final pero pasa dos años bajo el agua es, en la práctica, una estrategia que casi nadie mantiene.
- Distribución de las ganancias: si el resultado depende de tres o cuatro operaciones excepcionales, basta con que no se repitan para que todo desaparezca.
Y hay una más que conviene tener presente: la caída máxima que ves en el backtest es la de un único orden en que ocurrieron las operaciones. Si reordenas esas mismas operaciones al azar miles de veces, que es lo que hace una simulación de Montecarlo, el resultado final es el mismo, pero la peor caída suele salir claramente mayor en muchos de los recorridos. El pasado te enseñó uno de los caminos posibles, no el peor.
La conclusión práctica es asumir de entrada que los resultados en real serán peores que los del backtest, porque casi siempre lo son: los costes pesan más, las ejecuciones son peores y parte de lo que parecía ventaja era ajuste. Una estrategia que solo es rentable con sus parámetros exactos, sin costes y en un único periodo no es una estrategia rentable. La que merece la pena es la que sigue siendo razonable cuando le quitas todas esas ayudas, aunque su curva sea mucho menos bonita.