Dediqué unos días a auditar un sistema de FX en vivo que construí, con más de 16 años de historial. El resultado fue negativo de una manera que no esperaba, y el diagnóstico que lo encontró es lo suficientemente general como para merecer ser documentado: se aplica a cualquier búsqueda de parámetros, no solo al trading.
Cada número que aparece a continuación proviene de una ejecución real medida. Nada es ilustrativo.
La configuración
17 configuraciones, barras de entrada de 4 horas, salidas simuladas en barras de 1 hora, del 28/05/2010 al 08/07/2026, 7.641 operaciones. Es fundamental destacar que alimenté las funciones de producción sin modificar con un archivo CSV histórico en lugar de una transmisión de datos en vivo, por lo que la ruta de código sometida a prueba es exactamente la misma que se ejecuta en tiempo real.
Error 1: la simulación cargó los costos en el lugar incorrecto
Las barras OHLC de la plataforma son precios BID. El backtest colocaba la entrada al cierre de la barra, situaba el take-profit y el stop-loss en el cierre ± n·ATR, verificaba los toques contra los máximos y mínimos del bid, y luego restaba el spread del P&L final.
En vivo, una posición larga se ejecuta al ASK, el bracket se sitúa en relación con ese ask, y se cierra en el BID. Por lo tanto, en vivo el precio necesita recorrer un spread adicional para alcanzar el objetivo, y alcanza el stop un spread antes.
Restar el costo del resultado no es lo mismo que cargarlo al disparador. Lo primero cambia cuánto ganas. Lo segundo cambia qué operaciones ganan en absoluto.
Medido: 2–5 puntos porcentuales de tasa de aciertos, siempre en tu contra.
Esto se generaliza mucho más allá del trading: si tu simulación aplica los costos como un ajuste posterior en lugar de modelar el mecanismo que los genera, tus recuentos de eventos son incorrectos, no solo tus totales.
Error 2: la tasa de aciertos fue una elección de diseño, no una prueba
Los objetivos se fijaron en 0.5–0.8×ATR y los stops en 1.5–2.0×ATR. Esto representa una relación beneficio:riesgo de 0.25–0.4, lo que determina aritméticamente la tasa de aciertos de equilibrio:
tasa de aciertos de equilibrio = SL / (TP + SL) = 75–82%
Fuera de la muestra, utilizando únicamente segmentos de pruebas walk-forward: 4,947 operaciones, 73.5% de tasa de aciertos, -4,669.9 pips, -0.944 pips por operación.
Una tasa de aciertos del 73.5% que genera pérdidas no es una paradoja. Los objetivos pequeños se alcanzan con frecuencia; eso es precisamente lo que hacen los objetivos pequeños. La alta tasa de aciertos se compró aceptando una pérdida cuatro veces mayor que la ganancia; nunca fue evidencia de una ventaja competitiva.
El diagnóstico que vale la pena robar
Antes de volver a optimizar cualquier cosa, me pregunté si la superficie de parámetros era aprendible en absoluto.
Para cada pliegue de validación walk-forward: evaluar la cuadrícula completa de parámetros en la ventana de entrenamiento y en la ventana de prueba, y luego calcular la correlación de rango de Spearman entre ambas.
if rho > 0 -> el rango de entrenamiento predice el rango de prueba; la selección tiene sentido
if rho ~ 0 -> la superficie es ruido; NINGUNA regla de selección puede ayudar
Esa segunda línea es la parte valiosa. Separa "mi optimizador es malo" de "no hay nada aquí" — dos situaciones que desde fuera parecen idénticas y exigen respuestas opuestas.
Resultado en 119 pliegues:
- mediana de rho: -0.024
- media de rho: -0.030, IC del 95% [-0.090, +0.030] — incluye cero
- pliegues con rho > 0: 47.9% — como lanzar una moneda
Cero información. Coherente con ello, la optimización walk-forward con suavizado de meseta produjo resultados fuera de muestra peores que los parámetros que nunca toqué, y seleccionó el límite de la cuadrícula en 11 de 17 configuraciones — la firma de un optimizador sin nada a qué agarrarse.
Luego verifiqué si el efecto existe en algún lugar
38 instrumentos, períodos de tenencia no superpuestos, ajustados por volatilidad y agrupados por clase de activo, lo que reduce 1,140 pruebas a 6, divididas entre la primera y la segunda mitad:
| Clase de activo | Sharpe @0pb | Costo de equilibrio | 1.ª mitad | 2.ª mitad | Estable |
|---|---|---|---|---|---|
| FX major | +0.08 | 3pb | +0.06 | -0.09 | no |
| FX cross | +0.02 | 1pb | -0.05 | -0.06 | no |
| Índice | +0.07 | 5pb | +0.04 | +0.02 | sí |
| Metal | +0.12 | 12pb | +0.13 | +0.03 | sí |
| Energía | +0.13 | 23pb | +0.15 | -0.02 | no |
| Cripto | +0.42 | 100pb | +0.54 | +0.15 | sí |
Dos cosas que no habría imaginado:
El costo de transacción de equilibrio es más útil para la toma de decisiones que el Sharpe. Los pares FX major alcanzan el punto de equilibrio con aproximadamente 3pb y los cruces con alrededor de 1pb; ambos están por debajo del spread real. La pregunta "¿existe una ventaja aquí?" se responde antes de escribir cualquier código de estrategia.
El resultado significativo fue el falso. La energía muestra un t = 3.73 en la muestra completa. Sin embargo, se mantiene plana o negativa en la segunda mitad. Sin la división, habría parecido el hallazgo más sólido de la tabla.
Las criptomonedas fueron las únicas supervivientes, aunque su rendimiento decae drásticamente (de 0.54 a 0.15). Con spreads realistas de CFD, la segunda mitad se vuelve negativa. Se trata de un efecto histórico, no actual.
La lección real
Construya el falsificador antes que la estrategia.
La razón por la que una larga serie de configuraciones parecía "validada" es que ningún componente en el pipeline tenía la tarea de decir aquí no hay nada. Cada parte fue diseñada para encontrar algo, así que encontró algo, cada vez.
La prueba de correlación de rangos mencionada anteriormente tomó una tarde e invalidó meses de trabajo con parámetros, incluida la única pista en la que tenía más confianza. Esa es la prueba haciendo su trabajo, y es el seguro más barato que he añadido a un proceso de investigación en mucho tiempo.
Esta es documentación de investigación, no asesoramiento de inversión. Los resultados pasados no indican resultados futuros. El trading de CFDs conlleva un alto riesgo de pérdida.
Foto de Tyler Prahm en Unsplash
Photo by Tyler Prahm on Unsplash
Artículos relacionados
SafetyWing: Revisión neutral del seguro de viaje para nómadas digitales
Analizamos SafetyWing, un seguro de viaje flexible para nómadas digitales y viajeros de larga estancia. Conoce sus características, costos, ventajas, limitaciones y a quién conviene realmente, con datos verificados.
Baby Planet: revisión neutral del servicio de consultoría sobre seguros de cáncer
Baby Planet es un servicio de consultoría independiente que compara más de 30 aseguradoras para encontrar el seguro de cáncer más adecuado. Ideal para quienes buscan orientación experta sin compromiso inicial.
FUNDROP: Revisión neutral de la plataforma de crowdfunding inmobiliario en Japón
FUNDROP permite invertir desde 10.000 yenes en inmuebles residenciales japoneses con plazos cortos. Ideal para principiantes que buscan rentas por objetivo sin gestionar propiedades.