O que é
É o método que separa estratégia com vantagem real de estratégia que apenas decorou o passado.
- Out-of-sample (fora da amostra): você otimiza os parâmetros em um pedaço do histórico e testa, sem mexer em nada, em um pedaço que o sistema nunca viu.
- Walk-forward: você repete esse processo em janelas que caminham no tempo — otimiza em um período, testa no seguinte, avança a janela, repete. A estratégia precisa provar valor várias vezes seguidas, em regimes de mercado diferentes.
Backtest simples responde "isso teria funcionado?". Walk-forward responde a pergunta que importa: "isso continua funcionando quando eu não sei o que vem?"
Como se calcula
Divisão clássica em janelas deslizantes:
`` Janela 1: otimiza jan–jun → testa jul–set Janela 2: otimiza abr–set → testa out–dez Janela 3: otimiza jul–dez → testa jan–mar ... ``
O resultado que vale é o agregado dos períodos de teste, nunca o dos períodos de otimização.
A métrica de robustez mais usada é a eficiência walk-forward:
`` Eficiência WF = Desempenho fora da amostra / Desempenho dentro da amostra ``
- Acima de 0,5: a estratégia mantém mais da metade do desempenho no desconhecido. Sinal bom.
- Abaixo de 0,3: boa parte do resultado do backtest era ajuste ao passado.
- Negativa: a estratégia só funcionava porque você já sabia a resposta.
Como ler o número
- O resultado dentro da amostra é sempre bonito — ele foi escolhido para ser. Não significa nada sozinho.
- Interessa a consistência entre janelas: uma estratégia que ganha em 6 de 8 períodos vale mais que outra que explode em 1 e perde em 7 com lucro total maior.
- Se os parâmetros ótimos mudam muito a cada janela (média de 9 vira 34 vira 12), não há regularidade — há ruído.
- Se o desempenho fora da amostra cai perto de zero, o backtest estava medindo memória, não vantagem.
Faixas de referência
- Proporção comum: 70% otimização / 30% teste por janela, com 6 a 12 janelas no total.
- Estratégia robusta apresenta um platô de parâmetros que funcionam, não um pico isolado. Pico estreito é aviso de sobreajuste.
- Estratégias curve-fitted produzem Sharpe alto e drawdown mínimo no papel — é exatamente esse perfil "perfeito demais" que deve acender o alerta.
- Nenhum walk-forward substitui operação real pequena. Ele reduz a chance de ilusão; não elimina.
Parâmetros comuns
- Janela de otimização: 6 a 12 meses de dados intradiários.
- Janela de teste: 30% do tamanho da otimização.
- Número de janelas: mínimo 6 para leitura confiável.
- Operações por janela de teste: 30+ (abaixo disso, cada janela é ruído).
Na prática
- Separe o período de teste antes de começar e não olhe para ele. Olhar já contamina.
- Conte quantas vezes você voltou para ajustar. Cada volta ao mesmo dado consome robustez, mesmo que a intenção seja boa.
- Inclua custos e slippage reais em todas as janelas. Estratégia de alta frequência costuma sobreviver ao walk-forward e morrer na corretagem.
- Prefira poucos parâmetros. Cada parâmetro extra é uma alça a mais para o sobreajuste segurar.
- Depois do walk-forward, rode Monte Carlo sobre a série de operações fora da amostra: um mede robustez no tempo, o outro mede risco de sequência.
Quando falha
Fortes:
- É o padrão-ouro de validação de estratégia — força a prova repetida em regimes diferentes.
- Expõe estratégias que só funcionam em um tipo de mercado.
- Permite reotimização periódica com método, em vez de no susto.
- Mostra a estabilidade dos parâmetros, informação que backtest único esconde.
Limitações:
- Precisa de muito dado. Com 6 meses de histórico não dá para fazer walk-forward honesto.
- Trabalhoso e computacionalmente caro.
- Não protege contra viés de sobrevivência do processo: se você testou 200 estratégias e escolheu a que passou, ela pode ter passado por sorte.
- Assume que o passado recente informa o futuro próximo — em quebra de regime, não informa.
- Testar fora da amostra, não gostar do resultado, ajustar e testar de novo. Isso deixa de ser fora da amostra na segunda rodada.
- Reportar o resultado da otimização como se fosse o desempenho esperado.
- Usar janelas curtas demais, com poucas operações em cada teste.
- Rodar sem custos — depois descobrir na conta real.
- Escolher a estratégia campeã entre centenas testadas e não descontar essa seleção.
Exemplo
Um trader desenvolve um setup de rompimento no WIN e otimiza sobre 2 anos de dados. O backtest fecha com +312% e drawdown de 9%. Número que parece bom demais — e é.
Ele monta o walk-forward: 8 janelas de 9 meses de otimização e 3 de teste.
- Dentro da amostra: média de +38% por janela.
- Fora da amostra: média de +6% por janela, com 5 janelas positivas e 3 negativas.
- Eficiência WF: 6 / 38 = 0,16.
Ou seja: 84% do resultado do backtest era ajuste ao passado. Olhando os parâmetros ótimos por janela, a média rápida oscilou entre 5 e 21 períodos — sem estabilidade nenhuma.
Ele simplifica: tira dois filtros, fixa a média em 9 e refaz. O novo backtest cai para +74%, muito menos sedutor. Mas a eficiência WF sobe para 0,61, com 7 das 8 janelas positivas. É essa a versão que vai para a conta real — a que rende menos no papel e mais na vida.
