Ir para o conteúdo

Overfitting

Ajuste ao ruído histórico e seleção entre muitos testes: como reconhecer, medir e conter overfitting em sistemas de trading.

Em palavras simples — Overfitting ocorre quando a estratégia aprende detalhes acidentais do passado como se fossem uma regra repetível. Ela explica muito bem a amostra usada e degrada fora dela.

Overfitting é o ajuste excessivo de modelo, regra ou processo ao ruído e às particularidades da amostra histórica. Em trading, também surge da seleção: se muitas estratégias são testadas, alguma pode vencer por acaso. O melhor backtest observado não é uma estimativa neutra do desempenho futuro.

Overfitting e seleção entre muitas tentativasO melhor in-sample também incorpora o acaso da pesquisa. Números e superfícies são ilustrativos; cada especificação testada pertence à seleção.Overfitting e seleção entre muitas tentativasO melhor in-sample também incorpora o acaso da pesquisaNúmeros e superfícies são ilustrativos; cada especificação testada pertence à seleção.Espaço de testes16 configurações testadas · um pico isolado0.20.40.1-0.10.30.81.90.20.10.60.70.1-0.20.10.30.02Vencedor selecionadoO máximo histórico não estima sem viés o retorno futuro.3Teste independenteAvaliação não usada na escolha mede a degradação fora daamostra.4Inferência múltiplaA conclusão considera tentativas, dependência e regra deseleção.Cyclepedia · esquema educacional condicionado, não previsão nem promessa
Quanto maior o espaço de busca, maior a chance de encontrar um pico isolado que não representa uma região estável.

De onde nasce

  • parâmetros demais para a informação disponível;
  • features, universos, janelas e filtros escolhidos após ver o resultado;
  • regras complexas que capturam eventos únicos;
  • dados contaminados, revisados ou com survivor bias;
  • custos e fills ajustados para favorecer a curva;
  • divulgação apenas dos modelos vencedores;
  • consultas repetidas ao mesmo holdout.

Complexidade não é apenas quantidade de parâmetros. Uma pesquisa com regra simples, mas milhares de variantes, também possui grande capacidade de seleção.


Sintomas, não diagnósticos automáticos

Um pico estreito de parâmetro, desempenho concentrado em poucos trades, queda forte fora da amostra, turnover incompatível com custos e lógica econômica fraca são sinais de fragilidade. Nenhum prova sozinho overfitting: uma relação real pode ser instável e um modelo sobreajustado pode continuar funcionando por algum tempo.

A diferença entre treino e teste ajuda, mas depende da incerteza e da forma de seleção. O foco é o processo completo, não uma única métrica.


Testes múltiplos e vencedor aparente

Com muitos candidatos, o máximo incorpora acaso. Candidatos correlacionados não equivalem a testes independentes, mas ainda aumentam o espaço de busca. White's Reality Check, Probability of Backtest Overfitting e Deflated Sharpe Ratio tratam aspectos dessa seleção sob premissas próprias. Nenhum substitui o registro das alternativas e uma hipótese econômica.


Protocolo de contenção

  1. Formular hipótese e critérios antes de observar o teste.
  2. Limitar a busca a variações economicamente justificadas.
  3. Registrar todos os candidatos, inclusive os negativos.
  4. Separar treino, seleção e teste final por tempo.
  5. Ajustar preprocessing apenas dentro de cada treino.
  6. Verificar regiões de parâmetros, subperíodos, ativos, custos e atrasos.
  7. Quantificar incerteza, dependência e multiplicidade.
  8. Congelar a versão antes de paper ou forward test.

Regularização, simplicidade e shrinkage podem reduzir variância, mas não corrigem dados ruins ou seleção retrospectiva.


Exemplo ilustrativo

Uma pesquisa testa 16 combinações de janela e limiar. Uma configuração produz Sharpe muito superior, enquanto as vizinhas são medíocres e o lucro vem de um único episódio. Escolher o pico e reportá-lo como se fosse o único teste superestima a evidência. Uma análise adequada preserva todas as combinações, explica a regra de escolha e verifica o comportamento fora da amostra.


Robustez e OOS não são provas definitivas

Uma estratégia pode passar no OOS por sorte, sobretudo se o segmento foi consultado repetidamente. Testes de robustez também podem ser escolhidos até obter resultado favorável. A evidência aumenta quando protocolo, tentativas, custos, dependência, subperíodos e prova prospectiva contam a mesma história, mas sempre permanece condicionada ao regime e ao modelo.


Graus de liberdade escondidos

Complexidade não é apenas o número de parâmetros do modelo. Escolher universo, período inicial, frequência, filtro, tratamento de outliers, função objetivo, benchmark e gráfico apresentado também cria graus de liberdade. Mesmo uma regra com dois números pode estar sobreajustada se nasceu depois de dezenas de decisões orientadas pelo mesmo histórico.

O controle começa com um diário de pesquisa: hipótese, variantes testadas, critério de descarte e resultado de cada uma. Especificações aparentadas são uma família, não descobertas independentes. Preferir regiões estáveis a um pico isolado, perturbar parâmetros e repetir em ativos ou períodos plausíveis ajuda a verificar se existe estrutura além do acaso.

A governança separa desenvolvimento e liberação do teste final, quando possível, e impede a substituição silenciosa do holdout. Isso não garante que o futuro repetirá o passado; torna visível quanto da evidência foi gasto na seleção e reduz a apresentação seletiva do vencedor.

Uma comparação honesta inclui uma especificação simples e plausível. Se a versão complexa melhora muito no treino, mas não preserva vantagem em janelas independentes, sob custos ou pequenas perturbações, a complexidade adicional não recebeu suporte suficiente. O foco não é premiar simplicidade por si só, mas exigir evidência proporcional às escolhas que o histórico permitiu fazer.

Limites

Não existe número universal de parâmetros, trades ou valor OOS que separe modelo válido de overfit. Estratégias realmente não lineares podem exigir complexidade; estratégias simples podem esconder ampla seleção. O diagnóstico é comparativo e processual.


Fontes

Conexões