Ir para o conteúdo

Out of sample

Avaliação em observações não usadas no desenvolvimento: separação temporal, pureza do teste, purging, embargo e walk-forward sem atalhos universais.

Em palavras simples — Out of sample é uma parte dos dados que não participou da construção da estratégia. Ela pergunta como uma regra já escolhida se comporta em observações posteriores.

Uma avaliação out of sample (OOS) usa observações que não foram usadas para estimar, ajustar ou selecionar a estratégia. Em séries financeiras, a separação é principalmente temporal: treinar no futuro e testar no passado quebraria a ordem real das decisões. OOS reduz a reutilização da amostra, mas não torna o resultado independente nem garante validade futura.

Splits temporais e walk-forwardHoldout, rolling e expanding respondem a perguntas diferentes. Proporções e janelas são ilustrativas; dependência, horizonte da label e regime orientam o desenho.Splits temporais e walk-forwardHoldout, rolling e expanding respondem a perguntas diferentesProporções e janelas são ilustrativas; dependência, horizonte da label e regime orientam o desenho.Holdout fixoDesenvolvimento e avaliação final ficam separados;cada consulta consome o teste.Rolling windowTreino e teste avançam com memória de comprimentoconstante.Expanding windowO treino acumula história enquanto cada testepermanece posterior.Teste final intactoPreserva avaliação distinta da seleção iterativa,quando a amostra permite.Cyclepedia · esquema educacional condicionado, não previsão nem promessa
Cada desenho responde a uma pergunta distinta; a proporção e os gaps dependem do horizonte e da dependência dos dados.

In-sample, validação, teste e forward não são sinônimos

Segmento Função
In-sample / treino estimar e desenvolver regras e parâmetros
Validação comparar candidatos e tomar decisões de seleção
Teste final / holdout avaliar a configuração já congelada
Forward test observar prospectivamente regras congeladas em dados novos

Quando a equipe vê o teste e altera uma feature, limiar, universo ou custo, o teste passou a informar o desenvolvimento. Ele não volta a ser intacto. O resultado pode continuar útil, mas precisa ser descrito como iteração, não como avaliação nunca consultada.


O split não tem proporção universal

Divisões como 70/30 não são leis. Um teste curto pode não conter regimes ou eventos suficientes; um treino curto pode estimar mal parâmetros. A escolha depende do horizonte do sinal, frequência, quantidade efetiva de observações, mudança estrutural, número de candidatos e uso da estratégia.

Datas adjacentes também não são necessariamente independentes. Labels que usam retornos futuros podem se sobrepor ao redor da fronteira; posições mantidas por vários dias compartilham o mesmo caminho; features de janela longa carregam informação próxima ao teste.


Purging e embargo

Purging remove do treino observações cujos intervalos informativos ou labels se sobrepõem ao teste. Embargo cria uma faixa adicional de separação para reduzir contaminação por proximidade. O tamanho não é arbitrário: relaciona-se ao horizonte da label, às janelas e à persistência do processo.

Esses procedimentos tratam uma forma de dependência. Não corrigem dados revisados, universo sobrevivente, seleção repetida ou custos irreais.


Protocolo de validação

  1. Fixar a pergunta, unidade de previsão e horizonte.
  2. Ordenar por tempo de disponibilidade, não apenas pela data econômica.
  3. Ajustar preprocessing somente no treino de cada split.
  4. Separar desenvolvimento, seleção e teste final.
  5. Aplicar gap, purging ou embargo quando houver sobreposição relevante.
  6. Registrar cada consulta e cada candidato.
  7. Agregar períodos de teste sem esconder dispersão, regimes ou concentração.
  8. Congelar especificação e critérios antes da prova prospectiva.

Walk-forward e teste final

No walk-forward, o modelo é estimado numa janela e avaliado no período seguinte; a origem avança e o processo se repete. A janela pode ser rolling, com tamanho constante, ou expanding, acumulando história. O desenho reproduz recalibrações temporais, mas os resultados de cada fold ainda podem influenciar a escolha do procedimento.

Quando os dados permitem, um teste final distinto preserva uma avaliação após as decisões de walk-forward. Quando não permitem, é melhor declarar a natureza iterativa e ampliar a incerteza do que fingir uma independência inexistente.


Exemplo ilustrativo

Uma estratégia mensal usa cinco anos para estimar parâmetros e avalia os seis meses seguintes. A janela avança seis meses. Como algumas labels medem retorno em três meses, observações de treino que atravessam a fronteira são removidas. Métricas são calculadas por fold e no conjunto, mostrando períodos negativos e custos. O exemplo não define janelas universais; explicita a lógica temporal.


Isolamento da decisão e agregação

O valor do teste depende do que permaneceu realmente desconhecido. Antes de abri-lo, devem estar congelados regra, parâmetros, universo, custos, benchmark e métricas. Se o pesquisador consulta o resultado e volta para ajustar a estratégia, aquele segmento passa a fazer parte do desenvolvimento; chamar uma segunda execução de “out of sample” não restaura sua independência.

Por isso, o registro de pesquisa deve ligar cada resultado à versão da especificação e contar alternativas examinadas, inclusive as abandonadas. Em um walk-forward, cada janela produz uma observação prospectiva distinta. Elas podem ser agregadas, mas convém manter também dispersão, pior janela, regimes e custos por período. Uma média única pode esconder que o método funciona somente em um episódio.

O teste final não transforma automaticamente uma hipótese em estratégia pronta. Ele estima comportamento sob um protocolo específico e uma história limitada. Paper trading e forward test acrescentam evidência sobre dados, latência e execução; monitoramento continua necessário depois da ativação.

Limites

Um bom OOS ainda pode coincidir com sorte, regime favorável ou seleção entre muitos projetos. Um OOS ruim pode refletir pouca amostra ou mudança real. O teste informa sobre determinado processo, período e escala; não certifica estabilidade futura. Robustez, registro de tentativas e forward test fornecem evidências complementares.


Fontes

Conexões