Início/ Conteúdos/ Vazamento: o modelo que olha para o futuro sem perceber
Laudo · Preditivo

Vazamento: o modelo que olha para o futuro sem perceber

Por que o modelo de churn que acerta 85% no passado falha no mês seguinte, e a arquitetura que evita isso.

1 de outubro de 20262 min de leituraBASTIDORES
Vazamento: o modelo que olha para o futuro sem perceber

Quase todo modelo de churn que "acerta 85%" tem o mesmo problema: está olhando para o futuro sem perceber.

Isso tem nome: vazamento. É quando o modelo usa, para prever um evento, uma informação que só existiria depois dele. No teste parece genial. Em produção, desaba.

No Signals, essa foi a regra técnica mais importante: todo sinal usado para prever o mês é medido só com o dado disponível no momento da decisão.

A arquitetura fez metade do trabalho:

  • um feature store por cliente e mês, com os sinais medidos point-in-time
  • uma tabela de labels separada, com o que aconteceu em cada mês
  • o backtest é um join entre as duas

De bônus, trocar "prever downgrade" por "prever churn" ou "prever ativação" virou trocar uma coluna, sem refazer pipeline.

E antes de qualquer modelo, a base foi validada contra a verdade conhecida: 30.452 eventos reconstruídos contra 30.454 do número oficial. Só depois disso eu confiei nela.

Kaufman e coautores escreveram em 2012 um artigo inteiro sobre isso, "Leakage in Data Mining". Continua atual.

Acurácia alta no passado não prova nada. Quando foi a última vez que você viu um modelo testado só com o que se sabia no dia?

Referências

  • Shachar Kaufman, Saharon Rosset, Claudia Perlich e Ori Stitelman, "Leakage in Data Mining: Formulation, Detection, and Avoidance", ACM TKDD (2012)
  • Foster Provost e Tom Fawcett, Data Science for Business (O'Reilly, 2013), trechos sobre avaliação e vazamento
  • Case: Signals

Quer que eu olhe isso na sua conta?

30 minutos, de graça. Entro nas suas plataformas e mostro os três problemas mais críticos de mensuração.

Quero meu diagnóstico grátis →