## glossário

O que é Overfitting?

Overfitting (sobreajuste) acontece quando um modelo de machine learning se ajusta excessivamente aos dados de treinamento, capturando não apenas os padrões reais mas também o ruído e as peculiaridades daquela amostra específica. O resultado é um modelo que vai muito bem no treino e mal em dados novos.

A analogia mais útil é a do estudante que decora as respostas da prova anterior em vez de entender a matéria: tira dez no simulado que já viu e reprova na prova de verdade.

Como identificar

O sinal característico é a divergência entre as curvas de erro. Enquanto o erro de treino continua caindo, o erro de validação estaciona e depois começa a subir — o ponto em que ele vira é onde o modelo parou de aprender e começou a decorar.

A assinatura numérica do overfitting
época   erro_treino   erro_validação
  1        0.68          0.71
  5        0.31          0.35
 10        0.18          0.24   <- melhor ponto
 20        0.07          0.29   <- validação piora
 40        0.01          0.38   <- decorou o treino

# treino quase perfeito + validação ruim = overfitting

O que causa

  • Modelo complexo demais para a quantidade de dados disponível — parâmetros sobrando para memorizar exemplos.
  • Dados de treino insuficientes ou pouco representativos da variedade real.
  • Treino prolongado além do ponto em que o modelo já havia generalizado.
  • Vazamento de dados — informação do conjunto de teste influenciando o treino, inflando artificialmente o desempenho.
  • Atributos irrelevantes que oferecem ruído para o modelo se agarrar.

Técnicas para combater

Cada técnica ataca o problema por um ângulo diferente:

  • Mais dados — a solução mais eficaz quando viável; dificulta a memorização.
  • Regularização L1 e L2 — penaliza coeficientes grandes, mantendo o modelo mais simples. Base da regressão Ridge e Lasso.
  • Validação cruzada — avalia em múltiplas divisões dos dados, dando estimativa mais confiável.
  • Early stopping — interrompe o treino quando o erro de validação para de melhorar.
  • Dropout — em redes neurais, desativa neurônios aleatoriamente durante o treino, impedindo dependências rígidas.
  • Data augmentation — gera variações dos dados existentes (rotação, recorte, ruído) para ampliar a diversidade.

O extremo oposto: underfitting

Combater overfitting com excesso de zelo leva ao problema inverso. No underfitting, o modelo é simples demais para capturar os padrões e vai mal tanto no treino quanto na validação. O equilíbrio entre os dois é conhecido como trade-off viés-variância: modelos simples têm alto viés, modelos complexos têm alta variância, e o objetivo é o ponto intermediário. Técnicas de regularização aplicadas a regressão são detalhadas em tipos de regressão linear.

## faq

Perguntas frequentes

Como saber se meu modelo está com overfitting?

Compare o desempenho em treino e em validação. Se o erro de treino é muito baixo e o de validação é significativamente maior, há sobreajuste. Uma diferença grande e crescente entre as duas curvas ao longo das épocas é o indicador mais claro.

Overfitting sempre é ruim?

Sim, quando o objetivo é generalizar para dados novos — que é praticamente sempre. Um modelo sobreajustado é otimizado para dados que já não importam.

Aumentar os dados sempre resolve?

Ajuda muito, mas não é bala de prata. Se os dados novos vierem da mesma fonte enviesada ou se o modelo for excessivamente complexo para o problema, o sobreajuste pode persistir. Costuma ser necessário combinar mais dados com regularização e simplificação do modelo.