## glossário
O que é Overfitting?
Overfitting (sobreajuste) acontece quando um modelo de machine learning se ajusta excessivamente aos dados de treinamento, capturando não apenas os padrões reais mas também o ruído e as peculiaridades daquela amostra específica. O resultado é um modelo que vai muito bem no treino e mal em dados novos.
A analogia mais útil é a do estudante que decora as respostas da prova anterior em vez de entender a matéria: tira dez no simulado que já viu e reprova na prova de verdade.
Como identificar
O sinal característico é a divergência entre as curvas de erro. Enquanto o erro de treino continua caindo, o erro de validação estaciona e depois começa a subir — o ponto em que ele vira é onde o modelo parou de aprender e começou a decorar.
época erro_treino erro_validação
1 0.68 0.71
5 0.31 0.35
10 0.18 0.24 <- melhor ponto
20 0.07 0.29 <- validação piora
40 0.01 0.38 <- decorou o treino
# treino quase perfeito + validação ruim = overfittingO que causa
- Modelo complexo demais para a quantidade de dados disponível — parâmetros sobrando para memorizar exemplos.
- Dados de treino insuficientes ou pouco representativos da variedade real.
- Treino prolongado além do ponto em que o modelo já havia generalizado.
- Vazamento de dados — informação do conjunto de teste influenciando o treino, inflando artificialmente o desempenho.
- Atributos irrelevantes que oferecem ruído para o modelo se agarrar.
Técnicas para combater
Cada técnica ataca o problema por um ângulo diferente:
- Mais dados — a solução mais eficaz quando viável; dificulta a memorização.
- Regularização L1 e L2 — penaliza coeficientes grandes, mantendo o modelo mais simples. Base da regressão Ridge e Lasso.
- Validação cruzada — avalia em múltiplas divisões dos dados, dando estimativa mais confiável.
- Early stopping — interrompe o treino quando o erro de validação para de melhorar.
- Dropout — em redes neurais, desativa neurônios aleatoriamente durante o treino, impedindo dependências rígidas.
- Data augmentation — gera variações dos dados existentes (rotação, recorte, ruído) para ampliar a diversidade.
O extremo oposto: underfitting
Combater overfitting com excesso de zelo leva ao problema inverso. No underfitting, o modelo é simples demais para capturar os padrões e vai mal tanto no treino quanto na validação. O equilíbrio entre os dois é conhecido como trade-off viés-variância: modelos simples têm alto viés, modelos complexos têm alta variância, e o objetivo é o ponto intermediário. Técnicas de regularização aplicadas a regressão são detalhadas em tipos de regressão linear.
## faq
Perguntas frequentes
Como saber se meu modelo está com overfitting?
Compare o desempenho em treino e em validação. Se o erro de treino é muito baixo e o de validação é significativamente maior, há sobreajuste. Uma diferença grande e crescente entre as duas curvas ao longo das épocas é o indicador mais claro.
Overfitting sempre é ruim?
Sim, quando o objetivo é generalizar para dados novos — que é praticamente sempre. Um modelo sobreajustado é otimizado para dados que já não importam.
Aumentar os dados sempre resolve?
Ajuda muito, mas não é bala de prata. Se os dados novos vierem da mesma fonte enviesada ou se o modelo for excessivamente complexo para o problema, o sobreajuste pode persistir. Costuma ser necessário combinar mais dados com regularização e simplificação do modelo.