Publicado em
· 10 de julho de 2026

Regressão Linear: O que é, Como Modelar e Avaliar

Blog
  • Foto de Henrico Piubello
    Henrico Piubello
    Henrico Piubello
    Especialista de TI - Grupo Voitto

    Especialista de TI - Grupo Voitto

Gráfico colorido de dispersão com uma reta de regressão linear atravessando os pontos de dados

A regressão linear é um método estatístico que modela a relação entre uma variável dependente e uma ou mais variáveis independentes por meio de uma reta. Ela encontra a linha que minimiza a diferença entre valores observados e previstos, servindo para prever valores contínuos e interpretar cada preditor.

Como funciona a regressão linear?

A regressão linear ajusta uma função linear que liga a variável dependente (ou resposta) a uma ou mais variáveis independentes (ou preditoras). O objetivo é encontrar a reta que minimiza a soma dos quadrados dos resíduos — a diferença entre os valores reais e os previstos. Essa técnica, chamada de mínimos quadrados ordinários (OLS, do inglês Ordinary Least Squares), é a base da implementação LinearRegression do scikit-learn, que ajusta os coeficientes para minimizar o resíduo entre os alvos observados e os previstos.

O modelo pode ser expresso matematicamente como:

Y=β0+β1X1+β2X2+...+βnXn+εY = β0 + β1X1 + β2X2 + ... + βn*Xn + ε

Onde:

  • YY representa a variável dependente que estamos tentando prever.
  • X1,X2,...,XnX1, X2, ..., Xn são as variáveis independentes que influenciam a variável dependente.
  • β0,β1,β2,...,βnβ0, β1, β2, ..., βn são os coeficientes do modelo que representam a influência das variáveis independentes.
  • εε é o termo de erro, que captura as discrepâncias entre os valores observados e os previstos.

A regressão linear assume que existe uma relação linear entre resposta e preditores, ou seja, o relacionamento pode ser representado por uma reta no espaço de dados. Mesmo quando a relação não é estritamente linear, o modelo costuma ser útil como uma primeira aproximação e como linha de base interpretável.

Quais são os pressupostos da regressão linear?

A regressão linear só produz resultados válidos e confiáveis quando alguns pressupostos são atendidos. Verificá-los antes de interpretar os coeficientes evita conclusões distorcidas. Os principais pressupostos são:

  1. Linearidade: existe uma relação linear entre as variáveis dependentes e independentes.
  2. Independência: os resíduos (diferença entre valores observados e previstos) não apresentam correlação entre si.
  3. Homocedasticidade: a variância dos resíduos é constante em todas as faixas de valores das variáveis independentes.
  4. Ausência de multicolinearidade: as variáveis independentes não estão altamente correlacionadas entre si, o que dificultaria a interpretação dos coeficientes.
  5. Ausência de outliers: não existem valores atípicos extremos que distorçam a estimativa dos coeficientes.
  6. Normalidade dos resíduos: os resíduos seguem uma distribuição normal, importante para testes estatísticos e intervalos de confiança.

Quando esses pressupostos são violados, técnicas adicionais como transformação de variáveis ou modelos alternativos ajudam a corrigir o problema. Compreender esses fundamentos é essencial para aplicar e interpretar a regressão linear corretamente em Ciência de Dados.

Para que serve a regressão linear?

A regressão linear tem uma ampla gama de aplicações em Ciência de Dados, sempre que o objetivo é prever um número ou entender o peso de cada fator. Ela é tão difundida que, na pesquisa State of Data Science and Machine Learning 2022 da Kaggle, a regressão linear e logística aparece como o método mais usado por cientistas de dados no trabalho. Alguns exemplos práticos:

  1. Previsão de vendas: estimar vendas com base em publicidade, preço, tendências históricas e outras variáveis relevantes.
  2. Análise de mercado: entender como fatores econômicos, demográficos ou sociais influenciam a demanda por um produto ou serviço.
  3. Análise de risco de crédito: modelar o risco de um indivíduo ou empresa a partir de histórico de pagamento, renda e idade.
  4. Previsão de demanda: antecipar a demanda futura com base em dados históricos de vendas, preços e concorrência.
  5. Análise de fatores de sucesso: identificar quais fatores mais influenciam o resultado de uma campanha ou lançamento.

Além da previsão, os coeficientes estimados revelam a direção e a magnitude da influência de cada variável, fornecendo insights valiosos para a tomada de decisão. É essa combinação de poder preditivo e interpretabilidade que mantém a regressão linear relevante mesmo diante de algoritmos mais complexos.

Como preparar os dados para a regressão linear?

A preparação adequada dos dados é crucial para obter resultados confiáveis com a regressão linear. Antes de ajustar o modelo, quatro etapas são fundamentais: análise exploratória, tratamento de dados faltantes, normalização e divisão em treino e teste.

A análise exploratória dos dados examina as características do conjunto, identifica padrões, detecta outliers e revela a distribuição das variáveis, orientando quais preditores incluir. Em seguida, o tratamento de dados faltantes lida com valores ausentes por exclusão, imputação simples (média, mediana) ou métodos avançados como o MICE (Multiple Imputation by Chained Equations), evitando viés no modelo.

A normalização e a padronização escalam as variáveis para intervalos como [0,1][0, 1] ou para média zero e desvio padrão um, evitando que diferenças de escala distorçam a comparação entre coeficientes. Por fim, a divisão dos dados em conjuntos de treinamento e teste permite ajustar os coeficientes em uma parte e avaliar o desempenho em dados não vistos, ajudando a detectar overfitting e a estimar de forma realista a capacidade de generalização do modelo.

Como avaliar um modelo de regressão linear?

A avaliação de uma regressão linear combina métricas quantitativas com análise de resíduos e validação cruzada. As métricas medem quão bem o modelo se ajusta aos dados e quão precisas são as previsões. As três mais usadas estão resumidas abaixo:

MétricaO que medeComo interpretar
Variância explicada pelo modeloQuanto mais perto de 1, melhor
RMSERaiz do erro quadrático médioQuanto menor, melhor o ajuste
MAEErro médio absolutoQuanto menor, menos erro médio

O que R², RMSE e MAE indicam?

O R² (coeficiente de determinação) indica a proporção da variância total da variável dependente explicada pelo modelo, variando de 00 a 11. O RMSE (Root Mean Square Error, ou raiz do erro quadrático médio) é a raiz da média dos erros ao quadrado; consulte a definição de RMSE da Oracle para o cálculo completo. Já o MAE (Mean Absolute Error, ou erro médio absoluto) mede a magnitude média dos erros de previsão. Em RMSE e MAE, quanto menor o valor, melhor o ajuste do modelo.

Como funciona a análise de resíduos?

A análise de resíduos verifica se as diferenças entre valores observados e previstos atendem aos pressupostos de independência, homocedasticidade e normalidade. Ela usa gráficos como o gráfico de dispersão de resíduos, o gráfico de resíduos versus valores ajustados e o gráfico de normalidade. Esses gráficos revelam padrões ou desvios e indicam se o modelo captura adequadamente a informação dos dados.

Por que usar validação cruzada?

A validação cruzada avalia a capacidade preditiva do modelo dividindo os dados em treino e teste várias vezes, ajustando e medindo o desempenho em cada rodada. Ela verifica se o modelo generaliza para dados não vistos e ajuda a identificar overfitting, que ocorre quando o modelo se ajusta bem ao treino mas erra em dados novos. Assim, a validação cruzada fornece uma estimativa mais realista da eficácia futura do modelo.

Como interpretar os coeficientes de regressão?

Os coeficientes são o coração interpretável da regressão linear: cada um representa a mudança média esperada na variável dependente para cada unidade de mudança na variável independente, mantendo as demais constantes. Coeficientes positivos indicam relação positiva; negativos, relação inversa.

Por exemplo, numa regressão simples com uma variável independente XX e resposta YY, o coeficiente β1β₁ é a variação média em YY para cada unidade a mais em XX. Essa leitura permite entender a direção e a magnitude da relação entre preditores e resposta.

O que é significância estatística dos coeficientes?

Além da leitura direta, é preciso avaliar o significado estatístico de cada coeficiente por meio de testes de hipóteses, como o teste t ou o teste F. Um coeficiente é considerado estatisticamente significativo quando o valor p associado é menor que um nível de significância pré-definido (geralmente 0,05). Isso indica que o coeficiente difere de zero e tem efeito real sobre a variável dependente, dando base para inferências confiáveis.

Como comparar a influência das variáveis?

A interpretação dos coeficientes também revela a influência relativa de cada preditor. Coeficientes de maior magnitude apontam variáveis com impacto mais forte na resposta. Se, numa regressão múltipla, β1β₁ (associado a X1X₁) supera β2β₂ (associado a X2X₂) em magnitude, então X1X₁ influencia mais o resultado. Essa análise é útil para priorizar as variáveis mais relevantes na modelagem e na tomada de decisão.

Quais técnicas avançadas melhoram a regressão linear?

Diversas técnicas aprimoram a qualidade do modelo e resolvem desafios específicos da regressão linear, como overfitting, variáveis irrelevantes e outliers. As três mais importantes são a regularização, a seleção de características e o tratamento de outliers.

A regularização combate o overfitting penalizando a magnitude dos coeficientes. As formas mais comuns são a regularização Ridge (L2), que penaliza o quadrado dos coeficientes, e a regularização Lasso (L1), que penaliza o valor absoluto. Ambas são recomendadas pela documentação de modelos lineares do scikit-learn justamente porque, em dimensões altas, minimizar apenas o erro quadrático pode levar ao sobreajuste.

A seleção de características identifica as variáveis mais relevantes, descartando preditores irrelevantes que prejudicam o desempenho. Técnicas como seleção univariada, eliminação recursiva e métodos baseados em teste F reduzem a dimensionalidade e melhoram a interpretabilidade. Por fim, a detecção e o tratamento de outliers — via gráficos de dispersão, análise de resíduos, método dos quartis ou escore z — evitam que valores atípicos distorçam os coeficientes, seja excluindo-os, imputando substitutos ou usando técnicas robustas de regressão.

Quais as limitações e extensões da regressão linear?

A regressão linear é poderosa, mas tem limitações que exigem cautela. Ela pressupõe relação linear e resíduos normais; quando isso não ocorre, os resultados distorcem. É sensível a outliers, sofre com multicolinearidade entre preditores e não captura relações não lineares. Além disso, só modela variáveis incluídas: fatores importantes deixados de fora levam a informação perdida. A própria documentação do scikit-learn alerta que os coeficientes ficam instáveis quando as variáveis são fortemente correlacionadas.

Para superar esses limites existem extensões. A Regressão Logística trata variáveis dependentes categóricas e é a base de muitos problemas de classificação. A Regressão Linear Generalizada (GLM) permite outras distribuições de probabilidade para a resposta, e a regressão de séries temporais lida com dependências temporais. Quando combinada com técnicas de machine learning, como árvores de decisão e ensembles, a regressão linear ganha capacidade de modelar relações mais complexas — um caminho natural para quem já domina os fundamentos e quer avançar em projetos de machine learning. Para aprofundar as variantes, o CodeCrush tem um guia dedicado aos tipos de regressão linear, como simples, múltipla, polinomial e regularizada.

Conclusão

A regressão linear continua sendo a primeira ferramenta que todo cientista de dados deveria dominar — não por ser a mais moderna, mas por ser a mais interpretável. Antes de partir para redes neurais ou ensembles, ajustar uma regressão linear bem preparada, validar seus pressupostos e ler seus coeficientes revela quase sempre a maior parte do que os dados têm a dizer. Trate-a como linha de base obrigatória: se um modelo complexo não superar de forma clara uma regressão linear honesta, a simplicidade e a transparência da reta quase sempre valem mais na prática.

## faq

Perguntas frequentes

Para que serve a regressão linear?

A regressão linear serve para prever valores numéricos contínuos e quantificar como variáveis independentes influenciam uma variável dependente. É usada em previsão de vendas, análise de risco de crédito, estimativa de demanda e precificação, sempre que existe uma relação aproximadamente linear entre os fatores estudados.

Qual a diferença entre regressão linear simples e múltipla?

A regressão linear simples usa apenas uma variável independente para prever a variável dependente, resultando em uma reta. A regressão linear múltipla usa duas ou mais variáveis independentes, ajustando um plano ou hiperplano. A múltipla capta relações mais ricas, mas exige atenção à multicolinearidade entre preditores.

O que significa o R² na regressão linear?

O R² (coeficiente de determinação) indica a proporção da variância da variável dependente explicada pelo modelo. Varia de 0 a 1: perto de 1, o modelo explica quase toda a variação; perto de 0, quase nada. Sozinho ele não garante um bom modelo, por isso combine-o com RMSE e análise de resíduos.

Quando a regressão linear não deve ser usada?

Evite a regressão linear quando a relação entre as variáveis é claramente não linear, quando os resíduos violam homocedasticidade ou normalidade, ou quando há multicolinearidade forte e muitos outliers. Nesses casos, prefira transformações, modelos de árvore, regressão regularizada ou métodos não lineares.

Regressão linear é machine learning?

Sim. A regressão linear é um dos algoritmos supervisionados mais usados em machine learning para tarefas de regressão. Ela aprende coeficientes a partir de dados de treino e generaliza para novos exemplos. Sua simplicidade e interpretabilidade a tornam uma linha de base clássica antes de modelos mais complexos.

Temas deste artigo

## continue lendo

Continue navegando

Sobre o autor

Foto de Henrico Piubello

Henrico Piubello

Especialista de TI - Grupo Voitto · Grupo Voitto

Ver perfil e todos os artigos