- Publicado em
- · 10 de julho de 2026
Regressão Linear: O que é, Como Modelar e Avaliar
- Blog

- Henrico Piubello
- Henrico Piubello
- Especialista de TI - Grupo Voitto
Especialista de TI - Grupo Voitto

A regressão linear é um método estatístico que modela a relação entre uma variável dependente e uma ou mais variáveis independentes por meio de uma reta. Ela encontra a linha que minimiza a diferença entre valores observados e previstos, servindo para prever valores contínuos e interpretar cada preditor.
- Como funciona a regressão linear?
- Quais são os pressupostos da regressão linear?
- Para que serve a regressão linear?
- Como preparar os dados para a regressão linear?
- Como avaliar um modelo de regressão linear?
- Como interpretar os coeficientes de regressão?
- Quais técnicas avançadas melhoram a regressão linear?
- Quais as limitações e extensões da regressão linear?
Como funciona a regressão linear?
A regressão linear ajusta uma função linear que liga a variável dependente (ou resposta) a uma ou mais variáveis independentes (ou preditoras). O objetivo é encontrar a reta que minimiza a soma dos quadrados dos resíduos — a diferença entre os valores reais e os previstos. Essa técnica, chamada de mínimos quadrados ordinários (OLS, do inglês Ordinary Least Squares), é a base da implementação LinearRegression do scikit-learn, que ajusta os coeficientes para minimizar o resíduo entre os alvos observados e os previstos.
O modelo pode ser expresso matematicamente como:
Onde:
- representa a variável dependente que estamos tentando prever.
- são as variáveis independentes que influenciam a variável dependente.
- são os coeficientes do modelo que representam a influência das variáveis independentes.
- é o termo de erro, que captura as discrepâncias entre os valores observados e os previstos.
A regressão linear assume que existe uma relação linear entre resposta e preditores, ou seja, o relacionamento pode ser representado por uma reta no espaço de dados. Mesmo quando a relação não é estritamente linear, o modelo costuma ser útil como uma primeira aproximação e como linha de base interpretável.
Quais são os pressupostos da regressão linear?
A regressão linear só produz resultados válidos e confiáveis quando alguns pressupostos são atendidos. Verificá-los antes de interpretar os coeficientes evita conclusões distorcidas. Os principais pressupostos são:
- Linearidade: existe uma relação linear entre as variáveis dependentes e independentes.
- Independência: os resíduos (diferença entre valores observados e previstos) não apresentam correlação entre si.
- Homocedasticidade: a variância dos resíduos é constante em todas as faixas de valores das variáveis independentes.
- Ausência de multicolinearidade: as variáveis independentes não estão altamente correlacionadas entre si, o que dificultaria a interpretação dos coeficientes.
- Ausência de outliers: não existem valores atípicos extremos que distorçam a estimativa dos coeficientes.
- Normalidade dos resíduos: os resíduos seguem uma distribuição normal, importante para testes estatísticos e intervalos de confiança.
Quando esses pressupostos são violados, técnicas adicionais como transformação de variáveis ou modelos alternativos ajudam a corrigir o problema. Compreender esses fundamentos é essencial para aplicar e interpretar a regressão linear corretamente em Ciência de Dados.
Para que serve a regressão linear?
A regressão linear tem uma ampla gama de aplicações em Ciência de Dados, sempre que o objetivo é prever um número ou entender o peso de cada fator. Ela é tão difundida que, na pesquisa State of Data Science and Machine Learning 2022 da Kaggle, a regressão linear e logística aparece como o método mais usado por cientistas de dados no trabalho. Alguns exemplos práticos:
- Previsão de vendas: estimar vendas com base em publicidade, preço, tendências históricas e outras variáveis relevantes.
- Análise de mercado: entender como fatores econômicos, demográficos ou sociais influenciam a demanda por um produto ou serviço.
- Análise de risco de crédito: modelar o risco de um indivíduo ou empresa a partir de histórico de pagamento, renda e idade.
- Previsão de demanda: antecipar a demanda futura com base em dados históricos de vendas, preços e concorrência.
- Análise de fatores de sucesso: identificar quais fatores mais influenciam o resultado de uma campanha ou lançamento.
Além da previsão, os coeficientes estimados revelam a direção e a magnitude da influência de cada variável, fornecendo insights valiosos para a tomada de decisão. É essa combinação de poder preditivo e interpretabilidade que mantém a regressão linear relevante mesmo diante de algoritmos mais complexos.
Como preparar os dados para a regressão linear?
A preparação adequada dos dados é crucial para obter resultados confiáveis com a regressão linear. Antes de ajustar o modelo, quatro etapas são fundamentais: análise exploratória, tratamento de dados faltantes, normalização e divisão em treino e teste.
A análise exploratória dos dados examina as características do conjunto, identifica padrões, detecta outliers e revela a distribuição das variáveis, orientando quais preditores incluir. Em seguida, o tratamento de dados faltantes lida com valores ausentes por exclusão, imputação simples (média, mediana) ou métodos avançados como o MICE (Multiple Imputation by Chained Equations), evitando viés no modelo.
A normalização e a padronização escalam as variáveis para intervalos como ou para média zero e desvio padrão um, evitando que diferenças de escala distorçam a comparação entre coeficientes. Por fim, a divisão dos dados em conjuntos de treinamento e teste permite ajustar os coeficientes em uma parte e avaliar o desempenho em dados não vistos, ajudando a detectar overfitting e a estimar de forma realista a capacidade de generalização do modelo.
Como avaliar um modelo de regressão linear?
A avaliação de uma regressão linear combina métricas quantitativas com análise de resíduos e validação cruzada. As métricas medem quão bem o modelo se ajusta aos dados e quão precisas são as previsões. As três mais usadas estão resumidas abaixo:
| Métrica | O que mede | Como interpretar |
|---|---|---|
| R² | Variância explicada pelo modelo | Quanto mais perto de 1, melhor |
| RMSE | Raiz do erro quadrático médio | Quanto menor, melhor o ajuste |
| MAE | Erro médio absoluto | Quanto menor, menos erro médio |
O que R², RMSE e MAE indicam?
O R² (coeficiente de determinação) indica a proporção da variância total da variável dependente explicada pelo modelo, variando de a . O RMSE (Root Mean Square Error, ou raiz do erro quadrático médio) é a raiz da média dos erros ao quadrado; consulte a definição de RMSE da Oracle para o cálculo completo. Já o MAE (Mean Absolute Error, ou erro médio absoluto) mede a magnitude média dos erros de previsão. Em RMSE e MAE, quanto menor o valor, melhor o ajuste do modelo.
Como funciona a análise de resíduos?
A análise de resíduos verifica se as diferenças entre valores observados e previstos atendem aos pressupostos de independência, homocedasticidade e normalidade. Ela usa gráficos como o gráfico de dispersão de resíduos, o gráfico de resíduos versus valores ajustados e o gráfico de normalidade. Esses gráficos revelam padrões ou desvios e indicam se o modelo captura adequadamente a informação dos dados.
Por que usar validação cruzada?
A validação cruzada avalia a capacidade preditiva do modelo dividindo os dados em treino e teste várias vezes, ajustando e medindo o desempenho em cada rodada. Ela verifica se o modelo generaliza para dados não vistos e ajuda a identificar overfitting, que ocorre quando o modelo se ajusta bem ao treino mas erra em dados novos. Assim, a validação cruzada fornece uma estimativa mais realista da eficácia futura do modelo.
Como interpretar os coeficientes de regressão?
Os coeficientes são o coração interpretável da regressão linear: cada um representa a mudança média esperada na variável dependente para cada unidade de mudança na variável independente, mantendo as demais constantes. Coeficientes positivos indicam relação positiva; negativos, relação inversa.
Por exemplo, numa regressão simples com uma variável independente e resposta , o coeficiente é a variação média em para cada unidade a mais em . Essa leitura permite entender a direção e a magnitude da relação entre preditores e resposta.
O que é significância estatística dos coeficientes?
Além da leitura direta, é preciso avaliar o significado estatístico de cada coeficiente por meio de testes de hipóteses, como o teste t ou o teste F. Um coeficiente é considerado estatisticamente significativo quando o valor p associado é menor que um nível de significância pré-definido (geralmente 0,05). Isso indica que o coeficiente difere de zero e tem efeito real sobre a variável dependente, dando base para inferências confiáveis.
Como comparar a influência das variáveis?
A interpretação dos coeficientes também revela a influência relativa de cada preditor. Coeficientes de maior magnitude apontam variáveis com impacto mais forte na resposta. Se, numa regressão múltipla, (associado a ) supera (associado a ) em magnitude, então influencia mais o resultado. Essa análise é útil para priorizar as variáveis mais relevantes na modelagem e na tomada de decisão.
Quais técnicas avançadas melhoram a regressão linear?
Diversas técnicas aprimoram a qualidade do modelo e resolvem desafios específicos da regressão linear, como overfitting, variáveis irrelevantes e outliers. As três mais importantes são a regularização, a seleção de características e o tratamento de outliers.
A regularização combate o overfitting penalizando a magnitude dos coeficientes. As formas mais comuns são a regularização Ridge (L2), que penaliza o quadrado dos coeficientes, e a regularização Lasso (L1), que penaliza o valor absoluto. Ambas são recomendadas pela documentação de modelos lineares do scikit-learn justamente porque, em dimensões altas, minimizar apenas o erro quadrático pode levar ao sobreajuste.
A seleção de características identifica as variáveis mais relevantes, descartando preditores irrelevantes que prejudicam o desempenho. Técnicas como seleção univariada, eliminação recursiva e métodos baseados em teste F reduzem a dimensionalidade e melhoram a interpretabilidade. Por fim, a detecção e o tratamento de outliers — via gráficos de dispersão, análise de resíduos, método dos quartis ou escore z — evitam que valores atípicos distorçam os coeficientes, seja excluindo-os, imputando substitutos ou usando técnicas robustas de regressão.
Quais as limitações e extensões da regressão linear?
A regressão linear é poderosa, mas tem limitações que exigem cautela. Ela pressupõe relação linear e resíduos normais; quando isso não ocorre, os resultados distorcem. É sensível a outliers, sofre com multicolinearidade entre preditores e não captura relações não lineares. Além disso, só modela variáveis incluídas: fatores importantes deixados de fora levam a informação perdida. A própria documentação do scikit-learn alerta que os coeficientes ficam instáveis quando as variáveis são fortemente correlacionadas.
Para superar esses limites existem extensões. A Regressão Logística trata variáveis dependentes categóricas e é a base de muitos problemas de classificação. A Regressão Linear Generalizada (GLM) permite outras distribuições de probabilidade para a resposta, e a regressão de séries temporais lida com dependências temporais. Quando combinada com técnicas de machine learning, como árvores de decisão e ensembles, a regressão linear ganha capacidade de modelar relações mais complexas — um caminho natural para quem já domina os fundamentos e quer avançar em projetos de machine learning. Para aprofundar as variantes, o CodeCrush tem um guia dedicado aos tipos de regressão linear, como simples, múltipla, polinomial e regularizada.
Conclusão
A regressão linear continua sendo a primeira ferramenta que todo cientista de dados deveria dominar — não por ser a mais moderna, mas por ser a mais interpretável. Antes de partir para redes neurais ou ensembles, ajustar uma regressão linear bem preparada, validar seus pressupostos e ler seus coeficientes revela quase sempre a maior parte do que os dados têm a dizer. Trate-a como linha de base obrigatória: se um modelo complexo não superar de forma clara uma regressão linear honesta, a simplicidade e a transparência da reta quase sempre valem mais na prática.
## faq
Perguntas frequentes
Para que serve a regressão linear?
A regressão linear serve para prever valores numéricos contínuos e quantificar como variáveis independentes influenciam uma variável dependente. É usada em previsão de vendas, análise de risco de crédito, estimativa de demanda e precificação, sempre que existe uma relação aproximadamente linear entre os fatores estudados.
Qual a diferença entre regressão linear simples e múltipla?
A regressão linear simples usa apenas uma variável independente para prever a variável dependente, resultando em uma reta. A regressão linear múltipla usa duas ou mais variáveis independentes, ajustando um plano ou hiperplano. A múltipla capta relações mais ricas, mas exige atenção à multicolinearidade entre preditores.
O que significa o R² na regressão linear?
O R² (coeficiente de determinação) indica a proporção da variância da variável dependente explicada pelo modelo. Varia de 0 a 1: perto de 1, o modelo explica quase toda a variação; perto de 0, quase nada. Sozinho ele não garante um bom modelo, por isso combine-o com RMSE e análise de resíduos.
Quando a regressão linear não deve ser usada?
Evite a regressão linear quando a relação entre as variáveis é claramente não linear, quando os resíduos violam homocedasticidade ou normalidade, ou quando há multicolinearidade forte e muitos outliers. Nesses casos, prefira transformações, modelos de árvore, regressão regularizada ou métodos não lineares.
Regressão linear é machine learning?
Sim. A regressão linear é um dos algoritmos supervisionados mais usados em machine learning para tarefas de regressão. Ela aprende coeficientes a partir de dados de treino e generaliza para novos exemplos. Sua simplicidade e interpretabilidade a tornam uma linha de base clássica antes de modelos mais complexos.
Temas deste artigo
## continue lendo
Artigos relacionados
Continue navegando
Artigo anterior

Gatekeeper: o que é e como protege o acesso digital
Entenda o que é o Gatekeeper, o mecanismo de controle de acesso que autentica usuários, aplica políticas de permissão e barra acessos não autorizados.
Leia maisPróximo artigo

Como Estudar Machine Learning: Guia de Métodos e Recursos
Para estudar Machine Learning, comece por Python, estatística e álgebra linear, avance para algoritmos e pratique em projetos reais no Kaggle.
Leia maisSobre o autor



