- Publicado em
- · 10 de julho de 2026
Regressão Linear: O que é, Como Modelar e Avaliar
- Blog

- Henrico Piubello
- Henrico Piubello
- Especialista de TI - Grupo Voitto
Especialista de TI - Grupo Voitto

A regressão linear é um método estatístico que modela a relação entre uma variável dependente e uma ou mais variáveis independentes por meio de uma reta. Ela encontra a linha que minimiza a diferença entre valores observados e previstos, servindo para prever valores contínuos e interpretar cada preditor.
- Como funciona a regressão linear?
- Quais são os pressupostos da regressão linear?
- Para que serve a regressão linear?
- Como preparar os dados para a regressão linear?
- Como avaliar um modelo de regressão linear?
- Como interpretar os coeficientes de regressão?
- Quais técnicas avançadas melhoram a regressão linear?
- Quais as limitações e extensões da regressão linear?
Como funciona a regressão linear?
A regressão linear ajusta uma função linear que liga a variável dependente (ou resposta) a uma ou mais variáveis independentes (ou preditoras). O objetivo é encontrar a reta que minimiza a soma dos quadrados dos resíduos — a diferença entre os valores reais e os previstos. Essa técnica, chamada de mínimos quadrados ordinários (OLS, do inglês Ordinary Least Squares), é a base da implementação LinearRegression do scikit-learn, que ajusta os coeficientes para minimizar o resíduo entre os alvos observados e os previstos.
O modelo pode ser expresso matematicamente como:
Onde:
- representa a variável dependente que estamos tentando prever.
- são as variáveis independentes que influenciam a variável dependente.
- são os coeficientes do modelo que representam a influência das variáveis independentes.
- é o termo de erro, que captura as discrepâncias entre os valores observados e os previstos.
A regressão linear assume que existe uma relação linear entre resposta e preditores, ou seja, o relacionamento pode ser representado por uma reta no espaço de dados. Mesmo quando a relação não é estritamente linear, o modelo costuma ser útil como uma primeira aproximação e como linha de base interpretável.
Quais são os pressupostos da regressão linear?
A regressão linear só produz resultados válidos e confiáveis quando alguns pressupostos são atendidos. Verificá-los antes de interpretar os coeficientes evita conclusões distorcidas. Os principais pressupostos são:
- Linearidade: existe uma relação linear entre as variáveis dependentes e independentes.
- Independência: os resíduos (diferença entre valores observados e previstos) não apresentam correlação entre si.
- Homocedasticidade: a variância dos resíduos é constante em todas as faixas de valores das variáveis independentes.
- Ausência de multicolinearidade: as variáveis independentes não estão altamente correlacionadas entre si, o que dificultaria a interpretação dos coeficientes.
- Ausência de outliers: não existem valores atípicos extremos que distorçam a estimativa dos coeficientes.
- Normalidade dos resíduos: os resíduos seguem uma distribuição normal, importante para testes estatísticos e intervalos de confiança.
Quando esses pressupostos são violados, técnicas adicionais como transformação de variáveis ou modelos alternativos ajudam a corrigir o problema. Compreender esses fundamentos é essencial para aplicar e interpretar a regressão linear corretamente em Ciência de Dados.
Para que serve a regressão linear?
A regressão linear tem uma ampla gama de aplicações em Ciência de Dados, sempre que o objetivo é prever um número ou entender o peso de cada fator. Ela é tão difundida que, na pesquisa State of Data Science and Machine Learning 2022 da Kaggle, a regressão linear e logística aparece como o método mais usado por cientistas de dados no trabalho. Alguns exemplos práticos:
- Previsão de vendas: estimar vendas com base em publicidade, preço, tendências históricas e outras variáveis relevantes.
- Análise de mercado: entender como fatores econômicos, demográficos ou sociais influenciam a demanda por um produto ou serviço.
- Análise de risco de crédito: modelar o risco de um indivíduo ou empresa a partir de histórico de pagamento, renda e idade.
- Previsão de demanda: antecipar a demanda futura com base em dados históricos de vendas, preços e concorrência.
- Análise de fatores de sucesso: identificar quais fatores mais influenciam o resultado de uma campanha ou lançamento.
Além da previsão, os coeficientes estimados revelam a direção e a magnitude da influência de cada variável, fornecendo insights valiosos para a tomada de decisão. É essa combinação de poder preditivo e interpretabilidade que mantém a regressão linear relevante mesmo diante de algoritmos mais complexos.
Como preparar os dados para a regressão linear?
A preparação adequada dos dados é crucial para obter resultados confiáveis com a regressão linear. Antes de ajustar o modelo, quatro etapas são fundamentais: análise exploratória, tratamento de dados faltantes, normalização e divisão em treino e teste.
A análise exploratória dos dados examina as características do conjunto, identifica padrões, detecta outliers e revela a distribuição das variáveis, orientando quais preditores incluir. Em seguida, o tratamento de dados faltantes lida com valores ausentes por exclusão, imputação simples (média, mediana) ou métodos avançados como o MICE (Multiple Imputation by Chained Equations), evitando viés no modelo.
A normalização e a padronização escalam as variáveis para intervalos como ou para média zero e desvio padrão um, evitando que diferenças de escala distorçam a comparação entre coeficientes. Por fim, a divisão dos dados em conjuntos de treinamento e teste permite ajustar os coeficientes em uma parte e avaliar o desempenho em dados não vistos, ajudando a detectar overfitting e a estimar de forma realista a capacidade de generalização do modelo.
Como avaliar um modelo de regressão linear?
A avaliação de uma regressão linear combina métricas quantitativas com análise de resíduos e validação cruzada. As métricas medem quão bem o modelo se ajusta aos dados e quão precisas são as previsões. As três mais usadas estão resumidas abaixo:
| Métrica | O que mede | Como interpretar |
|---|---|---|
| R² | Variância explicada pelo modelo | Quanto mais perto de 1, melhor |
| RMSE | Raiz do erro quadrático médio | Quanto menor, melhor o ajuste |
| MAE | Erro médio absoluto | Quanto menor, menos erro médio |
O que R², RMSE e MAE indicam?
O R² (coeficiente de determinação) indica a proporção da variância total da variável dependente explicada pelo modelo, variando de a . O RMSE (Root Mean Square Error, ou raiz do erro quadrático médio) é a raiz da média dos erros ao quadrado; consulte a definição de RMSE da Oracle para o cálculo completo. Já o MAE (Mean Absolute Error, ou erro médio absoluto) mede a magnitude média dos erros de previsão. Em RMSE e MAE, quanto menor o valor, melhor o ajuste do modelo.
Como funciona a análise de resíduos?
A análise de resíduos verifica se as diferenças entre valores observados e previstos atendem aos pressupostos de independência, homocedasticidade e normalidade. Ela usa gráficos como o gráfico de dispersão de resíduos, o gráfico de resíduos versus valores ajustados e o gráfico de normalidade. Esses gráficos revelam padrões ou desvios e indicam se o modelo captura adequadamente a informação dos dados.
Por que usar validação cruzada?
A validação cruzada avalia a capacidade preditiva do modelo dividindo os dados em treino e teste várias vezes, ajustando e medindo o desempenho em cada rodada. Ela verifica se o modelo generaliza para dados não vistos e ajuda a identificar overfitting, que ocorre quando o modelo se ajusta bem ao treino mas erra em dados novos. Assim, a validação cruzada fornece uma estimativa mais realista da eficácia futura do modelo.
Como interpretar os coeficientes de regressão?
Os coeficientes são o coração interpretável da regressão linear: cada um representa a mudança média esperada na variável dependente para cada unidade de mudança na variável independente, mantendo as demais constantes. Coeficientes positivos indicam relação positiva; negativos, relação inversa.
Por exemplo, numa regressão simples com uma variável independente e resposta , o coeficiente é a variação média em para cada unidade a mais em . Essa leitura permite entender a direção e a magnitude da relação entre preditores e resposta.
O que é significância estatística dos coeficientes?
Além da leitura direta, é preciso avaliar o significado estatístico de cada coeficiente por meio de testes de hipóteses, como o teste t ou o teste F. Um coeficiente é considerado estatisticamente significativo quando o valor p associado é menor que um nível de significância pré-definido (geralmente 0,05). Isso indica que o coeficiente difere de zero e tem efeito real sobre a variável dependente, dando base para inferências confiáveis.
Como comparar a influência das variáveis?
A interpretação dos coeficientes também revela a influência relativa de cada preditor. Coeficientes de maior magnitude apontam variáveis com impacto mais forte na resposta. Se, numa regressão múltipla, (associado a ) supera (associado a ) em magnitude, então influencia mais o resultado. Essa análise é útil para priorizar as variáveis mais relevantes na modelagem e na tomada de decisão.
Quais técnicas avançadas melhoram a regressão linear?
Diversas técnicas aprimoram a qualidade do modelo e resolvem desafios específicos da regressão linear, como overfitting, variáveis irrelevantes e outliers. As três mais importantes são a regularização, a seleção de características e o tratamento de outliers.
A regularização combate o overfitting penalizando a magnitude dos coeficientes. As formas mais comuns são a regularização Ridge (L2), que penaliza o quadrado dos coeficientes, e a regularização Lasso (L1), que penaliza o valor absoluto. Ambas são recomendadas pela documentação de modelos lineares do scikit-learn justamente porque, em dimensões altas, minimizar apenas o erro quadrático pode levar ao sobreajuste.
A seleção de características identifica as variáveis mais relevantes, descartando preditores irrelevantes que prejudicam o desempenho. Técnicas como seleção univariada, eliminação recursiva e métodos baseados em teste F reduzem a dimensionalidade e melhoram a interpretabilidade. Por fim, a detecção e o tratamento de outliers — via gráficos de dispersão, análise de resíduos, método dos quartis ou escore z — evitam que valores atípicos distorçam os coeficientes, seja excluindo-os, imputando substitutos ou usando técnicas robustas de regressão.
Quais as limitações e extensões da regressão linear?
A regressão linear é poderosa, mas tem limitações que exigem cautela. Ela pressupõe relação linear e resíduos normais; quando isso não ocorre, os resultados distorcem. É sensível a outliers, sofre com multicolinearidade entre preditores e não captura relações não lineares. Além disso, só modela variáveis incluídas: fatores importantes deixados de fora levam a informação perdida. A própria documentação do scikit-learn alerta que os coeficientes ficam instáveis quando as variáveis são fortemente correlacionadas.
Há ainda uma armadilha que nenhum diagnóstico de resíduo acusa: agregar grupos com perfis distintos pode inverter o sinal da relação estimada. É o paradoxo de Simpson, e ele derruba conclusões que parecem sólidas nos números agregados.
Para superar esses limites existem extensões. A Regressão Logística trata variáveis dependentes categóricas e é a base de muitos problemas de classificação. A Regressão Linear Generalizada (GLM) permite outras distribuições de probabilidade para a resposta, e a regressão de séries temporais lida com dependências temporais. Quando combinada com técnicas de machine learning, como árvores de decisão e ensembles, a regressão linear ganha capacidade de modelar relações mais complexas — um caminho natural para quem já domina os fundamentos e quer avançar em projetos de machine learning. Para aprofundar as variantes, o CodeCrush tem um guia dedicado aos tipos de regressão linear, como simples, múltipla, polinomial e regularizada.
Conclusão
A regressão linear continua sendo a primeira ferramenta que todo cientista de dados deveria dominar — não por ser a mais moderna, mas por ser a mais interpretável. Antes de partir para redes neurais ou ensembles, ajustar uma regressão linear bem preparada, validar seus pressupostos e ler seus coeficientes revela quase sempre a maior parte do que os dados têm a dizer. Trate-a como linha de base obrigatória: se um modelo complexo não superar de forma clara uma regressão linear honesta, a simplicidade e a transparência da reta quase sempre valem mais na prática.
Recomendações para este tema
Selecionados pela redação — só o que usaríamos.
Eficax Shop Informática e Games
Kit Mobilador Completo de Headset Hub 3.0 Mouse Gamer Led Pad Speed Suporte de Celular
DeinShop
Teclado Gamer Mecanico Profissional LED Rainbow Teclado Gamer Iluminação LED RGB USB ABNT2 Hoopson MJ-91
Bookcenter RJ
Kit Upgrade INTEL I5 4570 + Placa Intel H81 + Memória 8 GB+ Cooler
## faq
Perguntas frequentes
Para que serve a regressão linear?
A regressão linear serve para prever valores numéricos contínuos e quantificar como variáveis independentes influenciam uma variável dependente. É usada em previsão de vendas, análise de risco de crédito, estimativa de demanda e precificação, sempre que existe uma relação aproximadamente linear entre os fatores estudados.
Qual a diferença entre regressão linear simples e múltipla?
A regressão linear simples usa apenas uma variável independente para prever a variável dependente, resultando em uma reta. A regressão linear múltipla usa duas ou mais variáveis independentes, ajustando um plano ou hiperplano. A múltipla capta relações mais ricas, mas exige atenção à multicolinearidade entre preditores.
O que significa o R² na regressão linear?
O R² (coeficiente de determinação) indica a proporção da variância da variável dependente explicada pelo modelo. Varia de 0 a 1: perto de 1, o modelo explica quase toda a variação; perto de 0, quase nada. Sozinho ele não garante um bom modelo, por isso combine-o com RMSE e análise de resíduos.
Quando a regressão linear não deve ser usada?
Evite a regressão linear quando a relação entre as variáveis é claramente não linear, quando os resíduos violam homocedasticidade ou normalidade, ou quando há multicolinearidade forte e muitos outliers. Nesses casos, prefira transformações, modelos de árvore, regressão regularizada ou métodos não lineares.
Regressão linear é machine learning?
Sim. A regressão linear é um dos algoritmos supervisionados mais usados em machine learning para tarefas de regressão. Ela aprende coeficientes a partir de dados de treino e generaliza para novos exemplos. Sua simplicidade e interpretabilidade a tornam uma linha de base clássica antes de modelos mais complexos.
Temas deste artigo
## continue lendo
Artigos relacionados
Continue navegando
Artigo anterior

Gatekeeper: o que é e como protege o acesso digital
Entenda o que é o Gatekeeper, o mecanismo de controle de acesso que autentica usuários, aplica políticas de permissão e barra acessos não autorizados.
Leia maisPróximo artigo

Como Estudar Machine Learning: Guia de Métodos e Recursos
Para estudar Machine Learning, comece por Python, estatística e álgebra linear, avance para algoritmos e pratique em projetos reais no Kaggle.
Leia maisSobre o autor



