Publicado em
· 10 de julho de 2026

Distância Euclidiana: O Que É, Fórmula e Usos em Python

Blog
  • Foto de Henrico Piubello
    Henrico Piubello
    Henrico Piubello
    Especialista de TI - Grupo Voitto

    Especialista de TI - Grupo Voitto

Ilustração da distância euclidiana aplicada à localização de pessoas por GPS

A distância euclidiana é a medida do segmento de reta mais curto entre dois pontos, calculada pela raiz quadrada da soma dos quadrados das diferenças entre as coordenadas. Em programação e ciência de dados, ela quantifica a similaridade entre registros e sustenta algoritmos como KNN e K-Means.

O que é distância euclidiana?

A distância euclidiana é uma métrica que mede o comprimento do segmento de reta entre dois pontos em um espaço euclidiano — o menor caminho possível entre eles. Derivada do teorema de Pitágoras, ela vale tanto para o plano bidimensional quanto para espaços com qualquer número de dimensões, o que a torna a medida direta mais usada em geometria e em análise de dados.

A fórmula geral para dois pontos p e q com n dimensões é:

d(p, q) = √((q₁ - p₁)² + (q₂ - p₂)² + ... + (qₙ - pₙ)²)

Para dois pontos em um plano, (x₁, y₁) e (x₂, y₂), a expressão se reduz a √((x₂ - x₁)² + (y₂ - y₁)²). Na prática da programação, cada ponto costuma representar um registro de dados — as preferências de um usuário, os atributos de um produto — e vale a regra central desta métrica: quanto menor a distância euclidiana entre dois conjuntos de dados, maior a similaridade entre eles.

Qual a diferença entre distância euclidiana e outras métricas?

A distância euclidiana mede o caminho em linha reta entre dois pontos, enquanto métricas como Manhattan, cosseno e Hamming medem diferenças por eixo, ângulo entre vetores ou posições divergentes. A escolha depende do tipo de dado e do que o modelo de machine learning precisa capturar.

MétricaComo medeUso típico
EuclidianaLinha reta entre dois pontosKNN, K-Means, dados contínuos
ManhattanSoma das diferenças absolutasAlta dimensionalidade, outliers
CossenoÂngulo entre vetoresTextos e sistemas de recomendação
MinkowskiGeneraliza Euclidiana e ManhattanAjuste fino via parâmetro p
HammingPosições diferentes entre símbolosDados categóricos e binários

Um cuidado importante: a distância euclidiana é sensível à escala das variáveis. Se uma coluna varia de 0 a 1 e outra de 0 a 10.000, a segunda domina o cálculo. Por isso, normalizar ou padronizar os dados antes de medir distâncias é etapa obrigatória em qualquer pipeline sério de análise.

Como calcular a distância euclidiana em Python?

Em Python, a distância euclidiana se calcula com a função math.dist da biblioteca padrão — disponível desde o Python 3.8, segundo a documentação oficial — ou com numpy.linalg.norm para vetores de qualquer dimensão. Para começar do zero, o roteiro é simples:

  1. Importe o módulo math (ou o NumPy, para vetores multidimensionais).
  2. Defina os dois pontos como tuplas ou arrays de coordenadas.
  3. Calcule a raiz quadrada da soma dos quadrados das diferenças entre as coordenadas.
import math

def distancia_euclidiana(ponto1, ponto2):
    x1, y1 = ponto1
    x2, y2 = ponto2
    return math.sqrt((x2 - x1)**2 + (y2 - y1)**2)

distancia_euclidiana((1, 2), (4, 6))  # 5.0
math.dist((1, 2), (4, 6))  # equivalente na stdlib (Python 3.8+), 5.0

Para dados multidimensionais, a função numpy.linalg.norm resolve em uma linha e de forma vetorizada:

import numpy as np

a = np.array([1, 2])
b = np.array([4, 6])
np.linalg.norm(a - b)  # 5.0

Se você está começando na linguagem, vale revisar o guia de Python para iniciantes e o artigo sobre a biblioteca NumPy para dominar arrays antes de trabalhar com métricas de distância.

Onde a distância euclidiana é usada em machine learning?

A distância euclidiana é o critério de similaridade padrão de algoritmos clássicos de classificação e agrupamento: o KNN (K-Nearest Neighbors) classifica um novo ponto olhando os vizinhos mais próximos, e o K-Means agrupa observações minimizando distâncias aos centroides. Na documentação oficial do scikit-learn, o KNeighborsClassifier usa por padrão a métrica de Minkowski com p=2 — exatamente a distância euclidiana.

Esse alcance é amplificado pelo tamanho do ecossistema. Segundo a Stack Overflow Developer Survey 2025, o Python é usado por 57,9% dos desenvolvedores, um salto de 7 pontos percentuais em um ano puxado por IA (Inteligência Artificial) e ciência de dados. E a Python Developers Survey 2024, conduzida pela PSF (Python Software Foundation) com a JetBrains junto a mais de 30.000 respondentes, mostra que 51% dos desenvolvedores Python trabalham com exploração e processamento de dados — o terreno natural das métricas de distância.

Um exemplo concreto: em um sistema de recomendação, cada usuário vira um vetor de preferências. Ao calcular a distância euclidiana entre o vetor de um usuário e o dos demais, o sistema encontra perfis semelhantes e recomenda itens que esses perfis já aprovaram. Para entender o contexto maior desses algoritmos, veja os fundamentos do machine learning explicados passo a passo.

Quando usar a distância euclidiana na ciência de dados?

Use a distância euclidiana quando as variáveis forem contínuas, estiverem na mesma escala (ou normalizadas) e o número de dimensões for baixo ou moderado. Nessas condições, ela é a métrica mais intuitiva e barata de calcular para análise de clusters, detecção de anomalias e busca por similaridade.

Na análise de agrupamentos, calcular a distância euclidiana entre pontos de um conjunto multidimensional ajuda a identificar padrões e reunir dados semelhantes. Imagine a análise de clientes de um e-commerce: a métrica agrupa consumidores com comportamentos de compra parecidos, gerando insights para estratégias de marketing personalizadas. Em aplicações geoespaciais, como um programa que estima a rota mais curta entre dois pontos de um mapa com coordenadas de GPS (Sistema de Posicionamento Global), a distância euclidiana fornece a linha de base da distância direta antes de considerar ruas e obstáculos.

O limite aparece em espaços com centenas ou milhares de dimensões: as distâncias entre todos os pontos tendem a se igualar (maldição da dimensionalidade) e a métrica perde poder discriminativo. Nesses cenários, reduza dimensões antes ou troque por Manhattan ou similaridade de cosseno, como resume a tabela comparativa acima.

Conclusão

A distância euclidiana é daqueles fundamentos que valem mais do que aparentam: uma fórmula de uma linha, herdada de Pitágoras, sustenta KNN, K-Means, recomendação e análise de clusters. O conselho prático do CodeCrush é direto — antes de adotar métricas exóticas, normalize seus dados, comece pela euclidiana e só troque de métrica quando os resultados do modelo mostrarem que ela não basta. Dominar essa base torna qualquer estudo posterior de algoritmos de similaridade muito mais rápido.

## faq

Perguntas frequentes

Para que serve a distância euclidiana em machine learning?

A distância euclidiana mede a similaridade entre registros: quanto menor a distância, mais parecidos os dados. O KNN a usa para classificar novos pontos pelos vizinhos mais próximos, o K-Means a utiliza para agrupar observações em clusters, e sistemas de recomendação a aplicam para comparar perfis de usuários e sugerir itens.

Como calcular a distância euclidiana em Python?

Use math.dist(p, q) da biblioteca padrão, disponível desde o Python 3.8, ou numpy.linalg.norm(a - b) para vetores de qualquer dimensão. As duas funções retornam a raiz quadrada da soma dos quadrados das diferenças entre coordenadas; a versão com NumPy é vetorizada e mais rápida para grandes volumes de dados.

Distância euclidiana ou Manhattan: qual escolher?

A euclidiana mede o caminho em linha reta e é o padrão quando as variáveis são contínuas e estão na mesma escala. A Manhattan soma as diferenças absolutas por eixo e costuma ser mais robusta a outliers e a dados de alta dimensionalidade. Teste as duas métricas e compare o desempenho do modelo.

Quando a distância euclidiana não é uma boa escolha?

Evite a distância euclidiana quando as variáveis estão em escalas muito diferentes sem normalização, quando há muitas dimensões (a chamada maldição da dimensionalidade) ou quando a direção importa mais que a magnitude, como em vetores de texto. Nesses casos, similaridade de cosseno ou distância de Manhattan funcionam melhor.

## continue lendo

Continue navegando

Sobre o autor

Foto de Henrico Piubello

Henrico Piubello

Especialista de TI - Grupo Voitto · Grupo Voitto

Ver perfil e todos os artigos