## glossário
O que é Big Data?
Big Data designa conjuntos de dados cujo volume, velocidade ou variedade excedem a capacidade de processamento das ferramentas convencionais de banco de dados. Não se trata apenas de "muitos dados" — é o ponto em que a abordagem tradicional deixa de funcionar e exige arquitetura distribuída.
A distinção é prática: se seus dados cabem confortavelmente num PostgreSQL bem indexado numa máquina razoável, você não tem um problema de Big Data — tem um problema de banco de dados, que é bem mais simples de resolver.
Os cinco Vs
- Volume — a escala dos dados, de terabytes a petabytes.
- Velocidade — a taxa de geração e a necessidade de processar em tempo real ou quase.
- Variedade — dados estruturados, semiestruturados e não estruturados convivendo: tabelas, JSON, texto, imagem, vídeo, logs.
- Veracidade — o grau de confiabilidade; dados em escala trazem inconsistência, duplicidade e lacunas.
- Valor — o mais importante e o mais esquecido: se não gera decisão melhor, é só custo de armazenamento.
Por que ferramentas tradicionais não bastam
Um banco relacional numa única máquina esbarra em limites físicos de disco, memória e CPU. A resposta do Big Data é escalar horizontalmente: distribuir dados e processamento por dezenas ou centenas de máquinas comuns, em vez de comprar uma máquina cada vez maior.
# PySpark: a operação é declarada uma vez e
# executada em paralelo pelo cluster
from pyspark.sql import functions as F
eventos = spark.read.parquet("s3://dados/eventos/2026/*")
resumo = (
eventos
.filter(F.col("tipo") == "compra")
.groupBy("categoria", F.to_date("data").alias("dia"))
.agg(
F.sum("valor").alias("receita"),
F.countDistinct("usuario_id").alias("clientes"),
)
.orderBy(F.desc("receita"))
)
resumo.write.mode("overwrite").parquet("s3://dados/resumo/")O ecossistema de tecnologias
O Hadoop inaugurou a era com armazenamento distribuído (HDFS) e o modelo MapReduce. O Spark o substituiu em boa parte dos casos por processar em memória e ser bem mais rápido. Para dados em fluxo contínuo, Kafka virou o padrão de ingestão. E os data warehouses modernos em nuvem trouxeram escala massiva com interface SQL familiar, tema aprofundado em o que é data warehouse.
Data lake, warehouse e lakehouse
O data lake armazena dados brutos em formato original, barato e flexível, mas com risco de virar um "pântano" sem governança. O data warehouse guarda dados tratados e modelados para análise, com desempenho consistente. O lakehouse tenta unir os dois, oferecendo transações e esquema sobre o armazenamento barato do lake. As aplicações analíticas resultantes aparecem em áreas de aplicação da ciência de dados.
## faq
Perguntas frequentes
A partir de que tamanho os dados viram Big Data?
Não existe limiar fixo, e desconfie de quem der um número. O critério real é funcional: quando as ferramentas convencionais deixam de dar conta em tempo aceitável. Na prática, a maioria das empresas que diz ter Big Data resolveria tudo com um banco relacional bem modelado.
Qual a diferença entre Big Data e Data Science?
Big Data é sobre a infraestrutura e as técnicas para armazenar e processar grandes volumes. Data Science é sobre extrair conhecimento dos dados por meio de estatística e modelagem, independentemente do tamanho. São disciplinas complementares, não sinônimos.
Preciso de Hadoop para trabalhar com grandes volumes?
Cada vez menos. Hadoop perdeu espaço para Spark no processamento e para armazenamento de objetos em nuvem no lugar do HDFS. Hoje é mais comum encontrar Spark sobre S3 ou um data warehouse gerenciado do que um cluster Hadoop tradicional.