## glossário

O que é Big Data?

Big Data designa conjuntos de dados cujo volume, velocidade ou variedade excedem a capacidade de processamento das ferramentas convencionais de banco de dados. Não se trata apenas de "muitos dados" — é o ponto em que a abordagem tradicional deixa de funcionar e exige arquitetura distribuída.

A distinção é prática: se seus dados cabem confortavelmente num PostgreSQL bem indexado numa máquina razoável, você não tem um problema de Big Data — tem um problema de banco de dados, que é bem mais simples de resolver.

Os cinco Vs

  • Volume — a escala dos dados, de terabytes a petabytes.
  • Velocidade — a taxa de geração e a necessidade de processar em tempo real ou quase.
  • Variedade — dados estruturados, semiestruturados e não estruturados convivendo: tabelas, JSON, texto, imagem, vídeo, logs.
  • Veracidade — o grau de confiabilidade; dados em escala trazem inconsistência, duplicidade e lacunas.
  • Valor — o mais importante e o mais esquecido: se não gera decisão melhor, é só custo de armazenamento.

Por que ferramentas tradicionais não bastam

Um banco relacional numa única máquina esbarra em limites físicos de disco, memória e CPU. A resposta do Big Data é escalar horizontalmente: distribuir dados e processamento por dezenas ou centenas de máquinas comuns, em vez de comprar uma máquina cada vez maior.

Processamento distribuído: a mesma lógica, em muitas máquinas
# PySpark: a operação é declarada uma vez e
# executada em paralelo pelo cluster
from pyspark.sql import functions as F

eventos = spark.read.parquet("s3://dados/eventos/2026/*")

resumo = (
    eventos
    .filter(F.col("tipo") == "compra")
    .groupBy("categoria", F.to_date("data").alias("dia"))
    .agg(
        F.sum("valor").alias("receita"),
        F.countDistinct("usuario_id").alias("clientes"),
    )
    .orderBy(F.desc("receita"))
)

resumo.write.mode("overwrite").parquet("s3://dados/resumo/")

O ecossistema de tecnologias

O Hadoop inaugurou a era com armazenamento distribuído (HDFS) e o modelo MapReduce. O Spark o substituiu em boa parte dos casos por processar em memória e ser bem mais rápido. Para dados em fluxo contínuo, Kafka virou o padrão de ingestão. E os data warehouses modernos em nuvem trouxeram escala massiva com interface SQL familiar, tema aprofundado em o que é data warehouse.

Data lake, warehouse e lakehouse

O data lake armazena dados brutos em formato original, barato e flexível, mas com risco de virar um "pântano" sem governança. O data warehouse guarda dados tratados e modelados para análise, com desempenho consistente. O lakehouse tenta unir os dois, oferecendo transações e esquema sobre o armazenamento barato do lake. As aplicações analíticas resultantes aparecem em áreas de aplicação da ciência de dados.

## faq

Perguntas frequentes

A partir de que tamanho os dados viram Big Data?

Não existe limiar fixo, e desconfie de quem der um número. O critério real é funcional: quando as ferramentas convencionais deixam de dar conta em tempo aceitável. Na prática, a maioria das empresas que diz ter Big Data resolveria tudo com um banco relacional bem modelado.

Qual a diferença entre Big Data e Data Science?

Big Data é sobre a infraestrutura e as técnicas para armazenar e processar grandes volumes. Data Science é sobre extrair conhecimento dos dados por meio de estatística e modelagem, independentemente do tamanho. São disciplinas complementares, não sinônimos.

Preciso de Hadoop para trabalhar com grandes volumes?

Cada vez menos. Hadoop perdeu espaço para Spark no processamento e para armazenamento de objetos em nuvem no lugar do HDFS. Hoje é mais comum encontrar Spark sobre S3 ou um data warehouse gerenciado do que um cluster Hadoop tradicional.