## glossário

O que é Machine Learning?

Machine Learning (aprendizado de máquina) é o campo da inteligência artificial em que sistemas melhoram seu desempenho em uma tarefa a partir da exposição a dados, sem que as regras sejam programadas explicitamente. Em vez de escrever a lógica, você fornece exemplos e deixa o algoritmo inferir os padrões.

A diferença fica clara num caso concreto. Para detectar spam com programação tradicional, alguém precisaria escrever centenas de regras e mantê-las conforme os spammers mudam de tática. Com aprendizado de máquina, você fornece milhares de e-mails rotulados e o modelo descobre sozinho quais sinais importam.

Os três tipos de aprendizado

  • Supervisionado — treina com dados rotulados, onde a resposta correta é conhecida. Usado em classificação (spam ou não) e regressão (prever preço).
  • Não supervisionado — recebe dados sem rótulo e busca estrutura própria: agrupamentos de clientes, detecção de anomalias, redução de dimensionalidade.
  • Por reforço — o agente aprende por tentativa e erro, recebendo recompensas ou punições. Base de sistemas que jogam, controlam robôs e otimizam operações.

O fluxo de um projeto real

A parte que surpreende quem começa: o algoritmo é a menor fatia do trabalho. A maior parte do esforço vai para coletar, limpar e preparar dados.

Divisão de dados e treino — o esqueleto de qualquer projeto
from sklearn.model_selection import train_test_split
from sklearn.ensemble import RandomForestClassifier
from sklearn.metrics import classification_report

# separa treino e teste ANTES de qualquer ajuste
X_treino, X_teste, y_treino, y_teste = train_test_split(
    X, y, test_size=0.2, random_state=42, stratify=y
)

modelo = RandomForestClassifier(n_estimators=200, random_state=42)
modelo.fit(X_treino, y_treino)

# avaliação sempre em dados que o modelo nunca viu
print(classification_report(y_teste, modelo.predict(X_teste)))

Aquela separação entre treino e teste não é formalidade. Avaliar o modelo nos mesmos dados em que ele treinou produz números excelentes e completamente enganosos — é o erro mais comum de quem está começando.

Métricas: acurácia raramente basta

Se 99% dos e-mails não são spam, um modelo que sempre responde "não é spam" acerta 99% das vezes e é inútil. Por isso se usa precisão (dos que marquei como positivos, quantos eram mesmo), recall (dos positivos reais, quantos encontrei) e F1, que equilibra os dois. A escolha depende do custo do erro: em diagnóstico médico, deixar passar um caso é muito pior que um alarme falso.

Limitações que importam

Modelos aprendem correlação, não causalidade — e reproduzem os vieses presentes nos dados de treino, às vezes amplificando-os. Também degradam com o tempo, à medida que a realidade muda e os dados de produção se afastam dos de treino, fenômeno chamado data drift. E há o risco de overfitting, quando o modelo decora em vez de generalizar. Para se aprofundar, veja fundamentos de machine learning e como criar projetos de machine learning.

## faq

Perguntas frequentes

Qual a diferença entre IA, Machine Learning e Deep Learning?

São camadas encaixadas. Inteligência Artificial é o campo amplo de fazer máquinas executarem tarefas que exigiriam inteligência. Machine Learning é o subconjunto em que isso é feito aprendendo com dados. Deep Learning é um subconjunto do ML que usa redes neurais profundas, dominante em imagem, áudio e linguagem.

Preciso saber muita matemática para trabalhar com ML?

Para usar bibliotecas prontas em problemas comuns, álgebra linear e estatística básicas são suficientes. Para entender por que um modelo falha, ajustar arquiteturas ou pesquisar, cálculo, probabilidade e otimização passam a ser necessários de verdade.

Quantos dados são necessários para treinar um modelo?

Depende da complexidade do problema e do modelo. Algoritmos clássicos podem funcionar com alguns milhares de exemplos bem rotulados. Redes profundas costumam exigir muito mais — embora transfer learning permita adaptar modelos já treinados com conjuntos pequenos.

## leia também

Artigos relacionados