## glossário
O que é Machine Learning?
Machine Learning (aprendizado de máquina) é o campo da inteligência artificial em que sistemas melhoram seu desempenho em uma tarefa a partir da exposição a dados, sem que as regras sejam programadas explicitamente. Em vez de escrever a lógica, você fornece exemplos e deixa o algoritmo inferir os padrões.
A diferença fica clara num caso concreto. Para detectar spam com programação tradicional, alguém precisaria escrever centenas de regras e mantê-las conforme os spammers mudam de tática. Com aprendizado de máquina, você fornece milhares de e-mails rotulados e o modelo descobre sozinho quais sinais importam.
Os três tipos de aprendizado
- Supervisionado — treina com dados rotulados, onde a resposta correta é conhecida. Usado em classificação (spam ou não) e regressão (prever preço).
- Não supervisionado — recebe dados sem rótulo e busca estrutura própria: agrupamentos de clientes, detecção de anomalias, redução de dimensionalidade.
- Por reforço — o agente aprende por tentativa e erro, recebendo recompensas ou punições. Base de sistemas que jogam, controlam robôs e otimizam operações.
O fluxo de um projeto real
A parte que surpreende quem começa: o algoritmo é a menor fatia do trabalho. A maior parte do esforço vai para coletar, limpar e preparar dados.
from sklearn.model_selection import train_test_split
from sklearn.ensemble import RandomForestClassifier
from sklearn.metrics import classification_report
# separa treino e teste ANTES de qualquer ajuste
X_treino, X_teste, y_treino, y_teste = train_test_split(
X, y, test_size=0.2, random_state=42, stratify=y
)
modelo = RandomForestClassifier(n_estimators=200, random_state=42)
modelo.fit(X_treino, y_treino)
# avaliação sempre em dados que o modelo nunca viu
print(classification_report(y_teste, modelo.predict(X_teste)))Aquela separação entre treino e teste não é formalidade. Avaliar o modelo nos mesmos dados em que ele treinou produz números excelentes e completamente enganosos — é o erro mais comum de quem está começando.
Métricas: acurácia raramente basta
Se 99% dos e-mails não são spam, um modelo que sempre responde "não é spam" acerta 99% das vezes e é inútil. Por isso se usa precisão (dos que marquei como positivos, quantos eram mesmo), recall (dos positivos reais, quantos encontrei) e F1, que equilibra os dois. A escolha depende do custo do erro: em diagnóstico médico, deixar passar um caso é muito pior que um alarme falso.
Limitações que importam
Modelos aprendem correlação, não causalidade — e reproduzem os vieses presentes nos dados de treino, às vezes amplificando-os. Também degradam com o tempo, à medida que a realidade muda e os dados de produção se afastam dos de treino, fenômeno chamado data drift. E há o risco de overfitting, quando o modelo decora em vez de generalizar. Para se aprofundar, veja fundamentos de machine learning e como criar projetos de machine learning.
## faq
Perguntas frequentes
Qual a diferença entre IA, Machine Learning e Deep Learning?
São camadas encaixadas. Inteligência Artificial é o campo amplo de fazer máquinas executarem tarefas que exigiriam inteligência. Machine Learning é o subconjunto em que isso é feito aprendendo com dados. Deep Learning é um subconjunto do ML que usa redes neurais profundas, dominante em imagem, áudio e linguagem.
Preciso saber muita matemática para trabalhar com ML?
Para usar bibliotecas prontas em problemas comuns, álgebra linear e estatística básicas são suficientes. Para entender por que um modelo falha, ajustar arquiteturas ou pesquisar, cálculo, probabilidade e otimização passam a ser necessários de verdade.
Quantos dados são necessários para treinar um modelo?
Depende da complexidade do problema e do modelo. Algoritmos clássicos podem funcionar com alguns milhares de exemplos bem rotulados. Redes profundas costumam exigir muito mais — embora transfer learning permita adaptar modelos já treinados com conjuntos pequenos.
## leia também