Dev e API

Validador de Sitemap XML — Erros, Limites e robots.txt

Informe um domínio ou o endereço do XML e veja quantas URLs o sitemap declara, o que está fora da especificação e se ele consta no robots.txt.

  • sem cadastro
  • grátis
  • nada fica salvo
Carregando o validador...

O que o sitemap XML faz — e o que não faz

O sitemap é uma lista das URLs que você quer que os buscadores conheçam. É importante ser preciso sobre o alcance disso: ele não manda indexar nada, não melhora ranqueamento e não compensa uma página ruim. O que ele faz é resolver um problema de descoberta — dizer "estas páginas existem" para um rastreador que talvez não chegasse até elas navegando pelos links.

O ganho é maior em três situações: sites grandes, em que percorrer tudo por links custa caro; sites novos, ainda sem links de fora apontando para eles; e páginas mal conectadas internamente. Em um site pequeno e bem interligado, o sitemap faz pouca diferença — o que não é motivo para não ter um, já que o custo é praticamente zero.

Os dois limites que rejeitam o arquivo inteiro

A especificação impõe 50.000 URLs e 50 MB descomprimidos por arquivo. O detalhe que costuma pegar de surpresa: ultrapassar qualquer um dos dois não faz o rastreador cortar o excedente — ele descarta o sitemap inteiro. Um site que cresceu e passou de 50.000 URLs pode ficar meses com o sitemap sendo silenciosamente ignorado.

A saída é dividir a lista em vários arquivos e publicar um sitemapindex apontando para todos. Só um nível de aninhamento é permitido: um índice não pode apontar para outro índice. E o limite de 50 MB é do conteúdo descompactado — servir em gzip economiza banda, mas não muda a conta.

lastmod: útil quando é verdade, ignorado quando não é

O lastmod é o campo opcional que mais rende, porque é o que o Google usa para decidir o que revisitar primeiro. Mas ele só é levado a sério enquanto for confiável. Um sitemap gerado com a data de hoje em todas as entradas, ou com datas no futuro, faz o Google concluir que o campo não carrega informação — e a partir daí ele passa a ser ignorado no site inteiro, inclusive nas páginas em que estava correto.

O formato aceito é o W3C Datetime: 2026-08-18 ou 2026-08-18T14:30:00-03:00. O padrão brasileiro de data (18/08/2026) é recusado, assim como data e hora separadas por espaço em vez do T. Quanto a changefreq e priority, o Google declara abertamente que ignora ambos — a frequência declarada quase nunca corresponde à real, e todo mundo marca as próprias páginas como prioridade máxima.

Um sitemap só fala do próprio site

URLs listadas em um sitemap precisam pertencer ao mesmo host em que ele está hospedado. A regra é mais estrita do que parece: subdomínios são hosts diferentes, e exemplo.com.br e www.exemplo.com.br também. Entradas fora desse escopo não geram erro visível — são apenas ignoradas, o que torna o problema difícil de notar sem uma validação como a de cima.

Por fim, declarar o sitemap no robots.txt custa uma linha e garante que qualquer rastreador o encontre, sem depender de cadastro manual em cada ferramenta de webmaster. A validação acima verifica isso automaticamente e avisa quando a linha está faltando.

## faq

Perguntas frequentes

O que é um sitemap XML?

É um arquivo que lista as URLs do site que você quer que os buscadores conheçam. Ele não manda indexar nada — é uma sugestão de onde olhar, útil principalmente quando as páginas são difíceis de alcançar por links internos, quando o site é grande, ou quando é novo e ainda não recebeu links de fora. Cada entrada tem obrigatoriamente uma tag loc com a URL completa, e opcionalmente lastmod, changefreq e priority.

Qual é a diferença entre urlset e sitemapindex?

O urlset é o sitemap propriamente dito: lista URLs de páginas. O sitemapindex é um índice que aponta para outros sitemaps, e existe porque um único arquivo não pode passar de 50.000 URLs nem de 50 MB descomprimido. Sites grandes quebram a lista em vários arquivos e publicam um índice apontando para todos. Um índice pode apontar para até 50.000 sitemaps, mas não pode apontar para outro índice — só um nível de aninhamento é permitido.

Quais são os limites de um sitemap?

São dois, e valem por arquivo: no máximo 50.000 URLs e no máximo 50 MB descomprimido. Passar de qualquer um dos dois faz o rastreador rejeitar o arquivo inteiro, não apenas o excedente. A solução é dividir em vários sitemaps menores e declarar todos em um sitemapindex. Vale notar que o limite de 50 MB é do arquivo descompactado: você pode servir o sitemap comprimido em gzip, mas o conteúdo depois de descomprimir é o que conta.

O lastmod importa mesmo?

Sim, quando é confiável. O Google usa o lastmod para decidir o que revisitar primeiro — mas apenas se ele acreditar no valor. Se o sitemap declara que todas as páginas foram modificadas hoje, ou traz datas no futuro, o Google conclui que o campo não tem informação e passa a ignorá-lo no site inteiro. O formato precisa ser o W3C Datetime: 2026-08-18 ou 2026-08-18T14:30:00-03:00. Datas no padrão brasileiro (18/08/2026) são descartadas.

changefreq e priority servem para alguma coisa?

Para o Google, não. Ele afirma explicitamente que ignora as duas há anos: changefreq porque a frequência declarada raramente corresponde à real, e priority porque todo mundo marca as próprias páginas como importantes. Outros rastreadores podem levá-las em conta, e valores inválidos podem fazer alguns validadores recusarem o arquivo — por isso a ferramenta acima aponta quando estão fora do permitido, mas classifica como nota, não como erro.

Posso listar URLs de outro domínio no sitemap?

Não. Um sitemap só pode listar URLs do mesmo site em que está hospedado — a regra vale inclusive entre subdomínios e entre as versões com e sem www, que os buscadores tratam como hosts distintos. URLs fora desse escopo são simplesmente ignoradas. Existe uma exceção pouco usada: se você comprovar a propriedade de vários domínios no Search Console, é possível cruzar sitemaps entre eles, desde que o sitemap seja declarado no robots.txt de cada um.

Preciso declarar o sitemap no robots.txt?

Não é obrigatório, mas é a forma mais barata de garantir que qualquer rastreador o encontre. Uma linha "Sitemap: https://exemplo.com.br/sitemap.xml" em qualquer ponto do robots.txt basta — ela é global e não pertence a nenhum grupo de User-agent. Sem ela, você depende de cadastrar o arquivo manualmente em cada ferramenta de webmaster, o que cobre Google e Bing e não ajuda com o resto. A validação acima verifica isso automaticamente.

## outras ferramentas