---
title: "llms.txt, robots.txt e sitemap.xml: qual é a diferença?"
slug: "llms-txt-robots-txt-sitemap"
status: "published"
published_at: "2026-08-15"
reviewed_at: "2026-08-15"
author: "LLMs.txt Brasil"
canonical_url: "https://llmstxt.com.br/artigos/llms-txt-robots-txt-sitemap"
image: "https://llmstxt.com.br/images/articles/llms-txt-robots-sitemap-og.jpg"
---

# llms.txt, robots.txt e sitemap.xml: cada arquivo tem um trabalho

Os três arquivos podem existir no mesmo site. Eles não competem e nenhum substitui os outros: `robots.txt` comunica regras de rastreamento, `sitemap.xml` ajuda mecanismos de busca a descobrir URLs e `llms.txt` oferece uma seleção contextual para ferramentas e agentes que adotem a proposta.

**Resposta curta:** use `robots.txt` para responder “o crawler pode buscar esta URL?”, `sitemap.xml` para “quais URLs importantes existem?” e `llms.txt` para “quais documentos ajudam a entender este site e por quê?”.

## Comparação em 30 segundos

| Arquivo | Pergunta que responde | Público principal | Formato | O que não garante |
|---|---|---|---|---|
| `robots.txt` | O crawler pode acessar este caminho? | crawlers identificados | texto do Robots Exclusion Protocol | privacidade ou remoção do índice |
| `sitemap.xml` | Quais URLs importantes existem? | mecanismos de busca | XML | crawl ou indexação de todas as URLs |
| `llms.txt` | Que contexto e documentos devo consultar? | agentes e ferramentas compatíveis | Markdown curado | adoção, citação ou ranking |

## robots.txt: regras de rastreamento

O `robots.txt` fica normalmente na raiz do domínio, como `https://exemplo.com.br/robots.txt`. Ele segue o [Robots Exclusion Protocol padronizado no RFC 9309](https://www.rfc-editor.org/rfc/rfc9309) e declara regras para agentes identificados.

Exemplo:

```text
User-agent: *
Disallow: /carrinho/
Disallow: /busca-interna/

Sitemap: https://exemplo.com.br/sitemap.xml
```

Segundo o [Google Search Central](https://developers.google.com/search/docs/crawling-indexing/robots/intro), o objetivo principal é gerenciar tráfego de crawlers. Ele não é um mecanismo de segurança e não deve ser usado para esconder conteúdo privado.

### O erro mais perigoso com robots.txt

`Disallow` impede que crawlers compatíveis busquem o conteúdo, mas a URL ainda pode ser descoberta por links externos e aparecer sem descrição em resultados. Para conteúdo que realmente precisa ficar privado, use autenticação ou outra proteção de acesso. Para retirar uma página pública do Google, use o método de desindexação adequado — não apenas `robots.txt`.

## sitemap.xml: descoberta de URLs importantes

O sitemap é um catálogo estruturado de páginas, imagens, vídeos ou notícias que o site considera importantes. Ele pode informar a URL canônica, a última atualização e relações com versões em outros idiomas.

Exemplo mínimo:

```xml
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://exemplo.com.br/produtos/cafe-especial</loc>
    <lastmod>2026-08-10</lastmod>
  </url>
</urlset>
```

O [Google explica](https://developers.google.com/search/docs/crawling-indexing/sitemaps/overview) que sitemaps ajudam seus sistemas a rastrear sites com mais eficiência, sobretudo sites grandes, novos ou com mídia especializada. Mesmo assim, enviar uma URL não garante que ela será rastreada ou indexada.

### O que deve entrar no sitemap

Prefira URLs canônicas que você deseja ver nos resultados de busca. Evite páginas redirecionadas, duplicadas, privadas, bloqueadas ou marcadas para não indexar. Um sitemap limpo funciona melhor como inventário do que um arquivo inflado com tudo que o servidor consegue gerar.

## llms.txt: contexto e seleção editorial

O `llms.txt` também usa um endereço previsível, mas seu trabalho é diferente. A [proposta aberta](https://llmstxt.org/) descreve um arquivo Markdown pequeno com resumo, orientações e listas comentadas de documentos.

Exemplo:

```markdown
# Loja Exemplo

> Cafés brasileiros de pequenos produtores, com torra semanal.

## Compra e atendimento

- [Catálogo](https://exemplo.com.br/markdown/catalogo.md): origem, torra, notas e preço
- [Assinaturas](https://exemplo.com.br/markdown/assinaturas.md): planos, frequência e cancelamento
- [Entregas](https://exemplo.com.br/markdown/entregas.md): regiões, prazos e rastreio
```

As descrições dão significado aos links. Em vez de listar centenas de URLs, o arquivo seleciona o que um consumidor compatível deveria abrir para uma tarefa específica.

### O limite essencial do llms.txt

Ele ainda é uma proposta com adoção variável, não um padrão obrigatório da web. O Google afirma que não usa `llms.txt` como sinal especial para a Busca nem para seus recursos generativos. Use-o para sistemas que realmente o consomem, não como atalho de SEO.

## Os três trabalhando juntos

Uma arquitetura saudável pode publicar:

```text
/robots.txt      regras para crawlers
/sitemap.xml     URLs HTML importantes para descoberta
/llms.txt        índice curado e contexto para agentes compatíveis
/llms-full.txt   conteúdo consolidado opcional
/markdown/*.md   representações textuais das páginas
```

O fluxo fica simples:

1. **Acesso:** o crawler consulta `robots.txt` e respeita as regras aplicáveis.
2. **Descoberta:** o mecanismo de busca usa links e `sitemap.xml` para encontrar URLs importantes.
3. **Contexto:** uma ferramenta compatível consulta `llms.txt`, escolhe os documentos pertinentes e busca o detalhe.

Nenhum arquivo atravessa autenticação. Nenhum transforma conteúdo ruim em boa resposta. Todos dependem de páginas corretas, públicas quando necessário e bem mantidas.

## Erros comuns e como corrigir

### Usar robots.txt para guardar segredos

O arquivo é público e pode revelar o nome dos caminhos bloqueados. Proteja dados sensíveis no servidor e na aplicação.

### Tratar sitemap como garantia de indexação

Ele é uma indicação de descoberta, não uma ordem. Corrija qualidade, acessibilidade, canonicalização e links internos da página.

### Despejar o sitemap inteiro dentro do llms.txt

Isso remove justamente a curadoria que torna o índice útil. Agrupe poucos documentos por intenção e descreva o valor de cada um.

### Publicar Markdown duplicado sem relação clara

Quando HTML e Markdown representam o mesmo conteúdo, sinalize a alternativa com `rel="alternate" type="text/markdown"` ou header HTTP `Link`, e mantenha uma URL humana canônica coerente.

### Atualizar um arquivo e esquecer os outros

Uma URL removida pode continuar no sitemap e no `llms.txt`. Automatize validação, datas, links e regeneração, mantendo sempre a última versão válida em caso de falha.

## Qual deles o seu site precisa?

- **Quase todo site público:** um `robots.txt` correto, ainda que permita todos os caminhos públicos.
- **Sites grandes, novos ou com conteúdo especializado:** um `sitemap.xml` tende a ajudar a descoberta.
- **Sites com documentação ou informação útil a agentes:** um `llms.txt` pode reduzir o caminho para consumidores compatíveis.
- **Conteúdo privado:** autenticação e autorização; nenhum desses arquivos substitui segurança.

## Checklist antes de publicar

- Confirme que `robots.txt` está no host e protocolo corretos.
- Não bloqueie CSS, JavaScript ou recursos necessários por acidente.
- Liste no sitemap somente URLs canônicas e indexáveis.
- Use datas de modificação verdadeiras, não a data de cada requisição.
- Mantenha o `llms.txt` curto, descrito e baseado em URLs estáveis.
- Não coloque informação privada em arquivos públicos.
- Valide todos os links após cada publicação.
- Regere Markdown e índices quando a página humana mudar.

## Fontes primárias

- [Proposta `/llms.txt`, versão 2](https://llmstxt.org/)
- [RFC 9309 — Robots Exclusion Protocol](https://www.rfc-editor.org/rfc/rfc9309)
- [Google: introdução ao robots.txt](https://developers.google.com/search/docs/crawling-indexing/robots/intro)
- [Google: visão geral de sitemaps](https://developers.google.com/search/docs/crawling-indexing/sitemaps/overview)
- [Sitemaps.org: protocolo XML](https://www.sitemaps.org/protocol.html)
- [Google: otimização para recursos generativos](https://developers.google.com/search/docs/fundamentals/ai-optimization-guide)

Fontes verificadas em 15 de agosto de 2026.

## Próximo passo

[Cadastre gratuitamente o llms.txt que você já hospeda](https://llmstxt.com.br/register) ou [compare os planos gerenciados](https://llmstxt.com.br/#planos) para manter o índice e as páginas Markdown sincronizados.
