O llms.txt é um arquivo em Markdown, normalmente servido em /llms.txt, que entrega a agentes de IA uma lista curta e comentada das páginas mais úteis de um site. Ele costuma ser recomendado como atalho para aparecer no ChatGPT e em outras respostas de IA, mas o que está documentado é mais modesto: o formato é uma proposta informal, a Pesquisa Google diz que ignora o arquivo, e a documentação dos rastreadores da OpenAI, da Anthropic e da Perplexity fala de robots.txt, não de llms.txt.
Isso não o torna inútil. Para sites de documentação e APIs, ele é um índice barato que agentes e ferramentas de desenvolvimento podem ler quando precisam. Este guia mostra o formato, como ele difere do robots.txt e do sitemap.xml, quando vale a pena criar um, um exemplo mínimo e o que pesa mais nas respostas de IA, tema que muita gente chama de SEO para IA ou GEO. As declarações dos provedores refletem as páginas públicas deles em 1º de outubro de 2026.
Escopo deste guia
As declarações dos provedores refletem a documentação pública deles em 1º de outubro de 2026. A verificação de llms.txt do Sitelemetry só confirma que o arquivo está acessível e parece uma lista de links; ela não valida o formato, não testa os links nem mostra se algum sistema de IA o lê.
O que a proposta do llms.txt especifica
Jeremy Howard publicou a proposta em 3 de setembro de 2024. O texto atual em llmstxt.org é a versão 2, modificada em 10 de agosto de 2026. É uma descrição informal, mantida num repositório público no GitHub e aberta a contribuições da comunidade, não um padrão da IETF ou do W3C. Nenhum buscador ou provedor de IA é obrigado a lê-la.
O arquivo é Markdown, com as partes numa ordem fixa:
- Um H1 com o nome do site ou do projeto. É a única parte obrigatória.
- Um blockquote com um resumo curto dos fatos principais.
- Parágrafos ou listas opcionais com mais contexto, sem títulos.
- Zero ou mais seções H2 com listas de arquivos: itens de lista com um link, opcionalmente seguido de dois-pontos e uma nota, como
- [Preços](https://example.com/precos): planos e limites.
Uma seção chamada Optional, com esse nome em inglês, reúne links secundários que um agente pode pular quando precisa de um contexto mais curto.
O arquivo pode ficar na raiz ou sob um caminho como /docs/llms.txt. Ele cobre as URLs sob o seu caminho e, quando vários arquivos se aplicam, os agentes devem usar o mais específico. A proposta não usa /.well-known/, porque esses locais só existem na raiz da origem e muitos autores controlam apenas um caminho num host compartilhado.
A proposta também sugere cópias limpas das páginas em Markdown, na mesma URL com .md no final (page.html.md) ou, desde a versão 2, com a extensão trocada (page.md). A versão 2 acrescenta duas relações de link, enviadas como elementos HTML <link> ou num cabeçalho HTTP Link: rel="alternate" type="text/markdown" para a cópia e rel="describedby" para o llms.txt que cobre a página. O texto atual não define um arquivo complementar como llms-full.txt; quando uma ferramenta ou plataforma de documentação gera um, essa é uma convenção dela.
Como o llms.txt difere do robots.txt e do sitemap.xml
Os três arquivos fazem trabalhos diferentes para leitores diferentes.
| Arquivo | O que faz | O que não faz |
|---|---|---|
| robots.txt | Diz aos rastreadores que cooperam quais URLs eles podem requisitar (Robots Exclusion Protocol, RFC 9309). | Não é controle de acesso. A RFC diz que as regras não são uma forma de autorização de acesso. |
| sitemap.xml | Lista as URLs que você considera importantes, para que os buscadores as descubram. | Uma URL listada não é necessariamente rastreada ou indexada. |
| llms.txt | Uma lista curta e comentada de páginas-chave que um agente lê quando precisa de informação. | Não libera nem bloqueia rastreamento, não afeta a indexação, e ninguém é obrigado a lê-lo. |
A proposta traça a mesma linha: o robots.txt diz que tipo de acesso automatizado é aceitável, enquanto o llms.txt é usado sob demanda. Ela acrescenta que um sitemap não serve de substituto, porque muitas vezes não tem versões em Markdown das páginas, não inclui URLs de outros sites e costuma cobrir mais conteúdo do que cabe na janela de contexto de um modelo.
Então, se você quer liberar ou bloquear um rastreador de IA, edite o robots.txt. Deixar uma página fora do llms.txt não a esconde, e listar uma página nele não passa por cima de uma regra do robots.txt que bloqueia um rastreador. O guia de robots.txt explica como as regras são aplicadas.
O que o Google e os provedores de IA disseram sobre o llms.txt
Veja o que dizem as fontes primárias:
- Pesquisa Google. O guia sobre os recursos de IA generativa (atualizado em 10 de julho de 2026) diz que você não precisa de arquivos legíveis por máquina, arquivos de texto para IA nem Markdown para aparecer na Pesquisa, incluindo os recursos de IA dela, porque a Pesquisa não os usa. Ele cita o llms.txt diretamente: manter um para outros serviços que usam esse tipo de arquivo não tem problema, mas ele não ajuda nem prejudica a visibilidade ou o ranking na Pesquisa Google.
- Chrome Lighthouse. A categoria experimental Agentic Browsing (Chrome 150 ou posterior, sem pontuação de 0 a 100) tem uma auditoria de llms.txt que procura o arquivo na raiz do domínio. Um erro de servidor é apontado; um 404 é marcado como não aplicável, porque oferecer o arquivo é opcional. É uma verificação de presença numa ferramenta de desenvolvimento, não uma declaração de que algum produto de busca ou de IA usa o arquivo.
- OpenAI. A página sobre os rastreadores explica os controles no robots.txt para o OAI-SearchBot (resultados de busca no ChatGPT) e o GPTBot (treinamento), e observa que as visitas do ChatGPT-User, iniciadas por usuários, podem não seguir o robots.txt. Ela não diz que a OpenAI lê o llms.txt de um site.
- Anthropic. O artigo de ajuda lista ClaudeBot, Claude-User e Claude-SearchBot e diz que eles respeitam o robots.txt. Não menciona o llms.txt.
- Perplexity. A documentação cobre o PerplexityBot, para resultados de busca, e o Perplexity-User, acionado pelo usuário, que em geral ignora o robots.txt. Não diz que a Perplexity lê o llms.txt de um site.
- Microsoft Bing. Não foi encontrada nenhuma orientação da Microsoft ou do Bing sobre o llms.txt. O anúncio de fevereiro de 2026 do AI Performance no Bing Webmaster Tools não menciona o arquivo.
Em 1º de outubro de 2026, nenhum desses provedores documenta o uso do llms.txt de um site para ranking, citações ou respostas. Vários deles publicam um para a própria documentação de desenvolvedores (OpenAI, Anthropic, Perplexity e a documentação da API Gemini do Google), assim como a Cloudflare. Publicar um arquivo para a própria documentação não é o mesmo que ler os arquivos de outros sites.
Quando vale a pena criar um llms.txt, e quando ele pode esperar
O arquivo é barato de escrever e, segundo o Google, inofensivo na Pesquisa. O custo real é mantê-lo correto.
| Tipo de site | Prioridade | Por quê |
|---|---|---|
| Documentação para desenvolvedores, referências de API, SDKs | Vale a pena | Desenvolvedores apontam agentes de programação para a documentação. Um índice bem escolhido poupa o agente de adivinhar qual página ler. |
| Produtos de software (SaaS) com muitas páginas de configuração ou integração | Vale a pena | Um mapa curto de configuração, limites e preços ajuda um agente a responder perguntas do tipo “como faço” a partir das páginas atuais. |
| Projetos de código aberto | Vale a pena | A documentação muitas vezes já está em Markdown, então o build pode gerar o arquivo e as cópias das páginas. |
| Sites institucionais e de pequenas empresas | Baixa prioridade | Poucas páginas bem conectadas já são fáceis de ler. |
| Lojas virtuais, portais de notícias, blogs | Baixa prioridade | O conteúdo muda o tempo todo, e uma lista mantida à mão fica desatualizada. |
Um teste rápido: um desenvolvedor colaria a URL do seu site num assistente de programação e pediria que ele trabalhasse com o seu produto? Se sim, um llms.txt com cópias em Markdown das páginas principais vale uma tarde de trabalho. Se você quer ser citado em respostas sobre um serviço local, como uma clínica ou um escritório de contabilidade, gaste essa tarde com conteúdo claro nas páginas e com o acesso dos rastreadores. Se os agentes devem agir sobre o seu produto em vez de ler sobre ele, considere uma API ou um servidor MCP; a introdução ao MCP explica como isso funciona.
Um exemplo mínimo de llms.txt para um site pequeno
Um arquivo completo para um app hipotético de escalas de trabalho em example.com:
# Example Escala
> Example Escala é um app no navegador para montar escalas de turnos em pequenos cafés e lojas. Um plano gratuito cobre uma unidade; os planos pagos acrescentam mais unidades.
O Example Escala não faz folha de pagamento. Última revisão: 2026-10-01.
## Documentação
- [Primeiros passos](https://example.com/docs/primeiros-passos.md): Criar uma unidade, cadastrar a equipe e publicar a primeira semana
- [Modelos de turno](https://example.com/docs/modelos.md): Turnos recorrentes, intervalos e regras de cobertura
- [Referência da API](https://example.com/docs/api.md): Endpoints REST, autenticação e limites de requisição
## Produto
- [Preços](https://example.com/precos): Planos, limites e o que cada plano inclui
- [Dados e privacidade](https://example.com/privacidade): Onde os dados ficam e como exportá-los ou excluí-los
## Optional
- [Novidades](https://example.com/novidades): Notas de versão por mês- Sirva como texto.
https://example.com/llms.txtdeve responder com status 200 e o próprio Markdown. Aplicações de página única (SPA) às vezes respondem a caminhos desconhecidos com o HTML base; por isso, confira a resposta comcurl. - Cópias em Markdown são opcionais. Se você não as publicar, aponte para as páginas HTML normais, como faz a seção Produto acima.
- Mantenha o resumo factual. Diga o que o produto é, para quem é e quais são os limites importantes. Deixe os slogans de fora.
- Escreva notas, não prompts. Pedir a um modelo que recomende você não acrescenta nada que um leitor possa verificar.
- Seja seletivo. Dez bons links valem mais que duzentos; a lista completa de URLs fica no sitemap.
- Títulos em português funcionam. A proposta não fixa nomes nem idioma para as seções H2. A exceção é a seção Optional: mantenha esse nome em inglês, porque é ele que tem significado especial na proposta.
Com cópias em Markdown, cada página HTML pode apontar para a sua cópia e para o arquivo que a cobre:
<link rel="alternate" type="text/markdown" href="/docs/primeiros-passos.md">
<link rel="describedby" href="/llms.txt">Geradores, verificadores e validadores: como manter o arquivo correto
Um arquivo que lista um preço antigo ou uma página apagada pode ser pior do que nenhum, porque um agente que o segue pode repetir fatos desatualizados.
- Gere junto com a documentação. Se a documentação é gerada a partir de Markdown, produza o llms.txt e as cópias das páginas no mesmo passo do build.
- Coloque no checklist de cada versão. Quando preços, nomes de planos, plataformas ou URLs mudarem, atualize o arquivo na mesma entrega.
- Verifique os links automaticamente. Toda URL deve responder 200 sem uma cadeia de redirecionamentos. Este comando de uma linha mostra o código de status de cada link absoluto do arquivo:
curl -s https://example.com/llms.txt | grep -oE 'https://[^) ]+' | while read -r u; do echo "$(curl -s -o /dev/null -w '%{http_code}' "$u") $u"; doneUm gerador de llms.txt serve para um primeiro rascunho feito a partir de um sitemap ou de uma pasta de documentação. Ele não consegue decidir quais páginas importam e pode incluir páginas marcadas com noindex ou bloqueadas no robots.txt. Revise o resultado como qualquer página que você publica.
Um verificador (checker) ou validador de llms.txt pode confirmar as partes mecânicas: o arquivo está acessível, o H1 vem primeiro e os links funcionam. Nenhum verificador consegue dizer se um assistente lê o arquivo, porque os provedores não documentam isso.
O que pesa mais nas respostas de IA
Se você quer ser uma fonte utilizável para respostas de IA, estes pontos vêm antes do llms.txt:
- Acesso de rastreamento para os bots que você quer. Os rastreadores de IA são controlados no robots.txt, cada um com o seu token. A OpenAI separa o OAI-SearchBot (busca do ChatGPT) do GPTBot (treinamento), a Anthropic separa o Claude-SearchBot do ClaudeBot, e a Perplexity documenta o PerplexityBot. O token Google-Extended é um controle do robots.txt, não um rastreador separado: ele define se o conteúdo que o Google rastreia pode ser usado no treinamento e no embasamento (grounding) do Gemini e, segundo o Google, não afeta a inclusão nem o ranking na Pesquisa. Liberar os rastreadores de busca e bloquear os de treinamento é uma escolha legítima. Lembre que um grupo
User-agent: *comDisallow: /bloqueia todo rastreador que segue o robots.txt e não tem grupo próprio. A OpenAI diz que uma mudança no robots.txt pode levar cerca de 24 horas para chegar aos sistemas dela. - Autenticação para conteúdo privado. Acessos acionados por usuários, como os do ChatGPT-User e do Perplexity-User, podem não seguir o robots.txt, e a RFC 9309 diz que as regras do robots.txt não são autorização de acesso.
- Conteúdo claro na página. As orientações do Google para os recursos de IA apontam para conteúdo único e útil e uma estrutura técnica clara, pronta para descoberta e indexação, e não para arquivos especiais. Responda a perguntas reais de forma direta no HTML de uma página acessível. O guia de SEO para IA trabalha um exemplo.
- Dados estruturados que batem com a página. O Google diz que dados estruturados não são necessários para a busca com IA generativa e que nenhuma marcação especial de schema.org é necessária; mesmo assim, continua recomendando dados estruturados para a elegibilidade a resultados avançados na Pesquisa. Se você usa JSON-LD, mantenha-o coerente com os fatos visíveis.
- Fatos consistentes. Nome, preços, planos, regiões atendidas e contatos devem bater entre as suas páginas, os dados estruturados e o llms.txt. Se as suas próprias páginas se contradizem, qualquer sistema que as resuma precisa adivinhar.
Nenhum arquivo consegue fazer um assistente citar você. O que você controla é se as suas páginas estão acessíveis, legíveis e corretas; o guia de SEO técnico cobre o básico de rastreamento e indexação.
O que o Sitelemetry verifica no llms.txt
A área de visibilidade em IA do Sitelemetry faz parte da auditoria de seis áreas (segurança, SEO técnico, visibilidade em IA, acessibilidade, desempenho e integrações), que começa no plano Starter, a partir de US$ 49 por mês. A verificação de llms.txt é estreita:
- Ela requisita
/llms.txtuma vez na origem e informa o status e o tamanho. - O arquivo só conta como presente se responder com status 2xx, não estiver vazio, não for HTML e parecer um guia de links: uma linha começando com
#ou-, uma URL ou palavras como docs ou sitemap. Um arquivo ausente aparece como resultado parcial, com uma recomendação. - Ela não valida o formato, não segue nem testa os links e não afirma que algum sistema de IA lê o arquivo.
A mesma área verifica no robots.txt bloqueios do site inteiro contra 16 rastreadores de IA identificados pelo nome, entre eles GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot e Google-Extended. Regras sob User-agent: * e bloqueios parciais não são atribuídos a rastreadores de IA específicos (um bloqueio do site inteiro para todos os rastreadores aparece separadamente), e a lista é fixa; por isso, confira você mesmo os rastreadores que não estão nela, como Claude-SearchBot ou Claude-User. Ela também informa os dados estruturados em JSON-LD, sem validá-los contra o schema.org. A auditoria lê o HTML estático de uma amostra de páginas sem executar JavaScript, não consulta ChatGPT, Claude, Perplexity nem Google e não acompanha citações em respostas de IA.
O plano Free cobre só as verificações de segurança. O snapshot gratuito de prontidão para lançamento roda oito verificações passivas sem cadastro; ele não olha llms.txt, robots.txt nem dados estruturados, e não é a auditoria das seis áreas. Os detalhes dos planos estão na página de preços.
Perguntas frequentes
O llms.txt é um padrão oficial?
Não. É uma proposta informal de Jeremy Howard, publicada pela primeira vez em setembro de 2024; a versão 2 é de 10 de agosto de 2026. Não é um padrão da IETF nem do W3C, e nenhum buscador ou provedor de IA é obrigado a lê-lo.
O llms.txt ajuda a aparecer no ChatGPT, no Perplexity ou nas respostas de IA do Google?
Nenhum provedor documentou que sim. A Pesquisa Google diz que ignora o llms.txt, então o arquivo não ajuda nem prejudica a visibilidade ali. Em 1º de outubro de 2026, OpenAI, Anthropic e Perplexity descrevem os seus rastreadores em termos de robots.txt e não dizem que leem o llms.txt de um site.
O llms.txt pode bloquear rastreadores de IA ou o treinamento de IA?
Não. Ele não concede nem nega acesso. Use o robots.txt com os tokens que cada provedor documenta, como GPTBot ou ClaudeBot para os rastreadores de treinamento, e mantenha o conteúdo privado atrás de autenticação, porque alguns acessos acionados por usuários podem não seguir o robots.txt.
Um gerador de llms.txt é suficiente?
Para um primeiro rascunho, sim. Você ainda precisa escolher as páginas que importam, escrever notas corretas, tirar tudo o que estiver bloqueado no robots.txt ou marcado com noindex e gerar o arquivo de novo quando a documentação mudar.
Como verificar o meu llms.txt?
Abra o arquivo (por exemplo, com curl) e confirme o status 200, Markdown em vez de uma página HTML, o H1 primeiro e links funcionando. A auditoria experimental do Lighthouse e a área de visibilidade em IA do Sitelemetry verificam se o arquivo está presente; nenhuma das duas consegue dizer se um assistente específico o lê.
Fontes e leituras
- llmstxt.org: The /llms.txt file (proposta, v2)llmstxt.org
- Google Search Central: otimizar o site para os recursos de IA generativa da Pesquisadevelopers.google.com
- Chrome for Developers: auditoria de llms.txt do Lighthousedeveloper.chrome.com
- Chrome for Developers: pontuação da categoria Agentic Browsing do Lighthousedeveloper.chrome.com
- OpenAI: visão geral dos rastreadores da OpenAIdevelopers.openai.com
- Claude Help Center: a Anthropic rastreia a web e como bloquear o rastreadorsupport.claude.com
- Perplexity: rastreadores da Perplexitydocs.perplexity.ai
- RFC 9309: Robots Exclusion Protocolwww.rfc-editor.org
- Google Crawling Infrastructure: rastreadores comuns do Google (Google-Extended)developers.google.com
- Google Search Central: saiba mais sobre sitemapsdevelopers.google.com
Preparado pela equipe editorial do Sitelemetry. Consulte as fontes indicadas para aprofundar o assunto.



