BlogAEOllms.txtCrawlers

llms.txt: o que é, se alguma IA lê de verdade e por que publicamos o nosso

Equipe Phame8 min

Resumo

llms.txt é um arquivo de texto em Markdown, publicado na raiz do site, com um resumo do negócio e uma lista dos links mais importantes. A proposta é de Jeremy Howard, de setembro de 2024. Até hoje, nenhuma IA anunciou que lê o arquivo: John Mueller, do Google, disse em 2025 que nenhum sistema de IA usa, e um estudo da Ahrefs com 137 mil domínios mostrou que 97% dos arquivos não receberam nenhuma visita em maio de 2026. A Phame publicou o seu mesmo assim, porque custa 10 minutos, e vai medir nos logs se algum bot busca o arquivo.

O que é o llms.txt?

É um arquivo de texto que fica na raiz do site, no endereço seusite.com.br/llms.txt.

A proposta é de Jeremy Howard, publicada em llmstxt.org em 3 de setembro de 2024. A ideia: dar a um modelo de linguagem (LLM, a tecnologia por trás de ChatGPT, Gemini e Claude) um resumo limpo do site. Sem menu, sem anúncio, sem código. Só os links que valem a pena ler.

A analogia com o robots.txt é inevitável, mas engana. O robots.txt é uma regra: diz aos bots o que podem rastrear, e os grandes bots respeitam. O llms.txt é um convite. Ele só funciona se o bot decidir abrir o arquivo, e é aí que a história complica.

Como é a estrutura do arquivo?

A especificação em llmstxt.org é curta. O arquivo é Markdown, com quatro partes:

  1. Um título H1 com o nome do site. É a única parte obrigatória.
  2. Uma citação em bloco com o resumo do que o site faz.
  3. Seções H2 com listas de links, cada link com uma nota curta.
  4. Uma seção chamada "Optional" com links secundários, que um bot pode pular quando precisa de contexto menor.

Um exemplo mínimo pra um negócio local:

# Nome da clínica

> Clínica odontológica no bairro Exemplo, em Cidade. Implantes, ortodontia
> e clínica geral. Atende de segunda a sexta, das 8h às 18h.

## Páginas principais

- [Serviços](https://www.nomedaclinica.com.br/servicos): lista de tratamentos e o que cada um resolve
- [Equipe](https://www.nomedaclinica.com.br/equipe): profissionais e registros
- [Contato](https://www.nomedaclinica.com.br/contato): endereço, telefone e como agendar

## Optional

- [Política de privacidade](https://www.nomedaclinica.com.br/privacidade)

Salve como llms.txt e publique na raiz. É isso. Não tem cadastro, não tem verificação, não tem ferramenta pra enviar.

O que dizem a favor?

O argumento é de custo e de organização.

Custo: o arquivo é texto puro. Um site pequeno escreve o seu em 10 minutos. Se um dia uma IA passar a usar, quem publicou já está pronto.

Organização: páginas de site têm menu, rodapé, pop-up e script. Um LLM que lê o HTML gasta contexto com tudo isso. O llms.txt entrega só o que importa, na ordem que você escolheu.

Tem um sinal de mercado também. Empresas de IA publicam o arquivo pra própria documentação de desenvolvedor: a página de bots da OpenAI e a da Perplexity abrem apontando pro llms.txt dos próprios sites. E o Lighthouse 13.3, ferramenta de auditoria do Chrome, ganhou uma checagem experimental que verifica se o site publica o arquivo, segundo o Search Engine Journal em maio de 2026.

Só que publicar um índice pra documentação técnica é diferente de anunciar que o bot lê o índice de terceiros. Nenhuma das empresas anunciou isso.

O que dizem contra?

As fontes contra são mais fortes, e vêm de quem opera os sistemas.

John Mueller, da equipe de busca do Google, escreveu no Bluesky em 17 de junho de 2025: "FWIW no AI system currently uses llms.txt" (pra constar, nenhum sistema de IA usa o llms.txt atualmente). Ele completou que os bots buscam páginas pra treino e pra resposta, mas não buscam esse arquivo.

Um mês depois, Gary Illyes, também do Google, falou no Search Central Live Deep Dive da Ásia-Pacífico. Basta SEO normal pra aparecer nas Visões gerais de IA, ele disse, e o Google não vai usar o llms.txt. A documentação oficial do Google sobre recursos de IA repete: "não é necessário criar novos arquivos legíveis por máquina, arquivos de texto de IA ou marcação para aparecer nesses recursos".

OpenAI, Anthropic e Perplexity mantêm páginas oficiais explicando cada bot que operam e o que ele faz. Nenhuma dessas páginas diz que o bot consulta o llms.txt de outros sites.

A Semrush, no blog em português, conclui que "usar o arquivo llms.txt provavelmente não vale o seu tempo agora, a menos que você esteja apenas curioso".

O que se sabe sobre adoção e uso real?

Adoção cresce. Uso, não.

A Semrush contou 951 domínios com o arquivo em julho de 2025. Em junho de 2026, a Ahrefs publicou o maior estudo até agora: logs de servidor de 137 mil domínios que publicam llms.txt, cobrindo o mês de maio de 2026.

O resultado: 97% dos arquivos não receberam nenhuma requisição no mês. Nada abriu o arquivo.

Nos 3% restantes, quem abriu não foi a IA. Ferramentas de auditoria de SEO responderam por 21,7% das requisições, rastreadores genéricos por 13,1%, ferramentas de perfil tecnológico por 11,6%. A Ahrefs resume: 77% dos bots que leem o llms.txt não são de ferramentas de IA. Bots de busca de IA ficaram com 1,1%. O Slackbot, que só expande links colados no Slack, buscou o arquivo mais vezes que o PerplexityBot. OAI-SearchBot, PerplexityBot e o bot de busca do Claude, somados, fizeram algumas centenas de requisições em milhares de sites.

A Ahrefs ainda faz uma ressalva que eu acho a mais importante do estudo: requisição é a medida generosa. Um bot abrir o arquivo não quer dizer que ele usou o conteúdo. E mesmo nessa medida generosa o número é quase zero.

Muitos artigos sobre o tema, em português e em inglês, não testaram nada: repetem a proposta ou repetem o Mueller. O estudo da Ahrefs é o único com log de servidor em escala. É a melhor evidência disponível, e ela diz que o arquivo fica parado.

O que a Phame fez e como vai medir?

Publicamos hoje o nosso, em phame.com.br/llms.txt.

O arquivo não foi escrito na mão. Ele é gerado a partir do conteúdo do site, com a mesma fonte do sitemap. Páginas principais, capítulos do guia, posts do blog, tutoriais e perguntas frequentes entram na lista sozinhos. Quando publicamos um post novo, ele aparece no llms.txt sem ninguém lembrar de atualizar.

Isso importa porque o maior problema de arquivo escrito na mão é envelhecer. Um índice de setembro de 2026 com links de 2025 é pior do que nenhum índice.

A medição vai nos logs de acesso. Cada requisição ao site chega com um identificador do bot (o user agent). Vamos contar quantas vezes o /llms.txt foi requisitado e por quem, separando:

  • ChatGPT: GPTBot, OAI-SearchBot e ChatGPT-User.
  • Claude: ClaudeBot, Claude-SearchBot e Claude-User.
  • Perplexity: PerplexityBot e Perplexity-User.
  • Google: Googlebot. O Gemini não tem bot próprio nos logs. O Google-Extended, que muita gente cita, é só um token de robots.txt; a documentação do Google diz que ele "não tem uma string do user agent de solicitação HTTP separada". O rastreamento é feito pelo Googlebot.

O que vamos observar: se o arquivo é requisitado, por qual bot, com que frequência, e se a requisição é seguida por visitas às páginas listadas. Esse último ponto é o que separaria leitura de índice de rastreamento de rotina. Um bot que abre o /llms.txt e dez minutos depois visita três posts do blog listados nele está usando o arquivo. Um bot que abre o arquivo uma vez e some está só varrendo a raiz do site, como faz com qualquer URL.

Tem uma armadilha nessa medição que a gente já conhece de outros clientes: o mesmo bot pode ter mais de um propósito. O GPTBot coleta pra treino, o OAI-SearchBot alimenta a busca do ChatGPT, o ChatGPT-User abre a página quando um usuário pergunta algo naquele momento. Se o arquivo for lido só pelo bot de treino, isso não muda o que o ChatGPT responde hoje sobre a Phame. Por isso a contagem é por bot, não por empresa.

Não prometemos resultado. A expectativa, com base no estudo da Ahrefs, é que o arquivo fique semanas sem visita. Vamos atualizar este post com o que os logs mostrarem.

Vale a pena pro seu negócio?

Resposta direta: custa 10 minutos, não atrapalha, e não substitui nada que importa.

Publique se você já fez o básico. O básico, pra um negócio local, é o perfil no Google completo e atualizado e o site indexado no Google e no Bing. Depois, páginas que respondem as perguntas que o seu cliente faz pra IA. É isso que aparece nas respostas hoje. Um índice em texto não compensa a falta de nenhum desses.

Não publique esperando resultado. Se alguém te vender llms.txt como tática de visibilidade em IA, peça a evidência. A evidência pública, em setembro de 2026, é a de que os bots não abrem o arquivo.

O nosso caso é diferente do seu por um motivo: a Phame mede presença em IA como serviço, e o arquivo é um experimento barato com dado observável. Se os logs mostrarem leitura, você lê aqui primeiro.

Perguntas frequentes

O llms.txt é a mesma coisa que o robots.txt?

Não. O robots.txt diz aos bots o que eles podem ou não rastrear, e todos os grandes bots respeitam. O llms.txt é uma sugestão de leitura, um índice em texto, e nenhum bot anunciou que consulta o arquivo.

Colocar o llms.txt pode prejudicar o meu site no Google?

Não há evidência de prejuízo. O Google disse que não usa o arquivo, então ele é ignorado na busca. Se quiser, bloqueie a indexação do arquivo pra ele não aparecer como resultado quando alguém buscar o nome do seu negócio.

Como eu crio o arquivo pro meu site?

Abra um editor de texto simples. Escreva o nome do negócio como título, um resumo de duas frases e uma lista com os links das páginas principais. Salve como llms.txt e publique na raiz do site, no mesmo lugar do robots.txt.

Existe plugin de WordPress que gera o llms.txt?

Sim, vários, e alguns plugins de SEO já incluem a função. Antes de instalar mais um plugin, considere que o arquivo é texto puro e você consegue escrever na mão em 10 minutos.

Se nenhuma IA lê, por que tanto site publica?

Porque é barato e porque existe a chance de alguma IA passar a usar. A Ahrefs mediu que a adoção cresce, mas o uso real pelos bots continua perto de zero. Publicar é uma aposta de baixo custo, não uma tática com resultado comprovado.

Atualizado em 22 de setembro de 2026