marketingames.org Glossário

Robots.txt

SEO técnico

O que é Robots.txt

Robots.txt é o arquivo na raiz do site que diz aos buscadores o que rastrear e o que ignorar. É instrução de acesso, não de indexação.

Na prática

Erro clássico e caro: bloquear no robots.txt uma página que já estava indexada. O Google para de ver o conteúdo, mas o endereço pode continuar aparecendo, agora sem descrição.

Um caso real

Uma loja bloqueou no robots.txt a pasta de páginas de produto pra economizar rastreamento durante uma migração. As páginas continuaram aparecendo na busca, sem descrição, com o aviso de que o conteúdo não pôde ser lido. O bloqueio impediu a leitura, e não a exibição.

O erro mais comum

Usar robots.txt pra tirar página do índice. Bloquear o rastreamento impede o buscador de ler a página e, com isso, de enxergar a instrução de não indexar que talvez esteja dentro dela. Para remover do índice, o caminho é a marcação noindex com a página liberada pra leitura.

De onde vem

O protocolo foi proposto em 1994 por Martijn Koster e adotado por consenso entre os buscadores da época, funcionando por décadas como acordo informal. Só foi padronizado formalmente pelo IETF em 2022, quase trinta anos depois de virar prática universal.

Perguntas frequentes sobre Robots.txt

Robots.txt protege conteúdo?
Não protege nada. É um pedido público que robôs bem comportados respeitam e que qualquer pessoa pode ler digitando o endereço. Conteúdo que precisa de proteção pede senha, não linha em arquivo de texto.
O que costuma valer a pena bloquear?
Áreas administrativas, resultados de busca interna e páginas geradas por filtros que criam infinitas combinações. Todas consomem rastreamento sem gerar página que alguém buscaria.
Bloquear robô de IA é possível?
É possível listar os agentes conhecidos que respeitam o protocolo, e as principais empresas publicam o nome dos seus. O cumprimento continua sendo voluntário, como sempre foi.