O que é Robots.txt
Robots.txt é o arquivo na raiz do site que diz aos buscadores o que rastrear e o que ignorar. É instrução de acesso, não de indexação.
Na prática
Erro clássico e caro: bloquear no robots.txt uma página que já estava indexada. O Google para de ver o conteúdo, mas o endereço pode continuar aparecendo, agora sem descrição.
Um caso real
Uma loja bloqueou no robots.txt a pasta de páginas de produto pra economizar rastreamento durante uma migração. As páginas continuaram aparecendo na busca, sem descrição, com o aviso de que o conteúdo não pôde ser lido. O bloqueio impediu a leitura, e não a exibição.
O erro mais comum
Usar robots.txt pra tirar página do índice. Bloquear o rastreamento impede o buscador de ler a página e, com isso, de enxergar a instrução de não indexar que talvez esteja dentro dela. Para remover do índice, o caminho é a marcação noindex com a página liberada pra leitura.
De onde vem
O protocolo foi proposto em 1994 por Martijn Koster e adotado por consenso entre os buscadores da época, funcionando por décadas como acordo informal. Só foi padronizado formalmente pelo IETF em 2022, quase trinta anos depois de virar prática universal.