Buscadores e empresas de Inteligência Artificial utilizam diferentes rastreadores, também chamados de crawlers ou bots.
O acesso desses agentes pode ser orientado pelo arquivo robots.txt, localizado normalmente na raiz do domínio.
Também existem diretivas aplicadas a páginas específicas, como a meta tag robots. O Google explica que essa tag oferece controle granular sobre como determinada página pode ser indexada e apresentada.
É importante diferenciar:
- bots de indexação;
- bots de pesquisa em tempo real;
- bots relacionados ao treinamento de modelos;
- bots utilizados para pré-visualizar links;
- agentes acionados por usuários.
Qual é a relação com GEO?
Um bloqueio incorreto pode impedir que um mecanismo encontre e analise o conteúdo.
Entretanto, permitir o rastreamento não garante que a página seja indexada, classificada ou citada.
Exemplo prático
Um firewall pode bloquear um rastreador mesmo quando o arquivo robots.txt permite seu acesso.