Pontos-chave:
- Crawl budget é a cota de tempo e recursos que o Google dedica a rastrear um site. Ele é determinado por dois fatores: o limite de capacidade do servidor e a demanda de rastreamento, baseada em popularidade, frequência de atualização e volume de URLs identificadas no site.
- O principal desperdício de crawl budget vem de um inventário inflado (volume excessivo de endereços irrelevantes no site): URLs duplicadas sem canonical, páginas com erro persistente, redirecionamentos em cadeia e páginas com noindex que continuam sendo rastreadas consomem cota antes de cobrir o que realmente importa.
- O status “Detectado, mas não indexado no momento” no Google Search Console é o sinal mais direto de problema de crawl budget. Quando esse volume é alto, o Google está encontrando as páginas, mas não tem recursos para rastreá-las e incluí-las no índice
O Google não tem recursos infinitos. Para cada site que ele rastreia, é alocada uma quantidade limitada de tempo e conexões, o chamado crawl budget; e, quando esse “orçamento” se esgota, parte do conteúdo fica de fora.
Em sites pequenos, isso raramente é um problema. Mas, em sites com milhares de páginas, filtros de e-commerce e conteúdo atualizado com frequência, o crawl budget se torna um dos fatores que mais impacta a indexação.
Saber como ele funciona é o primeiro passo para garantir que o Google rastreie e indexe o que realmente importa para o negócio. Neste artigo, você vai entender o que é crawl budget, como ele é calculado, o que desperdiça esse recurso e como otimizá-lo na prática. Acompanhe!
O que é crawl budget?
O crawl budget do Google é a alocação de tempo e recursos que o Google dedica a rastrear um site em um período de tempo. É a cota que define quantas URLs o Googlebot, o robô de rastreamento do Google, pode visitar antes de seguir para outro domínio.
Esse orçamento não é um número fixo. Ele varia de acordo com dois fatores que atuam ao mesmo tempo:
1. Limite de capacidade de rastreamento
O Googlebot visita o site sem sobrecarregar o servidor. Esse cálculo é feito com base em quantas conexões paralelas o servidor suporta, e o ritmo de crawl é ajustado de acordo com esse número.
Quando o servidor responde de forma consistente e com rapidez, esse limite aumenta. Erros frequentes ou tempo de resposta lento fazem o limite cair.
Leia também: O que é conteúdo escaneável e como aplicá-lo na prática
2. Demanda de rastreamento
Mesmo que o servidor suporte mais conexões, o Google só rastreia o que considera relevante. Páginas com mais tráfego e links de outros sites (backlinks) são visitadas com mais frequência, assim como sites que publicam conteúdo novo regularmente.
Outro fator que influencia essa equação é o tamanho do inventário: quanto mais URLs o Google identifica no site, incluindo duplicatas (páginas com conteúdo idêntico ou muito similar acessíveis por endereços diferentes) e variações geradas por filtros, mais recursos são necessários para cobrir tudo.
Um detalhe importante: o limite de rastreamento é dividido entre todos os robôs do Google, não só o da Pesquisa. Quando o AdsBot ou o rastreador do Google Shopping aumentam a demanda (em períodos de campanha ativa, por exemplo), a cota disponível para rastrear páginas orgânicas diminui.
Leia também: Tráfego pago ou orgânico — qual a diferença e principais estratégias?
Para quem o crawl budget realmente importa?
No SEO, o crawl budget raramente é um problema para sites pequenos. A própriadocumentação oficial do Google sobre crawl budget confirma isso: se o site tem poucas páginas ou publica raramente, esse não costuma ser um fator relevante. O tema se torna importante principalmente para:
- Sites com mais de 10 mil páginas que mudam diariamente.
- Sites com mais de 1 milhão de páginas com atualização moderada.
- Sites com alto volume de URLs com status “Detectado, mas não indexado no momento” no Google Search Console.
Alguns exemplos são e-commerces com catálogos extensos, portais de notícias, marketplaces e qualquer site que gere URLs dinâmicas em volume. Para sites fora desse perfil, manter o sitemap atualizado e monitorar o relatório de indexação no GSC é suficiente.
Leia também: Como importar URLs de um Sitemap XML pelo Google Sheets
O que desperdiça crawl budget?
De acordo com a documentação oficial do Google sobre crawl budget, o principal fator controlável é o inventário de URLs: o volume de endereços que o Googlebot identifica no site. Quando esse inventário tem muitas URLs irrelevantes, a cota se esgota antes de cobrir o que realmente importa.
As causas mais comuns aparecem em quatro situações:
1. URLs duplicadas sem canonical
Filtros de categoria, parâmetros de ordenação (como ?ordenar=menor-preco no final da URL), versões com e sem www — cada combinação pode gerar um endereço diferente para o mesmo conteúdo.
Sem canonical, uma tag que indica ao Google qual é a versão principal da página, o Googlebot rastreia todas como páginas distintas.
Leia também: Como usar SEO na descrição de produtos de e-commerce
2. Páginas com erro persistente
Páginas que retornam erros 4xx, 5xx ou soft 404 (páginas que exibem mensagem de erro, mas retornam status 200, como se estivessem funcionando normalmente) continuam na fila de rastreamento e consomem recursos sem gerar indexação.
Para páginas removidas, o código correto é 404 ou 410, que envia um sinal para o Google interromper o rastreamento daquele endereço.
Leia também: HTTP Status code — o que é e quais são os principais?
3. Redirecionamentos em cadeia
Cada redirecionamento adiciona uma requisição ao processo. Cadeias longas — A → B → C → D — consomem mais tempo e recursos por URL. Sempre que possível, aponte o redirecionamento direto para o destino final, sem etapas intermediárias: cada salto removido economiza cota de rastreamento por URL.
Leia também: Redirects e SEO — guia para redirecionar URLs de forma otimizada
4. Noindex sem bloqueio de rastreamento
Páginas com tag noindex ainda são rastreadas. O Google precisa visitar essa URL para ler a diretiva e só então decidir não indexá-la. Por isso, para conteúdos que não devem receber a visita do Googlebot, o correto é usar robots.txt.
Atenção: não combine as duas diretivas na mesma URL. Se a página já estiver indexada e você bloqueá-la via robots.txt, o Google não consegue mais rastreá-la para ler o noindex — e ela permanece indexada, sem nenhuma forma de ser removida do índice enquanto o bloqueio persistir.
Leia também: O que é headless CMS e qual a diferença? Saiba quando usá-lo no seu site
Como otimizar o crawl budget?
Otimizar o crawl budget se organiza em duas frentes — controlar o inventário de URLs e facilitar o rastreamento. Entenda melhor cada uma delas a seguir:
1. Controlar o inventário de URLs
Para reduzir o inventário percebido pelo Googlebot, as ações mais eficazes são:
- Canonical para URLs de filtros e parâmetros que devem continuar acessíveis, mas não devem ser indexadas separadamente.
- Robots.txt para o que não precisa ser rastreado nem aparecer em resultados.
- 404 ou 410 para páginas removidas, em que o 410 é o sinal mais adequado de remoção definitiva.
- Corrigir soft 404s páginas que retornam status 200, mas exibem erro, continuam sendo rastreadas indefinidamente, consumindo cota sem nenhum benefício para a indexação.
2. Facilitar o rastreamento
Com o inventário controlado, o próximo passo é garantir que o Googlebot consiga percorrer o site de forma rápida e eficiente.
Sitemap limpo
Apenas URLs que retornam status 200 e que você quer ver indexadas. De acordo com as recomendações do Google para sitemaps, a tag <lastmod>
Velocidade do servidor
Servidores que respondem com consistência recebem limite de rastreamento maior ao longo do tempo. O que significa mais páginas visitadas por ciclo de rastreamento sem nenhuma ação adicional de SEO.
Análise de log do servidor
Cada requisição do Googlebot fica registrada no servidor, com URL, código de resposta e horário. Filtrando pela identificação do Googlebot (chamada de user agent), é possível ver exatamente o que o robô visitou, quando e com qual resultado — de forma completa, diferente do Relatório de Estatísticas de Rastreamento do Search Console, que exibe apenas uma amostra representativa de URLs por categoria, segundo a própria documentação do Google.
Leia também: Google Search Console — O que é e Para que Serve?
Canonical, noindex e robots.txt: qual usar em cada situação?
Os três recursos resolvem problemas diferentes e usá-los de forma incorreta pode desperdiçar budget em vez de economizá-lo. A tabela abaixo resume qual deles usar em cada situação:
Como monitorar o crawl budget no Google Search Console
Três recursos do GSC ajudam a monitorar o crawl budget na prática: o relatório de Estatísticas de rastreamento, o relatório de Páginas e a ferramenta de Inspeção de URL. Entenda melhor cada um deles:
1. Estatísticas de rastreamento
Acessível em Configurações > Estatísticas de rastreamento, este relatório mostra os últimos 90 dias de atividade do Googlebot. De acordo com o Relatório de Estatísticas de Rastreamento do Search Console, os dados disponíveis incluem:
- Volume de requisições: quantidade total de URLs visitadas pelo Googlebot no período.
- Tempo médio de resposta: indicador direto da saúde do servidor em relação ao rastreamento.
- Distribuição por código HTTP: proporção de respostas 200, 301, 404, 5xx e outros códigos.
2. Relatório de indexação de páginas
De acordo com o relatório de indexação de páginas, o status “Detectado, mas não indexado no momento” indica que o Google encontrou a URL, mas adiou o rastreamento porque rastreá-la naquele momento sobrecarregaria o site — ou seja, é um sinal explícito de limitação de crawl budget, não apenas atraso editorial.
3. Sitemaps
Ao submeter cada sitemap individualmente no GSC, é possível comparar o número de URLs enviadas com o de URLs indexadas por segmento.
As recomendações do Google para sitemaps indicam que o arquivo deve conter apenas URLs que retornam status 200. Incluir URLs com erro ou redirecionamento gera sinal contraditório ao Googlebot e desperdiça cota de rastreamento.
Um e-commerce com alta indexação de produtos, mas baixa indexação de categorias, geralmente tem páginas de categoria tratadas como conteúdo raso ou duplicado pelo Google.
O cenário inverso (categorias indexadas, produtos não) costuma indicar duplicação por variação, como cor ou tamanho. Cada situação pede uma solução diferente, e só dá para identificar qual é qual com os sitemaps individuais submetidos no GSC.
Leia também: Page Experience — o que é, métricas e como otimizar?
Quanto do seu crawl budget está sendo desperdiçado?
Quando o crawl budget não é gerenciado, páginas estratégicas ficam fora do índice e o impacto aparece nas métricas antes de aparecer no diagnóstico.
À medida que o site cresce, a questão deixa de ser “o Google vai rastrear meu site?” e passa a ser “o Google vai rastrear as páginas certas?“
O time da Ecto audita a estrutura técnica do seu site e identifica onde o crawl budget está sendo desperdiçado, cruzando dados do GSC com análise de log do servidor. Fale com o nosso time de especialistas e descubra o que pode estar limitando a indexação do seu site!
Leia também: Trailing Slash — o que é e como otimizar suas URLs
Imagem de capa – Fonte: Freepik / Magnific.com (2026)







