Crawl budget: como garantir que o Google rastreie o que importa no seu site

Rebeca Araújo
11 min de leitura

Publicado em

2 de outubro de 2026

Atualizado em

29 de setembro de 2026
Pessoa digitando em notebook com dashboard de gráficos de linha e barras em tons de azul na tela.

Documento

Pontos-chave:

  1. Crawl budget é a cota de tempo e recursos que o Google dedica a rastrear um site. Ele é determinado por dois fatores: o limite de capacidade do servidor e a demanda de rastreamento, baseada em popularidade, frequência de atualização e volume de URLs identificadas no site.
  2. O principal desperdício de crawl budget vem de um inventário inflado (volume excessivo de endereços irrelevantes no site): URLs duplicadas sem canonical, páginas com erro persistente, redirecionamentos em cadeia e páginas com noindex que continuam sendo rastreadas consomem cota antes de cobrir o que realmente importa.
  3. O status “Detectado, mas não indexado no momento” no Google Search Console é o sinal mais direto de problema de crawl budget. Quando esse volume é alto, o Google está encontrando as páginas, mas não tem recursos para rastreá-las e incluí-las no índice


O Google não tem recursos infinitos. Para cada site que ele rastreia, é alocada uma quantidade limitada de tempo e conexões, o chamado crawl budget; e, quando esse “orçamento” se esgota, parte do conteúdo fica de fora.

Em sites pequenos, isso raramente é um problema. Mas, em sites com milhares de páginas, filtros de e-commerce e conteúdo atualizado com frequência, o crawl budget se torna um dos fatores que mais impacta a indexação.

Saber como ele funciona é o primeiro passo para garantir que o Google rastreie e indexe o que realmente importa para o negócio. Neste artigo, você vai entender o que é crawl budget, como ele é calculado, o que desperdiça esse recurso e como otimizá-lo na prática. Acompanhe!

O que é crawl budget?

O crawl budget do Google é a alocação de tempo e recursos que o Google dedica a rastrear um site em um período de tempo. É a cota que define quantas URLs o Googlebot, o robô de rastreamento do Google, pode visitar antes de seguir para outro domínio.

Esse orçamento não é um número fixo. Ele varia de acordo com dois fatores que atuam ao mesmo tempo:

1. Limite de capacidade de rastreamento

O Googlebot visita o site sem sobrecarregar o servidor. Esse cálculo é feito com base em quantas conexões paralelas o servidor suporta, e o ritmo de crawl é ajustado de acordo com esse número.

Quando o servidor responde de forma consistente e com rapidez, esse limite aumenta. Erros frequentes ou tempo de resposta lento fazem o limite cair.

Leia também: O que é conteúdo escaneável e como aplicá-lo na prática

2. Demanda de rastreamento

Mesmo que o servidor suporte mais conexões, o Google só rastreia o que considera relevante. Páginas com mais tráfego e links de outros sites (backlinks) são visitadas com mais frequência, assim como sites que publicam conteúdo novo regularmente.

Outro fator que influencia essa equação é o tamanho do inventário: quanto mais URLs o Google identifica no site, incluindo duplicatas (páginas com conteúdo idêntico ou muito similar acessíveis por endereços diferentes) e variações geradas por filtros, mais recursos são necessários para cobrir tudo.

Um detalhe importante: o limite de rastreamento é dividido entre todos os robôs do Google, não só o da Pesquisa. Quando o AdsBot ou o rastreador do Google Shopping aumentam a demanda (em períodos de campanha ativa, por exemplo), a cota disponível para rastrear páginas orgânicas diminui.

Leia também: Tráfego pago ou orgânico — qual a diferença e principais estratégias?

Para quem o crawl budget realmente importa?

No SEO, o crawl budget raramente é um problema para sites pequenos. A própriadocumentação oficial do Google sobre crawl budget confirma isso: se o site tem poucas páginas ou publica raramente, esse não costuma ser um fator relevante. O tema se torna importante principalmente para:

  • Sites com mais de 10 mil páginas que mudam diariamente.
  • Sites com mais de 1 milhão de páginas com atualização moderada.
  • Sites com alto volume de URLs com status “Detectado, mas não indexado no momento” no Google Search Console.

Alguns exemplos são e-commerces com catálogos extensos, portais de notícias, marketplaces e qualquer site que gere URLs dinâmicas em volume. Para sites fora desse perfil, manter o sitemap atualizado e monitorar o relatório de indexação no GSC é suficiente.

Leia também: Como importar URLs de um Sitemap XML pelo Google Sheets

O que desperdiça crawl budget?

De acordo com a documentação oficial do Google sobre crawl budget, o principal fator controlável é o inventário de URLs: o volume de endereços que o Googlebot identifica no site. Quando esse inventário tem muitas URLs irrelevantes, a cota se esgota antes de cobrir o que realmente importa.

As causas mais comuns aparecem em quatro situações:

1. URLs duplicadas sem canonical

Filtros de categoria, parâmetros de ordenação (como ?ordenar=menor-preco no final da URL), versões com e sem www — cada combinação pode gerar um endereço diferente para o mesmo conteúdo.

Sem canonical, uma tag que indica ao Google qual é a versão principal da página, o Googlebot rastreia todas como páginas distintas.

Leia também: Como usar SEO na descrição de produtos de e-commerce

2. Páginas com erro persistente

Páginas que retornam erros 4xx, 5xx ou soft 404 (páginas que exibem mensagem de erro, mas retornam status 200, como se estivessem funcionando normalmente) continuam na fila de rastreamento e consomem recursos sem gerar indexação.

Para páginas removidas, o código correto é 404 ou 410, que envia um sinal para o Google interromper o rastreamento daquele endereço.

Leia também: HTTP Status code — o que é e quais são os principais?

3. Redirecionamentos em cadeia

Cada redirecionamento adiciona uma requisição ao processo. Cadeias longas — A → B → C → D — consomem mais tempo e recursos por URL. Sempre que possível, aponte o redirecionamento direto para o destino final, sem etapas intermediárias: cada salto removido economiza cota de rastreamento por URL.

Leia também: Redirects e SEO — guia para redirecionar URLs de forma otimizada

4. Noindex sem bloqueio de rastreamento

Páginas com tag noindex ainda são rastreadas. O Google precisa visitar essa URL para ler a diretiva e só então decidir não indexá-la. Por isso, para conteúdos que não devem receber a visita do Googlebot, o correto é usar robots.txt.

Atenção: não combine as duas diretivas na mesma URL. Se a página já estiver indexada e você bloqueá-la via robots.txt, o Google não consegue mais rastreá-la para ler o noindex — e ela permanece indexada, sem nenhuma forma de ser removida do índice enquanto o bloqueio persistir.

Leia também: O que é headless CMS e qual a diferença? Saiba quando usá-lo no seu site

Como otimizar o crawl budget?

Otimizar o crawl budget se organiza em duas frentes — controlar o inventário de URLs e facilitar o rastreamento. Entenda melhor cada uma delas a seguir:

1. Controlar o inventário de URLs

Para reduzir o inventário percebido pelo Googlebot, as ações mais eficazes são:

  • Canonical para URLs de filtros e parâmetros que devem continuar acessíveis, mas não devem ser indexadas separadamente.
  • Robots.txt para o que não precisa ser rastreado nem aparecer em resultados.
  • 404 ou 410 para páginas removidas, em que o 410 é o sinal mais adequado de remoção definitiva.
  • Corrigir soft 404s páginas que retornam status 200, mas exibem erro, continuam sendo rastreadas indefinidamente, consumindo cota sem nenhum benefício para a indexação.

2. Facilitar o rastreamento

Com o inventário controlado, o próximo passo é garantir que o Googlebot consiga percorrer o site de forma rápida e eficiente.

Sitemap limpo

Apenas URLs que retornam status 200 e que você quer ver indexadas. De acordo com as recomendações do Google para sitemaps, a tag <lastmod> ajuda o Google a priorizar o rerastreamento de conteúdo modificado, mas só quando as datas refletem alterações reais.

Velocidade do servidor

Servidores que respondem com consistência recebem limite de rastreamento maior ao longo do tempo. O que significa mais páginas visitadas por ciclo de rastreamento sem nenhuma ação adicional de SEO.

Análise de log do servidor

Cada requisição do Googlebot fica registrada no servidor, com URL, código de resposta e horário. Filtrando pela identificação do Googlebot (chamada de user agent), é possível ver exatamente o que o robô visitou, quando e com qual resultado — de forma completa, diferente do Relatório de Estatísticas de Rastreamento do Search Console, que exibe apenas uma amostra representativa de URLs por categoria, segundo a própria documentação do Google.

Leia também: Google Search Console — O que é e Para que Serve?

Canonical, noindex e robots.txt: qual usar em cada situação?

Os três recursos resolvem problemas diferentes e usá-los de forma incorreta pode desperdiçar budget em vez de economizá-lo. A tabela abaixo resume qual deles usar em cada situação:

Objetivo Ferramenta correta Por quê
Remover do índice, manter rastreável noindex A página continua acessível; o Google lê a diretiva e não indexa.
Bloquear o rastreamento robots.txt O Googlebot não acessa a página — método mais eficiente para economizar budget em URLs irrelevantes.
Consolidar duplicatas canonical A URL alternativa continua rastreável; a autoridade se consolida na versão preferencial.
Remover página permanentemente 404 ou 410 Sinaliza ao Google para interromper o rastreamento daquela URL.

Como monitorar o crawl budget no Google Search Console

Três recursos do GSC ajudam a monitorar o crawl budget na prática: o relatório de Estatísticas de rastreamento, o relatório de Páginas e a ferramenta de Inspeção de URL. Entenda melhor cada um deles:

1. Estatísticas de rastreamento

Acessível em Configurações > Estatísticas de rastreamento, este relatório mostra os últimos 90 dias de atividade do Googlebot. De acordo com o Relatório de Estatísticas de Rastreamento do Search Console, os dados disponíveis incluem:

  • Volume de requisições: quantidade total de URLs visitadas pelo Googlebot no período.
  • Tempo médio de resposta: indicador direto da saúde do servidor em relação ao rastreamento.
  • Distribuição por código HTTP: proporção de respostas 200, 301, 404, 5xx e outros códigos.

2. Relatório de indexação de páginas

De acordo com o relatório de indexação de páginas, o status “Detectado, mas não indexado no momento” indica que o Google encontrou a URL, mas adiou o rastreamento porque rastreá-la naquele momento sobrecarregaria o site — ou seja, é um sinal explícito de limitação de crawl budget, não apenas atraso editorial.

3. Sitemaps

Ao submeter cada sitemap individualmente no GSC, é possível comparar o número de URLs enviadas com o de URLs indexadas por segmento.

As recomendações do Google para sitemaps indicam que o arquivo deve conter apenas URLs que retornam status 200. Incluir URLs com erro ou redirecionamento gera sinal contraditório ao Googlebot e desperdiça cota de rastreamento.

Um e-commerce com alta indexação de produtos, mas baixa indexação de categorias, geralmente tem páginas de categoria tratadas como conteúdo raso ou duplicado pelo Google.

O cenário inverso (categorias indexadas, produtos não) costuma indicar duplicação por variação, como cor ou tamanho. Cada situação pede uma solução diferente, e só dá para identificar qual é qual com os sitemaps individuais submetidos no GSC.

Leia também: Page Experience — o que é, métricas e como otimizar?

Quanto do seu crawl budget está sendo desperdiçado?

Quando o crawl budget não é gerenciado, páginas estratégicas ficam fora do índice e o impacto aparece nas métricas antes de aparecer no diagnóstico.

À medida que o site cresce, a questão deixa de ser “o Google vai rastrear meu site?” e passa a ser “o Google vai rastrear as páginas certas?“

O time da Ecto audita a estrutura técnica do seu site e identifica onde o crawl budget está sendo desperdiçado, cruzando dados do GSC com análise de log do servidor. Fale com o nosso time de especialistas e descubra o que pode estar limitando a indexação do seu site!

Leia também: Trailing Slash — o que é e como otimizar suas URLs

Imagem de capa – Fonte: Freepik / Magnific.com (2026)

Rebeca Araújo

Redatora formada em Publicidade e Propaganda pela UAM, pós-graduada em Comunicação, Semiótica e Filosofia pela Estácio, com mais de 5 anos de experiência em criação de conteúdo online. É autora de um livro publicado de forma independente pela Amazon e escreve poesias e artigos com um olhar pessoal e intimista, explorando linguagem e pensamento crítico. Atua unindo criatividade, estratégia e SEO, produzindo conteúdos que transitam entre cultura, cinema, comportamento e o universo do conteúdo digital.

Fique por dentro do que gera resultados

 Descubra o que realmente move os resultados das marcas digitais. Toda semana, um conteúdo prático e estratégico para você aplicar no seu negócio.

Este campo é obrigatório.
Este campo é obrigatório.

Este site é protegido pelo reCAPTCHA e pela Política de privacidade e Termos de Uso do Google.

Recomendados

Mãos de uma pessoa digitando no teclado de um notebook prata sobre uma mesa de madeira, com outras pessoas ao fundo.

Como trabalhar SEO para um site institucional?

Notebook sobre mesa com página inicial do Google aberta no navegador Chrome, ao lado de uma planta.

E-E-A-T: como aplicar na estratégia de conteúdo

Mãos digitando em um notebook sobre uma mesa de madeira, com ícones de Inteligência Artificial sobrepostos à imagem, incluindo um cérebro com a sigla "AI", engrenagens, gráficos e símbolos de conectividade global.

GEO: o que é, como funciona e seu impacto no SEO

Câmera em tripé grava um criador de conteúdo sorrindo em sua mesa de trabalho. O ambiente tem iluminação neon roxa e azul ao fundo.

10 dicas para criar conteúdo digital de qualidade

Garoto vestindo camiseta branca em ambiente com pouca iluminação, observando atentamente a tela de um notebook. Na tela e ao redor dela, há ilustrações digitais luminosas de ícones educativos — incluindo um player de vídeo, livro aberto, lâmpada, capelo, lupa e um tubo de ensaio —, além do texto "Education" em tom azul neon sobre um fundo digital.

Dia Mundial da Alfabetização e o que muda com a IA

plugins premium WordPress

Falta pouco para começarmos a análise

Informações para contato

Este campo é obrigatório.
+55
Este campo é obrigatório.
Este campo é obrigatório.
Este campo é obrigatório.
Este campo é obrigatório.
Este campo é obrigatório.
Este site é protegido pelo reCAPTCHA e pela Política de privacidade e Termos de Uso do Google.

A Ecto tem um compromisso com sua Privacidade, portanto, ao clicar em ENVIAR os dados inseridos por você serão utilizados para possibilitar o nosso contato e lhe oferecer serviços que possam ser de seu interesse ou da empresa a qual você representa. Este formulário é destinado para maiores de 18 anos.

Você poderá cancelar o envio dessas mensagens a qualquer momento. Em caso de dúvidas acesse nossa Política de Privacidade