SEO çalışmalarında çoğu zaman anahtar kelime, içerik kalitesi, backlink, site hızı ve kullanıcı deneyimi gibi konular öne çıkar. Ancak özellikle büyük web sitelerinde organik performansı etkileyen çok kritik bir teknik SEO konusu daha vardır: crawl budget, yani arama motoru tarama bütçesi.
Crawl budget, Googlebot’un bir web sitesinde belirli bir zaman aralığında tarayabileceği ve taramak isteyeceği URL setini ifade eder. Google’ın güncel crawl budget dokümanında bu kavram, “crawl capacity limit” ve “crawl demand” bileşenleriyle açıklanır. Yani Google yalnızca teknik olarak kaç URL tarayabileceğine değil, aynı zamanda hangi URL’leri taramaya değer gördüğüne de bakar.
Küçük ve orta ölçekli sitelerde crawl budget çoğu zaman büyük bir problem değildir. Ancak e-ticaret siteleri, haber siteleri, ilan siteleri, marketplace yapıları, forumlar, çok dilli siteler ve milyonlarca URL üreten platformlarda crawl budget yönetimi SEO performansını doğrudan etkileyebilir.
Crawl Budget Nedir?
Crawl budget, Googlebot’un bir web sitesinde taramaya ayırdığı kaynakların toplamı olarak düşünülebilir. Googlebot bir siteyi ziyaret ettiğinde her URL’yi aynı sıklıkta taramaz. Bazı sayfalar daha sık ziyaret edilirken bazı sayfalar çok daha nadir taranabilir. Bazı URL’ler ise keşfedilmesine rağmen uzun süre taranmayabilir veya taransa bile indekslenmeyebilir.

Google, crawl budget’ı iki ana bileşen üzerinden tanımlar: crawl capacity limit ve crawl demand. Crawl capacity limit, Google’ın sunucunuzu zorlamadan ne kadar tarama yapabileceğini ifade eder. Crawl demand ise Google’ın belirli URL’leri taramaya ne kadar ihtiyaç duyduğunu gösterir. Bu iki faktör birlikte sitenin crawl budget’ını oluşturur.
Basit bir örnekle açıklamak gerekirse; sitenizde 1 milyon URL varsa Googlebot bu URL’lerin tamamını aynı gün taramak zorunda değildir. Google, sunucu kapasitenizi, sayfaların önemini, güncellenme sıklığını, kalite sinyallerini, popülerliği ve URL envanterinin temizliğini değerlendirerek hangi sayfaları ne sıklıkla tarayacağına karar verir.
Crawl Budget Her Site İçin Önemli mi?
Crawl budget her web sitesi için aynı öneme sahip değildir. Google, hızlı değişen çok sayıda sayfası olmayan veya yeni sayfaları yayınlandığı gün taranan siteler için bu rehberin genellikle gerekli olmadığını belirtir. Bu tür sitelerde güncel sitemap kullanmak ve indeks kapsamını düzenli kontrol etmek çoğu zaman yeterlidir.
Crawl budget özellikle şu site türleri için kritik hale gelir:
- 1 milyon ve üzeri benzersiz URL’ye sahip büyük siteler
- 10.000 ve üzeri benzersiz URL’ye sahip, içeriği günlük değişen siteler
- Search Console’da çok sayıda “Discovered – currently not indexed” URL’si bulunan siteler
- Filtreleme ve sıralama parametreleriyle binlerce URL üreten e-ticaret siteleri
- Haber, ilan, forum, marketplace ve seyahat platformları
- Çok dilli veya çok bölgeye hizmet veren büyük siteler
- Sık ürün ekleyen, stok güncelleyen veya fiyat değiştiren siteler
Google bu eşikleri kesin sınırlar olarak değil, site sahiplerinin kendilerini sınıflandırmasına yardımcı olacak yaklaşık göstergeler olarak paylaşır.
Crawl Budget Neden Büyük Siteler İçin Kritik?
Büyük web sitelerinde en büyük problem yalnızca çok sayıda sayfa olması değildir. Asıl problem, Googlebot’un önemli sayfalar yerine düşük değerli, tekrar eden veya indekslenmesi gerekmeyen URL’lere zaman harcamasıdır.
Örneğin bir e-ticaret sitesinde kategori, ürün, filtre, sıralama, renk, beden, fiyat aralığı, stok durumu, kampanya, sayfalama ve arama sonucu URL’leri kontrolsüz şekilde çoğalabilir. 50.000 ürünlü bir site, yanlış URL yapısıyla milyonlarca taranabilir URL üretebilir. Googlebot bu URL’leri taramaya başladığında önemli ürün ve kategori sayfalarına yeterince hızlı ulaşamayabilir.
Bu durum özellikle şu sonuçlara yol açabilir:
Yeni ürün sayfalarının geç keşfedilmesi, güncellenen fiyat veya stok bilgilerinin geç işlenmesi, stratejik kategori sayfalarının geç taranması, düşük kaliteli sayfaların daha fazla crawl kaynağı tüketmesi, önemli URL’lerin “Discovered – currently not indexed” durumunda beklemesi ve organik görünürlüğün gecikmesi.
Bu nedenle büyük sitelerde crawl budget yönetimi, yalnızca teknik SEO detayı değil; ürün görünürlüğü, kategori performansı, sezon kampanyaları ve organik gelir için önemli bir altyapı konusudur.
Google Crawl Budget’ı Nasıl Belirler?
Google crawl budget’ı belirlerken temel olarak iki ana unsuru dikkate alır: sitenin taranabilir kapasitesi ve URL’lerin taranma talebi.

Crawl Capacity Limit Nedir?
Crawl capacity limit, Googlebot’un sunucunuzu zorlamadan yapabileceği maksimum tarama miktarıdır. Google, web sitelerini tararken kullanıcı deneyimini bozmak veya sunucuyu aşırı yüklemek istemez. Bu nedenle aynı anda kaç bağlantı açılabileceği ve istekler arasında ne kadar beklenmesi gerektiği gibi faktörleri otomatik olarak hesaplar.
Eğer site uzun süre hızlı yanıt verirse ve sunucu sağlığı iyi görünürse Google daha fazla bağlantıyla tarama yapabilir. Ancak site yavaşlarsa, bağlantı zaman aşımına uğrarsa veya 5xx sunucu hataları artarsa Googlebot tarama hızını düşürebilir. Google’ın crawl budget dokümanında da site yavaşladığında veya sunucu hataları verdiğinde crawl capacity limit’in düşebileceği belirtilir.
Bu nedenle site performansı sadece kullanıcı deneyimi açısından değil, tarama verimliliği açısından da önemlidir. Hızlı ve stabil çalışan bir altyapı, Googlebot’un aynı kaynakla daha fazla sayfayı taramasına yardımcı olabilir.
Crawl Demand Nedir?
Crawl demand, Google’ın bir URL’yi taramaya ne kadar ihtiyaç duyduğunu ifade eder. Googlebot teorik olarak daha fazla URL tarayabilecek kapasiteye sahip olsa bile, eğer tarama talebi düşükse site daha az taranabilir.
Google’a göre crawl demand üzerinde etkili olan önemli faktörler arasında URL envanteri, popülerlik ve güncellik yer alır. Google, site sahibinden net yönlendirme almadığında bildiği URL’lerin çoğunu taramaya çalışabilir. Eğer bu URL’lerin büyük bölümü kopya, kaldırılmış, önemsiz veya indekslenmesi gerekmeyen sayfalardan oluşuyorsa Google’ın tarama kaynakları verimsiz kullanılmış olur.
Popüler sayfalar genellikle daha sık taranabilir. Sık değişen veya güncelliğini koruması gereken sayfalar da Google tarafından yeniden taranmak istenebilir. Buna karşılık düşük kaliteli, benzer, eski veya kullanıcı değeri zayıf URL’ler crawl demand açısından daha düşük öncelikli olabilir.
Crawl Budget ve Indexleme Arasındaki İlişki
Crawl budget doğrudan indeksleme garantisi vermez. Bir sayfanın Googlebot tarafından taranması, o sayfanın mutlaka Google indeksine ekleneceği anlamına gelmez. Google, taranan her sayfanın indekslenmeyeceğini; sayfanın tarama sonrası değerlendirme, konsolidasyon ve uygunluk süreçlerinden geçtiğini belirtir.
Bu ayrım büyük siteler için çok önemlidir. Çünkü bazı SEO ekipleri “Googlebot sayfayı taradıysa sorun yok” diye düşünebilir. Oysa önemli olan yalnızca taranmak değil, doğru sayfaların taranması, doğru sayfaların indekslenmesi ve organik aramada değer üretecek URL’lerin Google tarafından önceliklendirilmesidir.
Bu nedenle crawl budget optimizasyonu, sadece “daha çok URL taransın” hedefiyle yapılmamalıdır. Asıl hedef, Googlebot’un doğru URL’leri daha verimli taraması olmalıdır.
Crawl Budget’ı En Çok Ne Tüketir?
Büyük sitelerde crawl budget çoğunlukla düşük değerli URL’ler nedeniyle boşa harcanır. Google, birçok düşük değerli URL’nin sitenin tarama ve indeksleme performansını olumsuz etkileyebileceğini belirtir. Bu tür URL’ler arasında faceted navigation, session ID’ler, site içi duplicate content, soft 404 sayfalar, hacked pages, infinite spaces ve düşük kaliteli içerikler yer alır.
Filtre ve Sıralama URL’leri
E-ticaret ve ilan sitelerinde en büyük crawl budget problemlerinden biri filtreleme URL’leridir. Kullanıcılar kategori sayfalarında renk, beden, fiyat, marka, stok durumu, lokasyon, puan veya ürün tipi gibi filtreler kullanabilir. Bu filtreler URL parametreleriyle çalışıyorsa, her kombinasyon yeni bir URL oluşturabilir.
Google, faceted navigation yapısının URL parametreleri üzerinden uygulandığında neredeyse sınırsız URL alanı oluşturabileceğini ve bunun iki büyük probleme yol açabileceğini belirtir: fazla tarama ve yeni yararlı URL’lerin daha yavaş keşfedilmesi.
Örneğin şu URL’leri düşünelim:
/ayakkabi?renk=siyah
/ayakkabi?renk=siyah&beden=42
/ayakkabi?renk=siyah&beden=42&siralama=fiyat-artan
/ayakkabi?renk=siyah&beden=42&siralama=fiyat-artan&stok=var
Bu URL’lerin bazıları kullanıcı için faydalı olabilir; ancak hepsinin indekslenmesi veya taranması gerekmez. Özellikle sıralama, görünüm, stok filtresi, session ID, takip parametresi ve site içi arama URL’leri kontrol edilmezse Googlebot’un önemli kategori ve ürün sayfaları yerine düşük değerli kombinasyonlara zaman harcaması mümkündür.
Duplicate Content
Duplicate content, yani aynı veya çok benzer içeriğin farklı URL’ler üzerinden erişilebilir olması crawl budget verimliliğini düşürür. Aynı ürünün farklı parametrelerle, farklı kategori yollarıyla, HTTP/HTTPS veya www/non-www varyasyonlarıyla, trailing slash farkıyla ya da büyük-küçük harf farklılıklarıyla erişilebilir olması Googlebot’un aynı içeriği tekrar tekrar taramasına neden olabilir.
Google, duplicate content’i konsolide etmenin crawling’i benzersiz URL’ler yerine benzersiz içeriklere odaklamak için önemli olduğunu belirtir.
Bu nedenle canonical kullanımı, redirect standardizasyonu, sitemap temizliği ve iç linklerin doğru canonical URL’ye yönlendirilmesi büyük sitelerde crawl budget yönetiminin temel parçalarıdır.
Soft 404 Sayfalar
Soft 404, kullanıcının aslında mevcut olmayan veya değer üretmeyen bir sayfaya gelmesine rağmen sunucunun 200 başarılı yanıt kodu döndürmesidir. Örneğin stokta olmayan ve kaldırılmış bir ürün sayfası “ürün bulunamadı” mesajı gösteriyor ama HTTP 200 dönüyorsa Google bunu soft 404 olarak değerlendirebilir.
Google, soft 404 sayfaların taranmaya devam edeceğini ve crawl budget’ı boşa harcayacağını belirtir.
Büyük sitelerde soft 404 problemleri özellikle ürün kaldırma, ilan süresi dolma, arama sonucu olmayan sayfalar, boş kategori sayfaları ve yanlış filtre kombinasyonlarında görülür. Bu sayfalar doğru HTTP status koduyla yönetilmezse Googlebot gereksiz URL’leri tekrar tekrar tarayabilir.
Sonsuz URL Alanları
Sonsuz URL alanı, teknik olarak bitmeyen veya kontrolsüz şekilde çoğalan URL yapılarıdır. Takvim sayfalarında sınırsız gelecek tarih üretmek, sonsuz pagination URL’leri, arama parametreleri, hatalı relative linkler veya filtre kombinasyonları bu probleme yol açabilir.
Google’ın URL yapısı rehberinde, dinamik takvimlerin sınırsız tarih URL’leri üretebileceği ve bazı hatalı bağlantı yapılarının sonsuz URL alanları oluşturabileceği belirtilir. Bu tür problemli URL’ler tespit edildiğinde robots.txt ile engelleme gibi yöntemler önerilir.
Uzun Redirect Zincirleri
Redirect zincirleri, Googlebot’un bir URL’den diğerine, sonra başka bir URL’ye yönlendirilmesi anlamına gelir. Örneğin A URL’si B’ye, B URL’si C’ye, C URL’si D’ye yönleniyorsa Googlebot gereksiz adımlar izler. Bu durum tarama verimliliğini düşürebilir.
Google, uzun redirect zincirlerinden kaçınılması gerektiğini ve bunların crawling üzerinde olumsuz etkisi olduğunu belirtir.
Büyük sitelerde redirect zincirleri genellikle eski URL yapıları, kategori taşımaları, HTTP’den HTTPS’e geçiş, trailing slash değişiklikleri, kampanya URL’leri ve migration sonrası temizlik eksikliklerinden kaynaklanır.
Noindex Sayfalar Crawl Budget’ı Tüketir mi?
Noindex, bir sayfanın indekse alınmamasını sağlamak için kullanılır; ancak Google’ın noindex etiketini görebilmesi için sayfayı taraması gerekir. Google’ın crawling myths dokümanında da noindex kullanılan URL’lerin taranmasının crawl budget’ı etkileyebileceği belirtilir.
Bu nedenle noindex, indeks kontrolü için doğru bir yöntemdir; fakat crawl budget kontrolü için her zaman en iyi yöntem değildir. Eğer bir URL’nin Google tarafından hiç taranmasını istemiyorsanız robots.txt daha uygun olabilir. Ancak sayfanın arama sonuçlarından çıkarılması gerekiyorsa noindex kullanılmalıdır. Bu ayrım büyük sitelerde çok önemlidir.
Robots.txt Crawl Budget Yönetiminde Nasıl Kullanılır?
Robots.txt, arama motoru botlarına hangi URL’leri tarayabileceklerini veya tarayamayacaklarını belirtmek için kullanılır. Google, robots.txt dosyasının esas olarak crawler trafiğini yönetmek için kullanıldığını; ancak bir web sayfasını Google’dan gizlemek için doğru yöntem olmadığını açıklar. Bir sayfanın Google sonuçlarında görünmesini engellemek için noindex veya parola koruması gibi yöntemler gerekir.
Crawl budget açısından robots.txt özellikle şu sayfaları engellemek için kullanılabilir:
- Site içi arama sonuçları
- Sepet ve ödeme adımları
- Üye paneli veya hesap sayfaları
- Sıralama parametreleri
- Gereksiz filtre kombinasyonları
- Sonsuz takvim URL’leri
- Oturum ve takip parametreleri
- Aynı içeriği farklı sırada gösteren URL’ler
Ancak robots.txt dikkatli kullanılmalıdır. İndekslenmesi gereken kategori, ürün, içerik veya kaynak dosyaları yanlışlıkla engellenirse Google sayfayı tam anlamıyla tarayamayabilir veya sayfa içeriğini değerlendiremeyebilir.
Canonical Crawl Budget’a Nasıl Katkı Sağlar?
Canonical etiketi, benzer veya kopya sayfalar arasında tercih edilen URL’yi Google’a belirtmek için kullanılır. Google’a göre canonical belirtmek için yönlendirmeler güçlü bir sinyal, rel canonical etiketi güçlü bir sinyal, sitemap dahil etme ise daha zayıf bir sinyaldir. Bu sinyaller birlikte kullanıldığında canonical tercihinin Google tarafından anlaşılma ihtimali artar.
Crawl budget açısından canonical, duplicate URL’lerin zaman içinde daha az taranmasına yardımcı olabilir. Ancak canonical, robots.txt kadar doğrudan bir crawl engelleme yöntemi değildir. Google’ın faceted navigation rehberinde canonical’ın faceted URL’lerin crawl hacmini zaman içinde azaltabileceği, ancak robots.txt veya URL fragment gibi yöntemlere göre uzun vadede genellikle daha az etkili olduğu belirtilir.
Bu nedenle canonical daha çok “bu sayfaların ana versiyonu budur” demek için kullanılır. “Bu URL’leri hiç tarama” demek istiyorsanız robots.txt daha doğrudan bir yöntemdir.
XML Sitemap Crawl Budget İçin Neden Önemlidir?
XML sitemap, Google’a sitenizde hangi URL’leri önemsediğinizi ve taranmasını istediğinizi anlatan önemli bir sinyaldir. Sitemap doğrudan indeksleme garantisi vermez; Google, sitemap göndermenin bir ipucu olduğunu, Google’ın sitemap’i indireceğini veya içindeki tüm URL’leri taramada kullanacağını garanti etmediğini belirtir.
Buna rağmen büyük sitelerde sitemap yönetimi çok önemlidir. Çünkü sitemap, Google’a temiz ve öncelikli URL envanterinizi sunar. Google, sitemap oluştururken arama sonuçlarında gösterilmesini istediğiniz canonical URL’leri dahil etmenizi önerir.
Büyük sitelerde sitemap için dikkat edilmesi gerekenler şunlardır:
- Sadece indekslenebilir ve canonical URL’ler eklenmelidir.
- 3xx, 4xx, 5xx, noindex ve canonical dışı URL’ler sitemap’ten çıkarılmalıdır.
- Ürün, kategori, blog, marka ve lokasyon sayfaları ayrı sitemap’lerde gruplanabilir.
- Güncellenen içerikler için <lastmod> etiketi doğru kullanılmalıdır.
- Büyük sitemap dosyaları bölünmelidir.
Google’a göre tek bir sitemap dosyası 50 MB sıkıştırılmamış boyutu veya 50.000 URL sınırını aşmamalıdır. Daha büyük yapılar için birden fazla sitemap veya sitemap index dosyası kullanılabilir.
Büyük Sitelerde Crawl Budget Problemi Nasıl Anlaşılır?
Crawl budget problemi her zaman doğrudan görünmez. Bu nedenle Search Console, log analizi ve teknik crawl araçları birlikte değerlendirilmelidir.
Google Search Console Crawl Stats raporu, Googlebot’un siteyi nasıl taradığını anlamak için kullanılabilir. Bu raporda toplam crawl request, toplam indirme boyutu ve ortalama response time gibi zaman içi grafikler görülebilir. Ayrıca crawl istekleri response type, file type, crawl purpose ve Googlebot agent gibi kırılımlarla analiz edilebilir.
Dikkat edilmesi gereken sinyaller şunlardır:
- Önemli sayfalar uzun süredir taranmıyorsa
- Yeni ürün veya içerikler geç keşfediliyorsa
- “Discovered – currently not indexed” URL sayısı artıyorsa
- Googlebot çok sayıda parametreli URL tarıyorsa
- 5xx hataları veya timeout problemleri görülüyorsa
- Soft 404 hataları artıyorsa
- Sitemap’teki URL’ler taranmıyor ama düşük değerli URL’ler taranıyorsa
- Crawl request’lerin önemli bölümü CSS, JS, parametreli URL veya hata sayfalarına gidiyorsa
- Sunucu loglarında Googlebot’un stratejik sayfalara az geldiği görülüyorsa
Bu belirtiler tek başına kesin crawl budget problemi anlamına gelmeyebilir. Ancak büyük bir sitede birden fazla belirti aynı anda görülüyorsa crawl verimliliği detaylı incelenmelidir.
Crawl Budget Optimizasyonu Nasıl Yapılır?
Crawl budget optimizasyonunun amacı Googlebot’u daha fazla URL taramaya zorlamak değildir. Amaç, Googlebot’un değerli URL’lere daha hızlı ve daha verimli ulaşmasını sağlamaktır.
URL Envanterini Temizleyin
İlk adım, Googlebot’un hangi URL’lerle karşılaştığını anlamaktır. Büyük sitelerde URL envanteri çoğu zaman beklenenden çok daha büyüktür. Ürün ve kategori sayısı 100.000 görünürken, parametreler ve filtreler nedeniyle Google’ın keşfettiği URL sayısı milyonlara ulaşabilir.
Bu nedenle şu URL grupları ayrıştırılmalıdır:
İndekslenmesi gereken stratejik URL’ler, taranabilir ama indekslenmesi gerekmeyen URL’ler, hiç taranmaması gereken URL’ler, duplicate URL’ler, yönlenen URL’ler, hata veren URL’ler, soft 404 URL’ler, parametreli URL’ler ve orphan URL’ler.
Bu çalışma yapılmadan robots.txt, canonical veya sitemap optimizasyonu yapmak risklidir. Çünkü hangi URL’nin Google için değerli, hangisinin gereksiz olduğu netleşmeden yapılan müdahaleler önemli sayfaların görünürlüğünü etkileyebilir.
Önemli Sayfaları Sitemap ile Güçlendirin
Sitemap dosyaları temiz olmalıdır. Büyük sitelerde sitemap yalnızca tüm URL’leri listeleyen teknik bir dosya olarak görülmemelidir. Aynı zamanda Google’a öncelikli ve canonical URL envanterini göstermek için kullanılmalıdır.
Örneğin bir e-ticaret sitesinde ürün sitemap’i, kategori sitemap’i, marka sitemap’i ve blog sitemap’i ayrı tutulabilir. Böylece Search Console üzerinden hangi URL grubunun daha iyi tarandığı ve indekslendiği daha rahat analiz edilir.
Güncellenen içeriklerde <lastmod> etiketi doğru kullanılmalıdır. Ancak bu etiket yalnızca gerçek ve anlamlı içerik güncellemelerinde kullanılmalıdır. Google’ın crawling myths dokümanında yapay şekilde sayfa tarihini güncellemenin ek değer sağlamadığı; içeriğin kaliteye göre değerlendirildiği belirtilir.
Faceted Navigation Yapısını Kontrol Edin
Filtreleme URL’leri crawl budget yönetiminin en kritik alanlarından biridir. Google, faceted navigation URL’leri indekslenmek zorunda değilse bunların taranmasının robots.txt ile engellenebileceğini belirtir. Ayrıca yalnızca ürün detay sayfaları ve filtresiz listeleme sayfasının taranmasına izin vermek çoğu durumda daha verimli olabilir.
Ancak bazı filtre URL’leri SEO açısından değerli olabilir. Örneğin “siyah kadın bot”, “iPhone 15 kılıf”, “Ankara satılık daire” gibi arama hacmi olan kombinasyonlar indekslenmek istenebilir. Bu durumda tüm filtreleri kapatmak yerine SEO değeri olan filtre kombinasyonları için özel landing page yapısı oluşturmak daha doğru olur.
Burada önemli ayrım şudur:
SEO değeri olan filtre sayfaları optimize edilerek indekslenebilir hale getirilmeli, SEO değeri olmayan sıralama ve varyasyon URL’leri ise tarama dışı bırakılmalıdır.
Duplicate URL’leri Konsolide Edin
Duplicate URL’leri azaltmak için canonical, 301 yönlendirme, iç link standardizasyonu ve sitemap temizliği birlikte kullanılmalıdır. Google, canonical tercih sinyallerinin birlikte kullanıldığında daha etkili olabileceğini belirtir.
Örneğin aynı ürün şu URL’lerle erişiliyorsa problem oluşur:
/urun/ayakkabi-123
/kampanya/urun/ayakkabi-123
/kategori/spor-ayakkabi/ayakkabi-123
/urun/ayakkabi-123?color=black
Bu URL’lerden biri canonical olarak belirlenmeli, iç linkler bu URL’ye verilmeli, sitemap’te yalnızca canonical URL yer almalı ve gerekiyorsa duplicate varyasyonlar yönlendirilmelidir.
Soft 404 ve Boş Sayfaları Temizleyin
Büyük sitelerde özellikle stok dışı ürünler, süresi dolmuş ilanlar, boş kategori sayfaları ve sonuç üretmeyen filtre kombinasyonları soft 404 problemine dönüşebilir.
Google, kalıcı olarak kaldırılan sayfalar için 404 veya 410 HTTP status kodu döndürülmesini önerir. Ayrıca soft 404 sayfaların taranmaya devam ederek crawl budget’ı boşa harcayabileceğini belirtir.
Burada sayfa tipine göre karar verilmelidir:
Kalıcı olarak kaldırılan ve alternatifi olmayan sayfalar 404 veya 410 dönebilir. Benzer veya üst kategoriye yönlendirilmesi anlamlı olan sayfalar 301 ile taşınabilir. Geçici stok dışı ürünler kullanıcı için değerli bilgi sunuyorsa 200 kalabilir; ancak sayfa gerçekten boşsa ve hiçbir değer üretmiyorsa soft 404 riskine dikkat edilmelidir.
Sunucu Sağlığını ve Response Time’ı İyileştirin
Crawl budget yalnızca URL sayısıyla ilgili değildir. Sunucunun Googlebot isteklerine nasıl yanıt verdiği de önemlidir. Google, site yavaşladığında veya sunucu hataları oluştuğunda crawl capacity limit’in düşebileceğini açıklar.
Bu nedenle büyük sitelerde şu teknik metrikler izlenmelidir:
- Ortalama response time
- 5xx hata oranı
- Timeout oranı
- DNS problemleri
- CDN kaynaklı engellemeler
- Bot trafiğine karşı yanlış güvenlik duvarı kuralları
- Yoğun kampanya dönemlerinde sunucu kapasitesi
- Googlebot’un statik kaynaklara erişimi
Google’ın crawling errors dokümanında availability sorunlarının Google’ın siteyi istediği kadar taramasını engelleyebileceği; Crawl Stats raporunun Googlebot’un crawl geçmişini ve availability problemlerini incelemek için kullanılabileceği belirtilir.
Redirect Zincirlerini Kısaltın
Redirect zincirleri hem kullanıcı deneyimini hem de crawl verimliliğini olumsuz etkiler. Google, uzun redirect zincirlerinden kaçınılmasını önerir.
En iyi yapı, eski URL’nin doğrudan final canonical URL’ye yönlenmesidir. Örneğin:
Yanlış yapı:
A → B → C → D
Doğru yapı:
A → D
B → D
C → D
Özellikle site taşıma, kategori yeniden yapılandırma, HTTPS geçişi ve ürün URL güncellemelerinde redirect zincirleri düzenli olarak kontrol edilmelidir.
İç Linkleme Yapısını Güçlendirin
Googlebot sitenizdeki URL’leri iç linkler üzerinden keşfeder. Önemli sayfalar ana sayfa, kategori, menü, breadcrumb, ürün önerileri, blog içerikleri veya listeleme sayfaları üzerinden güçlü şekilde linklenmiyorsa Googlebot bu sayfalara daha geç ulaşabilir.
Büyük sitelerde şu yapılar önemlidir:
Ana kategori sayfalarından alt kategorilere net linkleme, breadcrumb kullanımı, önemli ürünlerin kategori yapısı içinde erişilebilir olması, orphan sayfaların azaltılması, paginated listeleme sayfalarının doğru bağlanması, içerikten kategori ve ürün sayfalarına stratejik iç link verilmesi.
Google’ın myths dokümanında ana sayfaya yakın linklenen sayfaların daha önemli görülebileceği ve daha sık taranabileceği; ancak bunun doğrudan daha yüksek sıralama anlamına gelmediği açıklanır.
JavaScript ve Kaynak Dosyalarını Verimli Yönetin
Googlebot yalnızca HTML’i değil, sayfayı anlamak için gerekli CSS, JavaScript ve diğer kaynakları da işleyebilir. Google’ın crawling myths dokümanında alternatif URL’ler, AMP veya hreflang gibi URL’ler ve CSS/JavaScript gibi gömülü kaynakların crawl budget tüketebileceği belirtilir.
Bu nedenle özellikle JavaScript ağırlıklı sitelerde şu konular kontrol edilmelidir:
Önemli içerik HTML içinde erişilebilir mi, Googlebot JS kaynaklarına erişebiliyor mu, gereksiz script dosyaları azaltıldı mı, render süresi yüksek mi, filtre ve pagination linkleri crawl edilebilir mi, kaynak dosyaları cache edilebilir ve tekrar kullanılabilir şekilde mi sunuluyor?
Burada amaç Googlebot’un sayfayı anlaması için gerekli kaynakları engellemek değildir. Tam tersine, gereksiz kaynak yükünü azaltıp sayfanın daha hızlı yüklenmesini ve render edilmesini sağlamaktır.
Noindex ve Robots.txt Ayrımını Doğru Yapın
Crawl budget yönetiminde en sık yapılan hatalardan biri noindex ve robots.txt’i aynı amaçla kullanmaktır. Noindex, sayfanın indeksten çıkarılması için kullanılır. Ancak Google’ın noindex’i görmesi için sayfayı taraması gerekir. Robots.txt ise Googlebot’un URL’yi taramasını engeller; ancak sayfanın başka kaynaklardan keşfedilmesi durumunda URL’nin arama sonuçlarında açıklamasız görünme ihtimali tamamen ortadan kalkmayabilir.
Bu nedenle kullanım mantığı şöyle olmalıdır:
Sayfa arama sonuçlarında görünmesin ama Google’ın etiketi okuyabilmesi gerekiyorsa noindex kullanılmalıdır. Sayfanın Google tarafından taranması gerekmiyorsa ve uzun vadede crawl dışı kalması isteniyorsa robots.txt düşünülebilir. Kalıcı olarak kaldırılmış bir sayfa varsa 404 veya 410 daha doğru olabilir. Duplicate sayfalarda ise canonical veya redirect kullanılmalıdır.
Crawl Budget Optimizasyonunda Hangi Metrikler Takip Edilmeli?
Crawl budget optimizasyonunun etkisini anlamak için yalnızca toplam tarama sayısına bakmak yeterli değildir. Önemli olan taramanın kalitesidir.
Takip edilmesi gereken başlıca metrikler şunlardır:
- Günlük toplam crawl request sayısı
- Ortalama response time
- 5xx hata oranı
- 404 ve 410 dağılımı
- Soft 404 sayısı
- Parametreli URL crawl oranı
- Sitemap URL’lerinin crawl oranı
- İndekslenebilir URL’lerin crawl oranı
- “Discovered – currently not indexed” trendi
- “Crawled – currently not indexed” trendi
- Googlebot’un en çok taradığı dizinler
- Googlebot’un en az taradığı önemli dizinler
- Crawl edilen URL’lerin canonical durumu
- Crawl edilen URL’lerin sitemap içinde olup olmaması
- Crawl edilen URL’lerin gelir veya SEO değeri
Bu analizler Search Console ve server log verileri birlikte kullanılarak yapılmalıdır. Search Console genel trendleri gösterirken, server logları Googlebot’un gerçekte hangi URL’leri ne zaman taradığını daha detaylı görmeyi sağlar.
Crawl Budget Hakkında Yanlış Bilinenler
Crawl budget konusunda birçok yanlış bilgi vardır. Bu yanlışlar büyük sitelerde hatalı SEO kararlarına yol açabilir.
Crawl Budget Bir Sıralama Faktörü Değildir
Crawl budget’ın iyileştirilmesi doğrudan daha yüksek sıralama anlamına gelmez. Google, crawl rate’i artırmanın Google Search sonuçlarında daha iyi pozisyonları zorunlu olarak sağlamayacağını ve crawling’in ranking signal olmadığını belirtir. Ancak crawling, bir sayfanın arama sonuçlarında yer alabilmesi için gerekli süreçlerden biridir.
Yani crawl budget bir sıralama faktörü değildir; fakat önemli sayfalar taranmaz veya güncellenmezse organik görünürlük dolaylı olarak etkilenebilir.
Crawl Delay Googlebot İçin Çalışmaz
Bazı web yöneticileri robots.txt dosyasındaki crawl-delay kuralıyla Googlebot’un hızını kontrol edebileceğini düşünebilir. Google’ın crawling myths dokümanında Google crawler’larının standart olmayan crawl-delay robots.txt kuralını işlemediği belirtilir.
Googlebot’un tarama hızını azaltmak için Search Console’daki ilgili ayarlar veya sunucu taraflı çözümler kullanılabilir; ancak amaç genellikle Googlebot’u yavaşlatmak değil, sitenin daha sağlıklı ve verimli taranmasını sağlamaktır.
Query Parametreleri Her Zaman Kötü Değildir
Google, query parametrelerini tarayabilir. Sorun parametre kullanmak değil, parametrelerin kontrolsüz şekilde sonsuz ve düşük değerli URL üretmesidir. Google’ın myths dokümanında “Google temiz URL’leri tercih eder ve query parametrelerini sevmez” yaklaşımının doğru olmadığı, Google’ın parametreleri tarayabildiği belirtilir.
Bu nedenle tüm parametreli URL’leri otomatik olarak kötü görmek yerine, hangi parametrelerin SEO değeri oluşturduğunu, hangilerinin yalnızca sıralama veya görünüm değiştirdiğini analiz etmek gerekir.
4xx Sayfalar Her Zaman Crawl Budget İsrafı Değildir
Google’ın myths dokümanında 429 dışındaki 4xx HTTP status kodlarının crawl budget’ı boşa harcamadığı belirtilir. Googlebot sayfayı taramayı dener, status kodunu alır ve içerik işlemez.
Bu nedenle kalıcı olarak kaldırılmış sayfalarda doğru 404 veya 410 kullanmak, soft 404 olarak 200 döndürmekten daha sağlıklıdır. Sorun 404 vermek değil, önemli iç linklerin bozuk sayfalara yönlenmesi veya çok sayıda değerli URL’nin yanlışlıkla 404’e düşmesidir.
Büyük Siteler İçin Crawl Budget Kontrol Listesi
Büyük bir web sitesinde crawl budget çalışması yapılırken aşağıdaki maddeler düzenli olarak kontrol edilmelidir:
- Sitemap yalnızca canonical ve indekslenebilir URL’lerden oluşuyor mu?
- Sitemap dosyaları 50.000 URL ve 50 MB sınırına uygun mu?
- Googlebot düşük değerli parametreli URL’leri çok fazla tarıyor mu?
- Filtreleme ve sıralama URL’leri kontrol altında mı?
- Site içi arama sonuçları taramaya açık mı?
- Sepet, ödeme, hesap ve aksiyon sayfaları crawl dışı mı?
- Soft 404 sayfalar temizlendi mi?
- Kaldırılan ürün veya ilanlar doğru status kodu ile yönetiliyor mu?
- Duplicate URL’ler canonical veya redirect ile konsolide edildi mi?
- İç linkler canonical URL’lere mi gidiyor?
- Redirect zincirleri kısaltıldı mı?
- 5xx hataları ve timeout problemleri düşük seviyede mi?
- Googlebot önemli kategori ve ürün sayfalarına düzenli ulaşıyor mu?
- Orphan sayfalar azaltıldı mı?
- Önemli sayfalar ana sayfaya ve kategori yapısına yakın mı?
- JavaScript kaynakları Googlebot tarafından erişilebilir mi?
- Search Console Crawl Stats düzenli inceleniyor mu?
- Log analizinde Googlebot’un URL dağılımı kontrol ediliyor mu?
Crawl Budget Optimizasyonu İçin Örnek Senaryo
Bir e-ticaret sitesinin 80.000 ürün sayfası, 2.000 kategori sayfası ve 20 farklı filtre tipi olduğunu düşünelim. Site görünürde 100.000 civarı önemli URL’ye sahip olsa da renk, beden, fiyat, stok, sıralama, marka ve kampanya parametreleri nedeniyle Google’ın keşfettiği URL sayısı milyonlara çıkabilir.
Bu durumda Googlebot ürün ve kategori sayfaları yerine şu URL’leri yoğun şekilde tarıyor olabilir:
?sort=price_asc
?view=grid
?stock=true
?color=black&size=42&sort=newest
?utm_source=newsletter
?sessionid=123
Bu sitenin crawl budget optimizasyonu için önce log analizi yapılır. Googlebot’un en çok hangi dizinleri ve parametreleri taradığı belirlenir. Ardından SEO değeri olmayan parametreler robots.txt veya teknik URL yönetimiyle kontrol altına alınır. Değerli filtre kombinasyonları için özel landing page stratejisi oluşturulur. Sitemap yalnızca canonical ürün, kategori ve marka sayfalarından oluşacak şekilde temizlenir. Soft 404 ürünler düzeltilir, redirect zincirleri kısaltılır ve iç linkleme yapısı önemli kategorileri güçlendirecek şekilde düzenlenir.
Bu çalışma sonucunda Googlebot’un daha az gereksiz URL taraması, önemli sayfalara daha sık ulaşması ve yeni ürünlerin daha hızlı keşfedilmesi hedeflenir.


Yorum Ekle