Robots.txt Tarama Yönetir; İndeks Gizleme Aracı Değildir.
- Robots.txt dosyası alan adının kök dizininde yer alır.
- Crawler’lara hangi yolların taranıp taranmayacağını bildirir.
- Bir sayfanın Google’da görünmesini engellemek için tek başına robots.txt yeterli değildir.
Robots.txt Nedir?
Robots.txt, web sitenizin kök dizininde bulunan ve arama motoru crawler’larına tarama talimatı veren bir metin dosyasıdır. Örneğin `https://example.com/robots.txt` adresinde yer alır.
Bu dosya, hangi crawler’ın hangi URL yollarına erişebileceğini veya erişemeyeceğini belirtir. Ancak kritik nokta şudur: robots.txt bir indeks gizleme mekanizması değildir.
Basit Robots.txt Örneği
Basit bir robots.txt dosyası tüm crawler’lara izin verebilir ve site haritasının yerini gösterebilir. Daha karmaşık sitelerde filtre, arama sonucu, sepet, kullanıcı paneli veya düşük değerli parametre yolları kontrollü şekilde yönetilebilir.
User-agent: *
Disallow:
Sitemap: https://www.example.com/sitemap.xml
Robots.txt İçinde Hangi Komutlar Kullanılır?
En sık kullanılan komutlar User-agent, Disallow, Allow ve Sitemap satırlarıdır. Komutların sırası, kapsamı ve hangi crawler’a uygulandığı dikkatli yazılmalıdır.
| Komut | Anlamı | Örnek |
|---|---|---|
| User-agent | Talimatın hangi crawler’a uygulanacağını belirtir. | User-agent: Googlebot |
| Disallow | Belirli yolun taranmasını engeller. | Disallow: /arama/ |
| Allow | Engellenmiş yol içinde izin verilen alt yolu belirtir. | Allow: /wp-admin/admin-ajax.php |
| Sitemap | Site haritası URL’sini bildirir. | Sitemap: https://example.com/sitemap.xml |
Robots.txt Dosyasında Neler Olmalı?
Robots.txt dosyasında gereksiz karmaşa olmamalıdır. Sadece gerçekten taranmasını istemediğiniz düşük değerli, tekrar üreten veya crawler bütçesini bozan alanlar yönetilmelidir.
Önemli organik sayfalar yanlışlıkla engellenmemelidir. Özellikle CSS, JS veya render için gerekli dosyaları kapatmak sayfanın Google tarafından doğru işlenmesini zorlaştırabilir.
- Site haritası konumu eklenebilir.
- Arama sonucu, filtre veya parametre alanları kontrollü yönetilebilir.
- Özel veya gizli sayfalar için robots.txt’e güvenilmemelidir.
- Önemli kategori, ürün, hizmet ve blog sayfaları engellenmemelidir.
- CSS ve JS dosyaları sayfa render’ı için gerekiyorsa kapatılmamalıdır.
Robots.txt Hataları Nelerdir?
Robots.txt hataları bazen büyük organik kayıplara neden olabilir. Özellikle canlıya çıkışta test ortamından kalan `Disallow: /` gibi kurallar, tüm sitenin taranmasını engelleyebilir.
Bir diğer yaygın hata, noindex yapılması gereken sayfayı robots.txt ile engellemektir. Google sayfayı tarayamazsa noindex etiketini de göremeyebilir.
-
01
Tüm Siteyi Engelleme
Disallow: / kuralı canlı sitede kalmış mı kontrol et.
-
02
Noindex ile Çakışma
Noindex görülmesi gereken sayfayı robots ile kapatma.
-
03
Yanlış Wildcard
Parametre veya yol kurallarının kritik sayfaları etkilemediğini test et.
-
04
Güncel Sitemap
Site haritası URL’sinin doğru ve erişilebilir olduğundan emin ol.
Robots.txt Nasıl Test Edilir?
Robots.txt değişiklikleri canlıya alınmadan önce mutlaka test edilmelidir. Search Console URL Denetimi, robots test araçları ve crawl simülasyonları birlikte kullanılabilir.
Değişiklik sonrası önemli URL’lerin taranabilir kalıp kalmadığı, site haritası ve indeks kapsamı raporlarıyla takip edilmelidir.
Yararlanılan Referanslar.
Bu yazının ana çerçevesi saha deneyimiyle kurulmuştur; teknik tanım ve sınırları netleştirmek için aşağıdaki resmi veya birincil kaynaklar dikkate alınmıştır.