Özet

Robots.txt Tarama Yönetir; İndeks Gizleme Aracı Değildir.

  • Robots.txt dosyası alan adının kök dizininde yer alır.
  • Crawler’lara hangi yolların taranıp taranmayacağını bildirir.
  • Bir sayfanın Google’da görünmesini engellemek için tek başına robots.txt yeterli değildir.

Robots.txt Nedir?

Robots.txt, web sitenizin kök dizininde bulunan ve arama motoru crawler’larına tarama talimatı veren bir metin dosyasıdır. Örneğin `https://example.com/robots.txt` adresinde yer alır.

Bu dosya, hangi crawler’ın hangi URL yollarına erişebileceğini veya erişemeyeceğini belirtir. Ancak kritik nokta şudur: robots.txt bir indeks gizleme mekanizması değildir.

Basit Robots.txt Örneği

Basit bir robots.txt dosyası tüm crawler’lara izin verebilir ve site haritasının yerini gösterebilir. Daha karmaşık sitelerde filtre, arama sonucu, sepet, kullanıcı paneli veya düşük değerli parametre yolları kontrollü şekilde yönetilebilir.

User-agent: *
Disallow:

Sitemap: https://www.example.com/sitemap.xml

Robots.txt İçinde Hangi Komutlar Kullanılır?

En sık kullanılan komutlar User-agent, Disallow, Allow ve Sitemap satırlarıdır. Komutların sırası, kapsamı ve hangi crawler’a uygulandığı dikkatli yazılmalıdır.

KomutAnlamıÖrnek
User-agentTalimatın hangi crawler’a uygulanacağını belirtir.User-agent: Googlebot
DisallowBelirli yolun taranmasını engeller.Disallow: /arama/
AllowEngellenmiş yol içinde izin verilen alt yolu belirtir.Allow: /wp-admin/admin-ajax.php
SitemapSite haritası URL’sini bildirir.Sitemap: https://example.com/sitemap.xml

Robots.txt Dosyasında Neler Olmalı?

Robots.txt dosyasında gereksiz karmaşa olmamalıdır. Sadece gerçekten taranmasını istemediğiniz düşük değerli, tekrar üreten veya crawler bütçesini bozan alanlar yönetilmelidir.

Önemli organik sayfalar yanlışlıkla engellenmemelidir. Özellikle CSS, JS veya render için gerekli dosyaları kapatmak sayfanın Google tarafından doğru işlenmesini zorlaştırabilir.

  • Site haritası konumu eklenebilir.
  • Arama sonucu, filtre veya parametre alanları kontrollü yönetilebilir.
  • Özel veya gizli sayfalar için robots.txt’e güvenilmemelidir.
  • Önemli kategori, ürün, hizmet ve blog sayfaları engellenmemelidir.
  • CSS ve JS dosyaları sayfa render’ı için gerekiyorsa kapatılmamalıdır.

Robots.txt Hataları Nelerdir?

Robots.txt hataları bazen büyük organik kayıplara neden olabilir. Özellikle canlıya çıkışta test ortamından kalan `Disallow: /` gibi kurallar, tüm sitenin taranmasını engelleyebilir.

Bir diğer yaygın hata, noindex yapılması gereken sayfayı robots.txt ile engellemektir. Google sayfayı tarayamazsa noindex etiketini de göremeyebilir.

  1. 01
    Tüm Siteyi Engelleme

    Disallow: / kuralı canlı sitede kalmış mı kontrol et.

  2. 02
    Noindex ile Çakışma

    Noindex görülmesi gereken sayfayı robots ile kapatma.

  3. 03
    Yanlış Wildcard

    Parametre veya yol kurallarının kritik sayfaları etkilemediğini test et.

  4. 04
    Güncel Sitemap

    Site haritası URL’sinin doğru ve erişilebilir olduğundan emin ol.

Robots.txt Nasıl Test Edilir?

Robots.txt değişiklikleri canlıya alınmadan önce mutlaka test edilmelidir. Search Console URL Denetimi, robots test araçları ve crawl simülasyonları birlikte kullanılabilir.

Değişiklik sonrası önemli URL’lerin taranabilir kalıp kalmadığı, site haritası ve indeks kapsamı raporlarıyla takip edilmelidir.

Yararlanılan Referanslar.

Bu yazının ana çerçevesi saha deneyimiyle kurulmuştur; teknik tanım ve sınırları netleştirmek için aşağıdaki resmi veya birincil kaynaklar dikkate alınmıştır.

Referans Google Robots.txt Introduction

https://developers.google.com/search/docs/crawling-indexing/robots/intro

Sıradaki Okuma

Google'da En Üst Sıraya Çıkmak: 10 İpucu

Google’da en üst sıraya çıkmanın garantili formülü yoktur; ama doğru niyet, güçlü içerik, teknik sağlık ve güven sinyalleriyle şansınızı ciddi biçimde artırabilirsiniz.

İncele Tüm Yazılar