robots.txt nasıl okunur?
Dosya gruplardan oluşur. Her grup bir veya daha fazla User-agent satırıyla başlar ve altındaki Allow / Disallow kuralları o botlar için geçerlidir. Bir bot önce kendi adının geçtiği grubu arar; bulamazsa User-agent: * grubunu uygular. Aynı adrese birden çok kural uyuyorsa en uzun (en özel) kural kazanır; eşitlikte Allow üstün gelir. Bu kurallar RFC 9309 standardında tanımlıdır ve oluşturucumuzdaki test aracı aynı mantıkla çalışır.
| Yazım | Anlamı |
|---|---|
Disallow: / | Sitenin tamamı kapalı |
Disallow: (boş) | Hiçbir engel yok |
Disallow: /admin/ | /admin/ ile başlayan her adres kapalı |
Disallow: /*?sirala= | İçinde ?sirala= geçen adresler kapalı (* joker) |
Disallow: /*.pdf$ | .pdf ile biten adresler kapalı ($ satır sonu) |
Yapay zeka botları için doğru ayar
Yapay zeka şirketleri artık farklı işler için farklı botlar kullanıyor. OpenAI'nin GPTBot'u model eğitimi için, OAI-SearchBot'u ChatGPT arama sonuçları için, ChatGPT-User ise bir kullanıcı sayfanızı açtırdığında gelir. Anthropic'te ClaudeBot, Claude-SearchBot ve Claude-User aynı ayrımı yapar. Bu yüzden "yapay zekayı engelle" tek bir karar değildir:
- Arama botlarını engellerseniz ChatGPT, Claude veya Perplexity yanıtlarında kaynak olarak gösterilme şansınızı kaybedersiniz.
- Eğitim botlarını engellerseniz içeriğiniz yeni modellerin eğitiminde kullanılmaz; arama görünürlüğünüz etkilenmez.
- Google-Extended yalnızca Gemini eğitimini etkiler; Google Arama ve AI Overviews için Googlebot'a bakılır.
Hazırladığınız dosyayı yükledikten sonra AI Bot Erişim Testi ile hem kuralların hem de güvenlik duvarınızın botlara izin verdiğini doğrulayın.
Sık yapılan hatalar
- Canlıya alırken geliştirme ortamından kalan
Disallow: /satırını unutmak. - CSS ve JS klasörlerini kapatmak: Google sayfayı doğru çizemez.
- Gizli kalması gereken adresleri robots.txt'ye yazmak: dosya herkese açıktır, bu adresleri ifşa eder.
- Sayfayı hem
Disallowile kapatıp hemnoindexeklemek: bot sayfayı okuyamadığı için noindex'i de göremez.