SEOGEOmedya
GEO ve Yapay Zekâ Araması

GPTBot, OAI-SearchBot, ClaudeBot: robots.txt'te Neye İzin Vermeli?

Yapay zekâ tarayıcılarını amaçlarına göre ayırıyoruz: arama, model eğitimi, kullanıcı tetiklemeli erişim. Hangisini engellerseniz ne olur, iki örnek robots.txt ile.

Yayın
Okuma
7 dk
Kaynak
8
GPTBot, OAI-SearchBot, ClaudeBot: robots.txt'te Neye İzin Vermeli?
Kısa cevap

Yapay zekâ botlarını tek kalemde açıp kapatmayın; amaçlarına göre ayırın. Arama botları (OAI-SearchBot, Claude-SearchBot, PerplexityBot) sizi cevaplarda kaynak yapar, eğitim botları (GPTBot, ClaudeBot, Google-Extended) içeriğinizi model eğitiminde kullanır. Çoğu işletme için makul başlangıç, arama botlarına izin verip eğitim botlarını ayrı bir iş kararı olarak değerlendirmektir.

robots.txt ne yapar, ne yapmaz?

robots.txt, 2022'de RFC 9309 olarak standartlaşan Robots Exclusion Protocol'ün dosyasıdır 1. Sitenin kök dizininde durur ve tarayıcılara hangi yolları taramamaları gerektiğini söyler. Bu yazıdaki kararları vermeden önce dört kuralı bilmek gerekiyor:

  • Bir rica, kilit değil. RFC 9309, bu kuralların bir erişim yetkilendirmesi olmadığını açıkça yazıyor; ayrıca dosyada listelenen yolların herkese açık hâle geldiğini hatırlatıyor 1. Gizli tutmanız gereken bir dizini robots.txt'e yazmak, onu ilan etmek demek.
  • Kullanıcı aracısı eşleşmesi büyük-küçük harfe duyarsız. Bir botla eşleşen özel grup yoksa * grubu uygulanır 1. Yani bir bota özel grup açtığınızda o bot artık * grubundaki kuralları okumaz; ortak kuralları o gruba da yazmanız gerekir.
  • En uzun eşleşen kural kazanır. Allow ve Disallow eşit uzunluktaysa Allow tercih edilmeli 1.
  • Önbellek. Tarayıcılar önbelleğe aldıkları robots.txt'i, dosyaya ulaşılamadığı durumlar dışında, 24 saatten uzun kullanmamalı 1. Değişikliğin anında yansımasını beklemeyin.

Bir uyarı daha: kullanıcı aracısı (user-agent) bilgisi taklit edilebilir. Google, kendi tarayıcılarının kimliğinin doğrulanabileceğini ve sahte Googlebot trafiğine dikkat edilmesi gerektiğini belirtiyor 2. Sunucu kayıtlarında "GPTBot" yazan her istek gerçekten OpenAI'den gelmiyor olabilir.

Üç tür bot: arama, eğitim, kullanıcı

Şirketlerin dokümanlarını yan yana koyduğunuzda botlar üç amaca ayrılıyor:

  • Arama dizini botları, içeriğinizi bir yapay zekâ arama ürününde gösterilebilmesi için tarar. OAI-SearchBot, Claude-SearchBot ve PerplexityBot bu gruptadır 6 7 8. Engellerseniz o ürünün cevaplarında kaynak olma şansınız düşer.
  • Model eğitimi botları, içeriği gelecekteki modellerin eğitim verisi olarak toplar. GPTBot ve ClaudeBot böyle çalışır; Google tarafında aynı işlevi ayrı bir bot değil, Google-Extended belirteci görür 2 6 7. Engellemek, cevaplardaki görünürlüğünüzü doğrudan etkilemez.
  • Kullanıcı tetiklemeli ajanlar, bir kullanıcı sohbette bağlantı paylaştığında ya da asistan cevap için bir sayfayı anlık okumak istediğinde devreye girer. ChatGPT-User, Claude-User ve Perplexity-User bu gruptadır.

Bu ayrımın en önemli sonucu: "yapay zekâya kapalı olalım" kararı aslında üç ayrı karardır.

Tarayıcı tablosu

TarayıcıŞirketAmaçrobots.txt'e uyar mıEngellerseniz
GooglebotGoogleArama dizini (AI Bakışı ve AI Modu dahil)Evet, otomatik taramada 2Google Arama'nın tamamından düşersiniz
Google-ExtendedGoogleGemini eğitimi ve Gemini uygulamalarında groundingYalnız robots.txt belirteci, ayrı bot yok 2Arama ve AI Bakışı etkilenmez 2
BingbotMicrosoftBing arama diziniEvet, Bing'in test aracı bu kurallara göre çalışıyor 4Bing sonuçlarından düşersiniz
GPTBotOpenAIModel eğitimiEvet 6İçerik eğitimde kullanılmaz; arama etkilenmez
OAI-SearchBotOpenAIChatGPT arama diziniEvet 6ChatGPT arama cevaplarında gösterilmezsiniz; yalnız gezinme bağlantısı kalabilir
ChatGPT-UserOpenAIKullanıcı tetiklemeli erişimUygulanmayabilir 6Tam engel beklemeyin
ClaudeBotAnthropicModel eğitimiEvet 7Gelecekteki içerik eğitim verisinden çıkarılır
Claude-SearchBotAnthropicArama kalitesi için dizinlemeEvet 7Claude arama sonuçlarında görünürlük azalabilir
Claude-UserAnthropicKullanıcı tetiklemeli erişimAnthropic, botlarının robots.txt'e uyduğunu belirtiyor 7Kullanıcı sorularında içeriğiniz getirilmez
PerplexityBotPerplexityPerplexity arama sonuçlarıEvet, robots.txt ile yönetiliyor 8Perplexity cevaplarında kaynak olma şansı düşer
Perplexity-UserPerplexityKullanıcı tetiklemeli erişimGenellikle uymuyor 8Tam engel beklemeyin

Tablodaki "Engellerseniz" sütunu şirketlerin kendi ifadelerine dayanıyor. Örneğin OpenAI, OAI-SearchBot'u engelleyen sitelerin ChatGPT arama cevaplarında gösterilmeyeceğini, ancak gezinme bağlantısı olarak çıkabileceğini yazıyor 6. Anthropic ise ClaudeBot engellendiğinde sitenin gelecekteki içeriğinin eğitim veri setlerinden çıkarılması gerektiğini, Claude-SearchBot ve Claude-User engellendiğinde görünürlüğün azalabileceğini belirtiyor 7. PerplexityBot'un ise temel model eğitimi için kullanılmadığı açıkça yazılı 8.

Google ve Bing'de durum farklı

İki büyük arama motorunda yapay zekâ özellikleri ayrı bir botla değil, ana arama tarayıcısıyla besleniyor. Bu yüzden robots.txt ile "aramada kal, AI özetinde olma" ayrımı yapılamıyor.

Google. Googlebot'a yazılan tarama tercihleri, Google Arama'yı ve tüm arama özelliklerini etkiliyor 2. Google-Extended ise ayrı bir HTTP kullanıcı aracısı olmayan bir kontrol belirteci; Google Arama'ya dahil edilmeyi etkilemiyor ve sıralama sinyali olarak kullanılmıyor 2. AI Bakışı ve AI Modu'ndan çıkmak istiyorsanız doğru araç Search Console'daki üretken yapay zekâ kontrolü. Google'a göre bu kontrol aramanın geri kalanında sıralama sinyali olarak kullanılmıyor, ancak AI eğitimini de etkilemiyor; eğitim için yine Google-Extended gerekiyor 3.

Bing. Microsoft, o dönemki adıyla Bing Chat için robots.txt yerine meta etiketleri önerdi. NOCACHE etiketi cevaplarda yalnızca URL, başlık ve snippet gösterilmesini sağlıyor; NOARCHIVE etiketi ise içeriğin sohbet cevaplarına girmesini ve Microsoft'un üretken yapay zekâ modellerinin eğitiminde kullanılmasını engelliyor. Her iki durumda da sayfa Bing arama sonuçlarında görünmeye devam ediyor 5.

Kullanıcı tetiklemeli ajanlar robots.txt'e her zaman uymaz

Bu, en çok yanlış anlaşılan nokta. Şirketlerin resmi ifadeleri şöyle:

  • OpenAI: ChatGPT-User'ın eylemleri bir kullanıcı tarafından başlatıldığı için robots.txt kurallarının uygulanmayabileceğini yazıyor; ayrıca bu ajanın web'i otomatik taramak için kullanılmadığını belirtiyor 6.
  • Perplexity: Perplexity-User'ın, getirme işlemini kullanıcı istediği için robots.txt kurallarını genellikle dikkate almadığını açıkça söylüyor 8.
  • Anthropic: Botlarının robots.txt'teki standart yönergelere uyduğunu, Claude-User'ın da site sahiplerine kullanıcı tetiklemeli istekleri kontrol etme imkânı verdiğini yazıyor; Crawl-delay uzantısını desteklediğini ve CAPTCHA'ları aşmaya çalışmayacağını da belirtiyor 7.

Pratik sonuç: bir sayfayı kullanıcı ajanlarından gerçekten uzak tutmanız gerekiyorsa robots.txt yeterli değil. Oturum açma, sunucu tarafı erişim kuralı ya da bot yönetimi gerekir. Tersine, bu ajanları engellemek genellikle gereksizdir: bir kullanıcının sohbette paylaştığı bağlantınızın okunamaması, size yazacak potansiyel bir müşterinin yarı yolda kalması demektir.

İki örnek robots.txt

Örnek 1: Her şeye açık. Görünürlüğü önceliklendiren, içeriğini zaten pazarlama amacıyla yayımlayan çoğu B2B ve hizmet sitesi için uygundur.

User-agent: *
Disallow: /yonetim/
Disallow: /sepet/

Sitemap: https://www.ornek.com.tr/sitemap.xml

Örnek 2: Aramaya açık, eğitime kapalı. Arama botlarına izin verir, bilinen eğitim botlarını ve belirteçlerini kapatır. Bu botlar * grubunu okumayacağı için kendi grupları tam engelle tanımlanır.

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: *
Disallow: /yonetim/
Disallow: /sepet/

Sitemap: https://www.ornek.com.tr/sitemap.xml

İkinci örnekte OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot ve Bingbot * grubuna düşer ve aynı kurallarla tarar. Google-Extended'ı kapatmanın Gemini uygulamalarındaki grounding kullanımını da etkileyebileceğini unutmayın 2.

Sık yapılan hatalar

Denetimlerde en sık karşılaştığımız robots.txt sorunları yapay zekâ botlarına özgü değil, ama bu botlar eklenince daha görünür hâle geliyor:

  • Bota özel grupta ortak kuralları unutmak. GPTBot için ayrı bir grup açıp yalnızca bir dizini engellediğinizde, * grubundaki yönetim paneli ve sepet engelleri o bot için geçersiz kalır 1. Her özel gruba ortak kuralları da yazın.
  • Yazım farklılıkları. Eşleşme büyük-küçük harfe duyarsız olsa da botun adı doğru yazılmalı; "Claude-Searchbot" sorun çıkarmaz, "ClaudeSearchBot" ise hiçbir botla eşleşmez.
  • Test ortamı dosyasını canlıya taşımak. Geliştirme ortamında kullanılan tam engel kuralının yayına çıkması, tüm arama ve yapay zekâ botlarını aynı anda dışarıda bırakır. Yayın kontrol listesine robots.txt satırı ekleyin.
  • Sadece robots.txt'e bakmak. CDN'deki bot koruması, güvenlik duvarı kuralları ve hız sınırları, robots.txt'te izin verdiğiniz botu sessizce engelleyebilir. Sunucu kayıtlarında 403 ve 429 yanıtlarını bot bazında izleyin.
  • Sahte botlara güvenmek. Kullanıcı aracısı taklit edilebildiği için şüpheli trafiği şirketlerin yayımladığı IP listeleri ya da doğrulama yöntemleriyle teyit edin 2.

Engellemek bir iş kararıdır

Bu konuda iki uç görüş var. Birincisi, içeriğin karşılıksız biçimde model eğitimine gittiğini ve trafik getirmediğini söyler. İkincisi, yapay zekâ cevaplarında görünmemenin rakiplere alan bırakmak olduğunu söyler. İkisi de kendi bağlamında haklı olabilir. Karar için şu sırayı öneriyoruz:

  1. İçeriğin rolünü belirleyin. İçerik doğrudan satılan ürün mü (yayıncılık, ücretli rapor, veri), yoksa müşteri kazanmak için yayımlanan pazarlama içeriği mi?
  2. Sunucu kayıtlarına bakın. Hangi botlar ne sıklıkta geliyor, sunucuya yük bindiriyor mu? Kararı varsayımla değil veriyle verin.
  3. Arama botlarını ayrı değerlendirin. Bunlar cevaplarda kaynak gösterilmenizin önkoşulu. Engellemenin bedeli, o üründe görünmemek.
  4. Eğitim botlarını ayrı değerlendirin. Engellemek görünürlüğü doğrudan düşürmez ama Google-Extended örneğinde olduğu gibi yan etkileri olabilir.
  5. Kullanıcı ajanlarına dokunmayın ya da gerçekten gerekiyorsa sunucu tarafında çözün.
  6. CDN ve güvenlik duvarını kontrol edin. robots.txt'te izin verdiğiniz bir bot, bot koruması tarafından engelleniyor olabilir. Perplexity bu nedenle botlarının yayımlanan IP aralıklarına güvenlik duvarında izin verilmesini öneriyor 8.
  7. Kararı yazılı hâle getirin ve altı ayda bir gözden geçirin. Bot listeleri ve şirket politikaları değişiyor.

Sitenizin bugünkü robots.txt durumunu ve yapay zekâ botlarına ne söylediğini AI görünürlük ön kontrolü ile görebilirsiniz. Botların erişimi sağlandıktan sonra hangi sayfaların seçildiğini yapay zekâ kaynak seçimi yazımızda anlattık. robots.txt, sitemap ve tarama bütçesi düzenlemesini teknik SEO hizmetimiz kapsamında yapıyoruz.

Sık sorulan sorular

OpenAI'nin dokümanına göre GPTBot yalnızca model eğitimi için içerik topluyor; ChatGPT aramasında görünmeyi OAI-SearchBot belirliyor ve iki ayar birbirinden bağımsız. GPTBot'u engelleyip OAI-SearchBot'a izin verirseniz içeriğiniz eğitime kapanır, ChatGPT arama cevaplarında kaynak olarak gösterilmeye devam edebilir.

Hayır. Google'ın tarayıcı dokümanına göre Google-Extended, Google Arama'ya dahil edilmeyi etkilemiyor ve sıralama sinyali değil; Gemini modellerinin eğitimini ve Gemini uygulamalarındaki grounding kullanımını yönetiyor. AI Bakışı ve AI Modu'ndan çıkmak için Search Console'daki üretken yapay zekâ kontrolü ya da nosnippet gibi önizleme kontrolleri kullanılır.

Kesin bir süre yok ama dokümanlar bir çerçeve veriyor. RFC 9309, tarayıcıların önbelleğe aldıkları robots.txt dosyasını genellikle 24 saatten uzun kullanmaması gerektiğini söylüyor. OpenAI ve Perplexity de değişikliklerin sistemlerine yansımasının yaklaşık 24 saat sürebileceğini belirtiyor. Değişiklikten sonra sunucu kayıtlarından teyit etmek en sağlam yol.

Hayır, robots.txt bir erişim yetkilendirme aracı değil. RFC 9309 bunu açıkça yazıyor ve dosyada listelenen yolların herkese açık hâle geldiğini hatırlatıyor. Kurallara uymayan bir aktörü durdurmaz. Gerçekten korunması gereken içerik için kimlik doğrulama, güvenlik duvarı ya da bot yönetimi gibi sunucu tarafı önlemler gerekir.

Tek doğru cevap yok; bu bir iş kararı. Görünürlük ve marka bilinirliği öncelikliyse arama botlarını açık tutmak mantıklı. İçeriğiniz doğrudan gelir kaynağıysa eğitim botlarını kapatmak makul olabilir. Çoğu işletme için dengeli seçenek, arama ve kullanıcı botlarına izin verip eğitim botlarını ayrıca değerlendirmek.

Kaynaklar

  1. 1IETF / RFC Editor. RFC 9309: Robots Exclusion Protocol
  2. 2Google Crawling Infrastructure. List of Google's common crawlers
  3. 3Search Console Yardım. Search generative AI control
  4. 4Bing Webmaster Blog. Bing Webmaster Tools makes it easy to edit and verify your robots.txt
  5. 5Bing Webmaster Blog. Announcing new options for webmasters to control usage of their content in Bing Chat
  6. 6OpenAI. Overview of OpenAI Crawlers
  7. 7Anthropic. Does Anthropic crawl data from the web, and how can site owners block the crawler?
  8. 8Perplexity. Perplexity Crawlers

SEOGEO Medya Editör Ekibi

Bu yazı ekibimizin editoryal sürecinden geçti: kaynaklar tek tek doğrulandı, sayısal iddialar kaynağa bağlandı. Yayın ilkelerimiz

İlgili hizmet

Teknik SEO

Tarama, indeksleme, hız ve yapısal veri. Geliştiricinize öncelik ve efor tahminli iş listesi.

İncele
Sonraki adım

Sitenizin bugün nerede durduğunu birlikte görelim

Analiz görüşmesinde sitenizi, rakiplerinizi ve hedef aramalarınızı konuşuruz; size uygun ilk 90 günlük planın çerçevesini çıkarırız. Bağlayıcı değildir.

WhatsAppAnaliz İste