Domaininizin robots.txt politikasını güvenli şekilde kontrol edin; başlıca AI crawler user-agent kayıtlarını görün, eksik/çelişkili kuralları yorumlayın ve yayınlamadan önce politika taslağınızı doğrulayın.
Komutları canlı sistemde uygulamadan önce sürüm, yedek, firewall ve geri dönüş planını kendi altyapınızda doğrulayın.
robots.txt erişim kontrolü değildir; crawler’a yönelik bir tercih sinyalidir. User-agent önceliği, Allow/Disallow kapsamı ve CDN/WAF davranışı birlikte okunmalıdır. Araç domainin yalnız public IP’ye çözülmesine izin verir ve özel/yerel ağ hedeflerine istek göndermez.
robots.txt erişim kontrolü değildir; crawler’a yönelik bir tercih sinyalidir. User-agent önceliği, Allow/Disallow kapsamı ve CDN/WAF davranışı birlikte okunmalıdır. Araç domainin yalnız public IP’ye çözülmesine izin verir ve özel/yerel ağ hedeflerine istek göndermez.
Kurulum komutundan öte mimari, kapasite, güvenlik, hata teşhisi ve production işletimini tek akışta ele alıyoruz.
Web yöneticileri GPTBot, ChatGPT-User, ClaudeBot/Claude-User, PerplexityBot, Google-Extended, Bytespider ve CCBot gibi farklı amaçlı user-agent’larla karşılaşabilir. Aynı şirketin eğitim, arama ve kullanıcı tetiklemeli fetch botları farklı olabilir.
Politikayı şirket adına göre değil, resmî bot dokümantasyonunda yayınlanan user-agent ve amaç bilgisine göre oluşturmak daha güvenlidir. Bot listeleri zaman içinde değişebileceği için robots.txt periyodik olarak gözden geçirilmelidir.
robots.txt, uyumlu crawler’lara belirli yolların taranıp taranamayacağını bildirir. Dosyanın varlığı URL’nin internette gizli olduğu veya yetkisiz erişimin engellendiği anlamına gelmez. Hassas veriler authentication ve network policy ile korunmalıdır.
`User-agent: *` ile genel kural yazıp altına spesifik AI bot bloğu eklemek mümkündür; ancak kural yorumlama ayrıntıları botun uygulamasına göre değişebilir. Kritik kararlar ilgili sağlayıcının resmî dokümanıyla doğrulanmalıdır.
Cloudflare AI Crawl Control, crawler trafiğini görünür kılmak ve belirli AI crawler’ları Allow, Block veya uygun özelliklerde Charge yaklaşımıyla yönetmek için ek bir kontrol katmanı sunar.
Bu katman origin robots.txt’nin yerine geçen tek çözüm değildir. Edge politikasının robots.txt ve origin firewall davranışıyla çelişmemesi için kural sahibi ve değişiklik tarihi kayıt altına alınmalıdır.
Cloudflare Pay Per Crawl, site sahibinin desteklenen AI crawler erişimi için ücret politikası belirlemesine olanak verir. İlgili akışta ödeme niyeti bulunmadığında HTTP 402 davranışı kullanılabilir.
Her içerik sitesi için monetization doğru seçenek değildir. SEO görünürlüğü, lisanslama hedefi, crawler türü ve içerik değeri birlikte değerlendirilmeden “tüm AI botlarını ücretlendir” kararı verilmemelidir.
Önce public robots.txt indirilir, hedef user-agent blokları kaydedilir, ardından CDN/WAF bot yönetimi ekranıyla karşılaştırılır. Bir değişiklik yapıldıysa curl ile status code, response header ve içerik tekrar doğrulanır.
Araç sadece metin içindeki tanımları ön değerlendirme amacıyla işaretler; tüm robots standardı öncelik semantiğini eksiksiz simüle eden bir arama motoru değildir.
Bir AI crawler’ı engelleme kararı ile Google Search’in klasik Googlebot erişimi aynı şey değildir. Ancak `User-agent: *` altında geniş bir Disallow yazılırsa arama motorları da etkilenebilir.
Bu nedenle değişiklik öncesi Search Console URL Inspection, robots doğrulaması ve sunucu loglarıyla Googlebot erişimi ayrıca izlenmelidir.
robots.txt’ye admin dizinlerini yazmak onları güvenli yapmaz; hatta hassas yol adlarını ifşa edebilir. Yönetim, yedek ve private API alanları oturum doğrulaması ve mümkünse network seviyesinde sınırlandırılmalıdır.
AI crawler kontrolü veri güvenliği projesi değil, erişim tercih ve trafik yönetimi katmanıdır. Kişisel/veri lisanslama gereksinimleri için hukuk ve gizlilik politikası ayrıca ele alınmalıdır.
Gerçek karar için web server/CDN loglarında user-agent, istek oranı, en çok çekilen yollar, response code ve bandwidth tüketimi ölçülmelidir. robots.txt içinde tanım olmayan bir botun hiç trafik üretmediği varsayılmamalıdır.
Aylık crawler raporu yayınlamak, EkaSunucu için özgün veri ve backlink fırsatı da oluşturabilir: hangi botların ne kadar trafik ürettiği anonim ve metodolojisi açık şekilde raporlanabilir.
robots.txt erişim kontrolü değildir; crawler’a yönelik bir tercih sinyalidir. User-agent önceliği, Allow/Disallow kapsamı ve CDN/WAF davranışı birlikte okunmalıdır. Araç domainin yalnız public IP’ye çözülmesine izin verir ve özel/yerel ağ hedeflerine istek göndermez.
| Belirti / problem | Muhtemel katman | İlk doğrulama |
|---|---|---|
| Araç robots.txt alamıyor | Domain public IP’ye çözülmüyor, HTTPS hatası veya WAF engeli | Tarayıcı/curl ile `/robots.txt` status code ve TLS zinciri kontrol edilir. |
| Bot tanımlı görünüyor ama yine trafik geliyor | Kural yolu, user-agent veya bot uyumluluğu farklı | Gerçek server logunda user-agent ve istenen path birlikte incelenir. |
| Google görünürlüğü düştü | Genel `User-agent: *` kuralı Googlebot’u da etkiliyor olabilir | Googlebot erişimi ve Search Console crawl/index durumu kontrol edilir. |
| Cloudflare Block fakat origin logunda trafik var | Trafik proxy dışından origin’e ulaşıyor olabilir | Origin IP koruması ve Cloudflare dışı erişim yolu kontrol edilir. |
| robots.txt hassas klasörü korumuyor | robots bir authentication mekanizması değildir | Hassas alan gerçek oturum/network erişim kontrolüne alınır. |
Kurulum komutundan öte mimari, kapasite, güvenlik, hata teşhisi ve production işletimini tek akışta ele alıyoruz.
Aracı sadece sahip olduğunuz veya analiz etmeye yetkili olduğunuz public domain üzerinde kullanın.
HTTPS üzerinden status code ve robots metnini kontrol edin.
Spesifik user-agent tanımlarını ve genel wildcard kurallarını ayırın.
Cloudflare veya başka bot yönetimi katmanındaki kuralı origin politikasıyla eşleştirin.
Gerçek user-agent isteklerini ve bant genişliğini en az birkaç günlük pencerede izleyin.
Değişiklik sonrası bot ve Googlebot erişimini ayrı doğrulayın.
Tarih, gerekçe ve geri dönüş metnini saklayın.
Kurulum komutundan öte mimari, kapasite, güvenlik, hata teşhisi ve production işletimini tek akışta ele alıyoruz.
curl -s https://alanadiniz.com/robots.txtcurl -I -A "GPTBot" https://alanadiniz.com/curl -I -A "ClaudeBot" https://alanadiniz.com/curl -I -A "PerplexityBot" https://alanadiniz.com/Yalnız public domain hedeflenir. Private/reserved IP’lere istek gönderilmez, redirect takip edilmez ve yanıt 1 MB ile sınırlandırılır.
AI crawler trafiğiniz, Cloudflare politikalarınız ve origin güvenliğiniz için teknik ön değerlendirme sağlayabiliriz.
Kurulum komutundan öte mimari, kapasite, güvenlik, hata teşhisi ve production işletimini tek akışta ele alıyoruz.
Kurulum komutundan öte mimari, kapasite, güvenlik, hata teşhisi ve production işletimini tek akışta ele alıyoruz.
robots.txt erişim kontrolü değildir; crawler’a yönelik bir tercih sinyalidir. User-agent önceliği, Allow/Disallow kapsamı ve CDN/WAF davranışı birlikte okunmalıdır. Araç domainin yalnız public IP’ye çözülmesine izin verir ve özel/yerel ağ hedeflerine istek göndermez.
Uyumlu crawler’lara tercih bildirir; kötü niyetli veya kurala uymayan istemciler için güvenlik duvarı değildir.
Hayır; sağlayıcılar farklı amaçlar için farklı user-agent tanımları kullanabilir. Politika her botun resmî tanımına göre yapılmalıdır.
Spesifik user-agent kuralı ile genel Googlebot erişimi farklı kavramlardır; ancak wildcard kuralları yanlış yazılırsa klasik crawl etkilenebilir.
Desteklenen crawler erişimini ücret politikasına bağlamaya yarayan Cloudflare özelliğidir; site hedeflerine göre Allow, Block veya Charge yaklaşımı seçilebilir.
SSRF riskini azaltmak için localhost, RFC1918 ve reserved ağlar hedeflenmez; araç yalnız public web domainlerini ön değerlendirmek içindir.
Tek bir doğru liste yoktur. İçerik lisanslama, görünürlük, trafik maliyeti ve sağlayıcı amacı birlikte değerlendirilmelidir.
AI crawler trafiğiniz, Cloudflare politikalarınız ve origin güvenliğiniz için teknik ön değerlendirme sağlayabiliriz.