Do czego służy robots.txt
Plik robots.txt pozwala zasugerować robotom wyszukiwarek, które obszary witryny powinny lub nie powinny być crawlowane. Nie jest to mechanizm bezpieczeństwa, lecz narzędzie organizujące sposób indeksacji i obciążenie crawlerami.
Typowe dyrektywy
User-agent- określa, do jakiego robota odnoszą się reguły,Disallow- blokuje dostęp do określonych ścieżek,Allow- dopuszcza crawling wybranych zasobów,Sitemap- wskazuje adres mapy strony XML.
Czego robots.txt nie robi
- nie ukrywa strony przed użytkownikami,
- nie gwarantuje, że URL nie pojawi się w indeksie,
- nie zastępuje nagłówka
noindexani ochrony hasłem.
Kiedy używać
- do blokowania paneli administracyjnych, wyników wyszukiwania, filtrów i tymczasowych zasobów,
- do wskazywania adresu sitemap XML,
- do ograniczania crawl budget na bardzo dużych serwisach.
Najczęstsze błędy
- blokowanie zasobów CSS i JS potrzebnych do renderowania strony,
- mylenie robots.txt z mechanizmem bezpieczeństwa,
- przypadkowe zablokowanie całej witryny przez
Disallow: /.