Baza wiedzy

robots.txt

Plik tekstowy umieszczany w katalogu głównym domeny, zawierający instrukcje dla robotów wyszukiwarek dotyczące dostępu do wybranych zasobów serwisu.

← Wróć do bazy wiedzy

Do czego służy robots.txt



Plik robots.txt pozwala zasugerować robotom wyszukiwarek, które obszary witryny powinny lub nie powinny być crawlowane. Nie jest to mechanizm bezpieczeństwa, lecz narzędzie organizujące sposób indeksacji i obciążenie crawlerami.



Typowe dyrektywy



  • User-agent - określa, do jakiego robota odnoszą się reguły,

  • Disallow - blokuje dostęp do określonych ścieżek,

  • Allow - dopuszcza crawling wybranych zasobów,

  • Sitemap - wskazuje adres mapy strony XML.



Czego robots.txt nie robi



  • nie ukrywa strony przed użytkownikami,

  • nie gwarantuje, że URL nie pojawi się w indeksie,

  • nie zastępuje nagłówka noindex ani ochrony hasłem.



Kiedy używać



  • do blokowania paneli administracyjnych, wyników wyszukiwania, filtrów i tymczasowych zasobów,

  • do wskazywania adresu sitemap XML,

  • do ograniczania crawl budget na bardzo dużych serwisach.



Najczęstsze błędy



  • blokowanie zasobów CSS i JS potrzebnych do renderowania strony,

  • mylenie robots.txt z mechanizmem bezpieczeństwa,

  • przypadkowe zablokowanie całej witryny przez Disallow: /.

Powiązane pojęcia
Kontakt
Masz pytanie techniczne?

Porozmawiajmy

Chętnie wyjaśnię, jak te pojęcia przekładają się na Twój projekt.

Skontaktuj się