LW IT Solutions

Macierz crawlerów robots.txt: która reguła wygrywa dla którego bota

Pliku robots.txt nie czyta się od góry do dołu. Każdy crawler najpierw wybiera dokładnie jedną grupę, a wewnątrz niej wygrywa najdłuższy pasujący wzorzec, przy remisie zaś Allow. To narzędzie stosuje te trzy zasady z RFC 9309 i przy każdym zestawieniu podaje linię, która wygrała.

Porównanie pomija wielkość liter, a nazwa z pliku liczy się wtedy, gdy identyfikator się od niej zaczyna.

Wyłącznie ścieżki, zaczynające się od ukośnika. Ciąg zapytania może przy nich stać.

Adres zostaje pobrany raz z tego serwera. Zapisywane jest tylko to pobranie, na potrzeby limitu godzinowego.

Osiem zapytań na godzinę. Pobierany jest wyłącznie /robots.txt, najwyżej 500 KiB, prywatne zakresy adresów są odrzucane.

OTHER TOOLS