LW IT Solutions
« Blog Overview /Digital Marketing / Trzy rodzaje crawlerów, jeden robots.txt
This post in other languages:

Trzy rodzaje crawlerów, jeden robots.txt

Trzy rodzaje crawlerów, jeden robots.txt
Spis treści
  1. Trzy rodzaje wykonujące różną pracę
  2. Czemu zapobiega i ile kosztuje każda blokada
  3. Google-Extended to nie Googlebot
  4. Wstecz nic nie działa
  5. llms.txt: mapa, a nie reguła
  6. Czego robots.txt nie potrafi

Jeden plik, trzy grupy czytelników niemające ze sobą nic wspólnego. Crawler wyszukiwarki pobiera stronę, aby dało się ją znaleźć; crawler trenujący pobiera ją, aby powstał z niej model; asystent pobiera ją, bo minutę temu ktoś zadał pytanie. Rozróżnić tę trójkę da się wyłącznie po nazwie, którą się przedstawia, a blokada jednego nic nie mówi o pozostałych.

Dlatego zwyczajowe polecenie – zablokować crawlery AI – nie jest jedną decyzją, lecz trzema, a dwie z nich kosztują coś, czego przy dopisywaniu wiersza rzadko się dopowiada.

Trzy bramy dla trzech rodzajów crawlerów - wyszukiwarki, trenowania i asystentów - każda z przypisanymi nazwami oraz z tym, czemu blokada zapobiega i ile kosztuje
Trzy bramy, trzy decyzje. Tylko środkowa jest bez skutków dla widoczności.

Trzy rodzaje wykonujące różną pracę

Crawlery wyszukiwarek – Googlebot, Bingbot i reszta – budują indeks, z którego pochodzą zwykłe wyniki. Blokada usuwa witrynę z wyszukiwarki w ciągu tygodni, dlatego nikt nie robi tego celowo i dlatego zdarza się przez przypadek: Disallow: / ze środowiska testowego, które przetrwało przeprowadzkę.

Crawlery trenujące – GPTBot, Google-Extended, ClaudeBot, CCBot i inne – zbierają materiał, z którego powstają modele. Pobierają raz i czytają wszystko; nic z tego nie wraca jako odwiedziny.

Crawlery asystentów – OAI-SearchBot, ChatGPT-User, PerplexityBot – pobierają stronę, bo właśnie teraz odpowiadają na pytanie. To, co pobiorą, często wraca: jako źródło, jako odnośnik, jako to zdanie, które ktoś czyta zamiast wyniku wyszukiwania.

Czemu zapobiega i ile kosztuje każda blokada

Blokowane Zapobiega Kosztuje
Wyszukiwarki Niczemu, czemu warto by zapobiegać. Witryna znika z Google i Bing.
Trenowanie Trafieniu nowego materiału do kolejnego modelu. Nic mierzalnego – ani pozycji, ani widoczności.
Asystenci Zacytowaniu witryny w odpowiedzi. Dokładnie tę widoczność – wzmiankę i odnośnik przy niej.

Środkowy wiersz to ten, o którym da się rozstrzygnąć z zasady i nic za to nie zapłacić. Dolny to ten, o którym rozstrzyga się przez przypadek, bo nazwy stoją w każdej krążącej liście tuż obok tych od trenowania.

Google-Extended to nie Googlebot

Rozróżnienie budzące najwięcej wahania: Google-Extended reguluje, czy treści służą do trenowania Gemini i modeli Vertex. Na pobieranie dla wyszukiwarki, na indeksowanie i na pozycję nie wpływa. Blokada niczego nie zmienia w tym, jak strona radzi sobie w Google, i nie jest to twierdzenie, któremu trzeba zaufać – po to ta nazwa istnieje.

Ten sam podział przebiega przez pozostałych dostawców. GPTBot to trenowanie; OAI-SearchBot zasila indeks wyszukiwania za asystentem; ChatGPT-User to pobranie następujące, gdy pyta człowiek. Zablokowanie wszystkich trzech, bo nazwy wyglądają podobnie, to najczęstsza droga, którą witryna po cichu znika z odpowiedzi, w których chciała się znaleźć.

Wstecz nic nie działa

Blokada obowiązuje od chwili odczytania. To, co już pobrano, siedzi w zbiorach z tego zbudowanych, a te nie zaglądają ponownie do robots.txt. Witryna działająca od lat, która dziś dopisuje te wiersze, rozstrzygnęła o przyszłych pobraniach, a nie o minionych.

Warto to powiedzieć wprost, bo decyzję przedstawia się często jako usunięcie. Nie jest usunięciem, lecz płotem wokół tego, czego jeszcze nie pobrano.

llms.txt: mapa, a nie reguła

Plik pod /llms.txt jest w zamyśle przeciwieństwem robots.txt: nie zabrania, tylko wskazuje. Krótki dokument Markdown nazywający, o co w witrynie chodzi i które strony niosą treść – spis rzeczy dla czegoś, co czyta się bez nawigacji.

Dwie rzeczy trzeba przy tym wyjaśnić. To propozycja, a nie standard, i żaden crawler nie ma obowiązku go szukać. I niczego nie ogranicza: strona tam wymieniona nie staje się przez to dozwolona, a brakująca nie staje się chroniona. Napisanie kosztuje dziesięć minut i jest warte dokładnie tyle, co dobry spis treści – czyli zupełnie nic, jeśli strony za nim są ubogie.

Czego robots.txt nie potrafi

To prośba, a nie zamek. Każdy crawler sam decyduje, czy się do niej stosuje, a ci, którzy to robią, są dokładnie tymi, którzy publikują nazwę, pod którą da się ich zablokować. Tego, co plik ignoruje, nic w nim nie dotyczy.

I nie trzyma strony poza wynikami wyszukiwania. Zablokowana strona, do której inni odsyłają, i tak może się pojawić, tyle że bez opisu, bo crawlerowi nie wolno było odczytać jej treści. Trzymanie czegoś poza indeksem wymaga noindex – do czego crawler musi mieć wstęp, aby to odczytać – a trzymanie czegoś w prywatności wymaga logowania. robots.txt stoi poniżej obu i dobrze nadaje się dokładnie do tego, czym jest: do kierowania ruchem tych crawlerów, które dają się kierować.

Lukas Wojcik

Lukas Wojcik

Systems architect and technology enthusiast specializing in scalable tracking solutions, GMP Stack (GA4 & GTM), and robust backend architectures. Advocate for clean code and privacy-first design.

Get in Touch

Briefly describe your project or inquiry for a tailored response. This site is protected by reCAPTCHA.

Napisanie komentarza

Adres e-mail nie jest publikowany. Pola obowiązkowe oznaczono gwiazdką.

ALL ARTICLES & CATEGORIES

CCTV

Śledź tę kategorię przez RSS

Cloud & AI

Śledź tę kategorię przez RSS

Data Privacy

Wszystkie artykuły w tej kategorii (11) Śledź tę kategorię przez RSS

Digital Analytics

Wszystkie artykuły w tej kategorii (36) Śledź tę kategorię przez RSS

Digital Marketing

Wszystkie artykuły w tej kategorii (23) Śledź tę kategorię przez RSS

IT & Networks

Wszystkie artykuły w tej kategorii (12) Śledź tę kategorię przez RSS

Raspberry Pi

Śledź tę kategorię przez RSS

Smart Home

Śledź tę kategorię przez RSS

Tworzenie stron internetowych

Śledź tę kategorię przez RSS

Wtyczki i triki WordPress

Śledź tę kategorię przez RSS