Ako overiť prístup vyhľadávacích crawlerov k webu
AI služby používajú rôzne crawlery, indexy a zdroje. Kontrola mimo Google ukáže, či je web dostupný aj pre vyhľadávanie v ChatGPT, Perplexity a službách Microsoftu.
Pri kontrole AI vyhľadávania oddeľte tri otázky: povoľuje web crawleru prístup, dostane serverovú odpoveď s obsahom a použila služba stránku vo výsledku? Každá potrebuje iný dôkaz. Tento postup rieši prvé dve.
Vyberte jednu URL a skontrolujte jej pravidlá
Začnite konkrétnou verejnou stránkou, ktorú chcete sprístupniť. Uložte jej adresu a čas kontroly. V robots.txt na rovnakom hostiteľovi nájdite pravidlá pre daný crawler a cestu stránky. Rozhodnutie, komu prístup povoliť, aj modelový zápis nájdete v článku Ktorým AI crawlerom povoliť prístup.
Otestujte odpoveď servera
Technik môže použiť nasledujúci príkaz. https://example.com/clanok/ je modelová adresa: nahraďte ju kontrolovanou URL. Príkaz uloží hlavičky a HTML do dvoch lokálnych súborov.
curl --silent --show-error --location \
--user-agent "OAI-SearchBot" \
--dump-header hlavicky.txt \
--output stranka.html \
"https://example.com/clanok/"Curl tu odošle požiadavku s uvedeným user-agentom a sleduje presmerovania. Nie je to návšteva skutočného OAI-SearchBotu a príkaz sám neuplatňuje pravidlá robots.txt. Test ukazuje odpoveď pre vašu požiadavku z vašej IP adresy.
- 200: otvorte aj uložený obsah. Musí obsahovať očakávaný článok, nie prihlásenie, bezpečnostnú výzvu alebo chybové hlásenie.
- Presmerovanie: skontrolujte cieľ aj konečnú odpoveď. Stránka nesmie skončiť na nesúvisiacom obsahu.
- 403 alebo bezpečnostná výzva: hľadajte zodpovedajúcu udalosť v CDN alebo bezpečnostnom nástroji. Porovnajte čas, cestu a pravidlo, ktoré požiadavku zastavilo.
- 5xx: najprv riešte serverovú chybu. Úprava textu článku ju neodstráni.
Potvrďte skutočný prístup v logoch
V prístupovom logu alebo logu CDN hľadajte kontrolovanú cestu. K záznamu patria čas, IP adresa, user-agent a výsledný stav. Samotný názov bota sa dá napodobniť. Pri OpenAI porovnajte zdrojovú IP s aktuálnymi rozsahmi odkazovanými v dokumentácii crawlerov; pri inej službe použite jej spôsob overenia.
Modelové vyhodnotenie: miestny test dostane 200, ale overená požiadavka crawlera v CDN logu dostala 403. Obsah v tomto prípade nie je prvá oprava. Správca má preveriť konkrétne blokujúce pravidlo a po zmene potvrdiť novú požiadavku. Bez záznamu skutočného crawlera máte iba lokálny test, nie potvrdenie jeho návštevy.
Indexáciu a citácie kontrolujte zvlášť
Po technickej oprave zopakujte test rovnakej URL. V Bing Webmaster Tools potom kontrolujte indexáciu Bingu; Google Search Console pokrýva Google. Pri AI Mode v Google ani inej službe úspešné načítanie samo nepotvrdzuje citáciu.
Od správcu si pýtajte adresu, čas, výsledok pred opravou a po nej a informáciu, či išlo o simulovanú alebo overenú požiadavku. Taký záznam umožní rozhodnúť, či je technická prekážka odstránená.
Časté otázky
Prečo nestačí Google Search Console?
Lebo jednotlivé AI služby používajú rôzne crawlery, vyhľadávacie indexy a zdroje. Google Search Console ukazuje stav v Google, nie prístup OAI-SearchBotu, PerplexityBotu ani indexáciu v Bingu.
Mám v robots.txt blokovať AI botov?
Závisí od cieľa a od konkrétneho user-agenta. OAI-SearchBot slúži na vyhľadávanie v ChatGPT, kým GPTBot súvisí s tréningom modelov. Prístup pre vyhľadávanie a tréning preto treba posudzovať oddelene.
Kedy po oprave skontrolovať prístup crawlerov a indexáciu?
Prístup crawlera overte hneď po oprave. Indexáciu sledujte následne; jej termín ani prvú citáciu nemožno zaručiť.
SEO · PPC · AI Search
Nezávislý audit vášho webu a kampaní
Podľa potrieb vášho webu vyberieme oblasť auditu: SEO, PPC, meranie, obsah alebo AI Search. Dostanete stručný zoznam odporúčaní v poradí podľa dopadu a plán na 30 dní.