AI Search a GEO

Ako overiť prístup vyhľadávacích crawlerov k webu

AI služby používajú rôzne crawlery, indexy a zdroje. Kontrola mimo Google ukáže, či je web dostupný aj pre vyhľadávanie v ChatGPT, Perplexity a službách Microsoftu.

Reálny serverový a archívny priestor prepojený kobaltovou dráhou k usporiadaným dokumentom.
Aj pri kvalitnom obsahu treba overiť, či ho vyhľadávacie crawlery dokážu načítať.

Pri kontrole AI vyhľadávania oddeľte tri otázky: povoľuje web crawleru prístup, dostane serverovú odpoveď s obsahom a použila služba stránku vo výsledku? Každá potrebuje iný dôkaz. Tento postup rieši prvé dve.

Vyberte jednu URL a skontrolujte jej pravidlá

Začnite konkrétnou verejnou stránkou, ktorú chcete sprístupniť. Uložte jej adresu a čas kontroly. V robots.txt na rovnakom hostiteľovi nájdite pravidlá pre daný crawler a cestu stránky. Rozhodnutie, komu prístup povoliť, aj modelový zápis nájdete v článku Ktorým AI crawlerom povoliť prístup.

Otestujte odpoveď servera

Technik môže použiť nasledujúci príkaz. https://example.com/clanok/ je modelová adresa: nahraďte ju kontrolovanou URL. Príkaz uloží hlavičky a HTML do dvoch lokálnych súborov.

curl --silent --show-error --location \
  --user-agent "OAI-SearchBot" \
  --dump-header hlavicky.txt \
  --output stranka.html \
  "https://example.com/clanok/"

Curl tu odošle požiadavku s uvedeným user-agentom a sleduje presmerovania. Nie je to návšteva skutočného OAI-SearchBotu a príkaz sám neuplatňuje pravidlá robots.txt. Test ukazuje odpoveď pre vašu požiadavku z vašej IP adresy.

  • 200: otvorte aj uložený obsah. Musí obsahovať očakávaný článok, nie prihlásenie, bezpečnostnú výzvu alebo chybové hlásenie.
  • Presmerovanie: skontrolujte cieľ aj konečnú odpoveď. Stránka nesmie skončiť na nesúvisiacom obsahu.
  • 403 alebo bezpečnostná výzva: hľadajte zodpovedajúcu udalosť v CDN alebo bezpečnostnom nástroji. Porovnajte čas, cestu a pravidlo, ktoré požiadavku zastavilo.
  • 5xx: najprv riešte serverovú chybu. Úprava textu článku ju neodstráni.

Potvrďte skutočný prístup v logoch

V prístupovom logu alebo logu CDN hľadajte kontrolovanú cestu. K záznamu patria čas, IP adresa, user-agent a výsledný stav. Samotný názov bota sa dá napodobniť. Pri OpenAI porovnajte zdrojovú IP s aktuálnymi rozsahmi odkazovanými v dokumentácii crawlerov; pri inej službe použite jej spôsob overenia.

Modelové vyhodnotenie: miestny test dostane 200, ale overená požiadavka crawlera v CDN logu dostala 403. Obsah v tomto prípade nie je prvá oprava. Správca má preveriť konkrétne blokujúce pravidlo a po zmene potvrdiť novú požiadavku. Bez záznamu skutočného crawlera máte iba lokálny test, nie potvrdenie jeho návštevy.

Indexáciu a citácie kontrolujte zvlášť

Po technickej oprave zopakujte test rovnakej URL. V Bing Webmaster Tools potom kontrolujte indexáciu Bingu; Google Search Console pokrýva Google. Pri AI Mode v Google ani inej službe úspešné načítanie samo nepotvrdzuje citáciu.

Od správcu si pýtajte adresu, čas, výsledok pred opravou a po nej a informáciu, či išlo o simulovanú alebo overenú požiadavku. Taký záznam umožní rozhodnúť, či je technická prekážka odstránená.

Časté otázky

Prečo nestačí Google Search Console?

Lebo jednotlivé AI služby používajú rôzne crawlery, vyhľadávacie indexy a zdroje. Google Search Console ukazuje stav v Google, nie prístup OAI-SearchBotu, PerplexityBotu ani indexáciu v Bingu.

Mám v robots.txt blokovať AI botov?

Závisí od cieľa a od konkrétneho user-agenta. OAI-SearchBot slúži na vyhľadávanie v ChatGPT, kým GPTBot súvisí s tréningom modelov. Prístup pre vyhľadávanie a tréning preto treba posudzovať oddelene.

Kedy po oprave skontrolovať prístup crawlerov a indexáciu?

Prístup crawlera overte hneď po oprave. Indexáciu sledujte následne; jej termín ani prvú citáciu nemožno zaručiť.

SEO · PPC · AI Search

Nezávislý audit vášho webu a kampaní

Podľa potrieb vášho webu vyberieme oblasť auditu: SEO, PPC, meranie, obsah alebo AI Search. Dostanete stručný zoznam odporúčaní v poradí podľa dopadu a plán na 30 dní.