AI Search a GEO

Ktorým AI crawlerom povoliť prístup na web

V robots.txt uvádzate pravidlá, ktoré majú crawlery pri návšteve webu rešpektovať. Pri AI službách však treba rozlišovať vyhľadávacie a tréningové user-agenty, pretože nemajú rovnaký účel.

Reálna oceľová brána do technického archívu s jednou vedome otvorenou kobaltovou trasou.
Prístup crawlerov nie je technický detail. Je to rozhodnutie, koho pustíte k obsahu.

Firma môže chcieť, aby sa jej obsah používal vo vyhľadávaní AI, a zároveň nechcieť povoliť zber pre tréning. Preto AI crawlery neposudzujte ako jednu skupinu. V robots.txt zapíšte rozhodnutie pre konkrétny účel.

Vyhľadávacie a tréningové AI crawlery

AI služby používajú rôzne crawlery a zdroje. Pravidlá v robots.txt preto kontrolujte osobitne pre jednotlivé user-agenty:

  • GPTBot - OpenAI ho používa na zber obsahu pre možné zlepšovanie modelov.
  • OAI-SearchBot - OpenAI ho používa na vyhľadávanie a zobrazovanie zdrojov v ChatGPT.
  • ClaudeBot - Anthropic ho používa na zber obsahu, ktorý môže slúžiť na tréning modelov. Claude-SearchBot slúži vyhľadávaniu a Claude-User načítava obsah na žiadosť používateľa. Tieto user-agenty posudzujte samostatne podľa dokumentácie Anthropicu.
  • PerplexityBot - vyhľadávač Perplexity.
  • Google-Extended - riadi použitie obsahu na trénovanie budúcich modelov Gemini a poskytovanie podkladov z indexu Googlu pri odpovedaní v Gemini Apps a Vertex AI. Prístup pre Google Search vrátane AI Overviews a AI Mode sa riadi pravidlami pre Googlebot.

Modelové nastavenie pre vyhľadávanie bez tréningu

Nasledujúci príklad rieši iba dvojicu crawlerov OpenAI. OAI-SearchBot má prístup okrem priečinka /neverejne/, GPTBot je blokovaný. Pre ostatné crawlery zostáva všeobecné pravidlo. Názov priečinka je modelový.

User-agent: OAI-SearchBot
Disallow: /neverejne/

User-agent: GPTBot
Disallow: /

User-agent: *
Disallow: /neverejne/

Prázdne Disallow: by neobmedzovalo žiadnu cestu v danej skupine. Disallow: / zakazuje celý web. Význam účelov a samostatné nastavenie opisuje dokumentácia crawlerov OpenAI.

Prečo nestačí dopísať iba meno crawlera

Modelová chyba vznikne, ak web obsahuje všeobecný zákaz priečinka a potom osobitnú skupinu, ktorá tento zákaz nezopakuje:

User-agent: *
Disallow: /neverejne/

User-agent: OAI-SearchBot
Disallow:

Táto osobitná skupina žiadnu cestu nezakazuje. Pri kontrole sa nespoliehajte na to, že sa pravidlá s hviezdičkou automaticky pripočítajú. Dokumentácia interpretácie robots.txt vysvetľuje výber skupiny; pri ďalšej službe overte aj jej vlastné pravidlá. Pôvodný súbor si pred úpravou uložte a zachovajte existujúce obmedzenia.

Kedy zvážiť blokovanie tréningového crawlera

Použitie obsahu na trénovanie modelov posudzujte oddelene od vyhľadávania. Robots.txt však nezabezpečuje platený ani citlivý obsah; ten chráňte prístupovými oprávneniami.

Po zmene treba overiť aj odpoveď servera a prípadné blokovanie na CDN. Tomu sa venuje návod na overenie prístupu crawlerov. Robots.txt sám nie je ochrana heslom ani záruka citácie.

Časté otázky

Ako zistím, či blokujem AI botov?

Otvorte si vasadomena.sk/robots.txt a skontrolujte pravidlá Disallow pre konkrétne user-agenty. OAI-SearchBot a GPTBot posudzujte oddelene, pretože nemajú rovnakú úlohu.

Mám AI botov pustiť, alebo zablokovať?

Nastavte ich podľa cieľa. Vyhľadávací crawler povoľte, ak chcete byť dohľadateľní v danej službe. Tréningový crawler môžete posudzovať samostatne podľa pravidiel práce s obsahom.

Stačí pustiť botov dnu, aby ma AI citovala?

Nie. Povolenie crawlera samo nezaručuje použitie stránky v odpovedi. Treba preveriť aj indexáciu a relevantnosť obsahu pre konkrétnu otázku; pravidlá sa líšia podľa služby.

SEO · PPC · AI Search

Nezávislý audit vášho webu a kampaní

Podľa potrieb vášho webu vyberieme oblasť auditu: SEO, PPC, meranie, obsah alebo AI Search. Dostanete stručný zoznam odporúčaní v poradí podľa dopadu a plán na 30 dní.