Vyhledávání a AI

Odkud berou AI nástroje data pro odpovědi

Odpověď AI nevzniká jen z toho, co se model naučil při tréninku. Velká část dnešních odpovědí stojí na živém vyhledávání a každý nástroj přitom sahá do jiného indexu. Jakmile víte do kterého, přestane být práce na viditelnosti v AI hádáním a začne připomínat běžné SEO: dostupnost, zařazení do indexu, relevance.

Co si z průvodce odnést

  • Trénovací data a živé vyhledávání jsou dvě různé vrstvy. O citace se hraje hlavně v té druhé.
  • Každý nástroj sahá jinam: Claude do Brave, ChatGPT do vlastního indexu, Gemini do Googlu, Perplexity do svého.
  • V robots.txt lze oddělit tréninkové roboty od vyhledávacích a povolit jen to, co skutečně chcete.

Dvě vrstvy: co je v modelu a co si model dohledá

Každý velký jazykový model kombinuje dva zdroje. Prvním jsou trénovací data, tedy znalosti zapečené v modelu do data uzávěrky. Druhým je živé vyhledávání: model si sám napíše dotaz, dostane výsledky, případně stáhne konkrétní stránky a z nich odpověď sestaví.

Pro práci na viditelnosti je podstatná hlavně druhá vrstva. Do trénovacích dat už svůj obsah zpětně nedostanete a nezjistíte, co přesně si z nich model odnesl. Živé vyhledávání naopak běží nad indexem, do kterého se dá dostat, a právě z něj vznikají citace a odkazy v odpovědi.

Trénovací data

Znalosti uzavřené k datu uzávěrky modelu. Neaktualizují se a nedají se ovlivnit jednou úpravou webu. Tréninkové roboty jde v robots.txt zakázat samostatně.

Živé vyhledávání

Model se v průběhu odpovědi ptá vyhledávače a cituje, co našel. Tady se rozhoduje o odkazech na váš web, a tady má smysl pracovat na dostupnosti a obsahu.

Do jakého indexu sahá který nástroj

Neexistuje jeden společný index pro AI. Každý dodavatel si zdroje řeší po svém a odpovědi se proto liší nejen formulací, ale i tím, které weby vůbec připadají v úvahu. Následující přehled shrnuje stav k září 2026; u nástrojů, které své zdroje nezveřejňují, jde o závěry z měření, nikoli o oficiální potvrzení.

Zdroje živých dat a roboti jednotlivých nástrojů
NástrojHlavní zdroj živých datVyhledávací a uživatelský robotTréninkový robot
ClaudeBrave Search; doložené měřením, oficiálně nepotvrzenéClaude-SearchBot, Claude-UserClaudeBot
ChatGPTVlastní index doplněný o Bing, Google a další dodavateleOAI-SearchBot, ChatGPT-UserGPTBot
Gemini, AI Overviews a AI ModeIndex Google SearchGooglebotGoogle-Extended
PerplexityVlastní index nad enginem Vespa a licencovaná dataPerplexityBot, Perplexity-UserNetrénuje na vlastním crawlu
CopilotBing, v Microsoftu 365 navíc firemní dataBingbotNeuvádí samostatný token
GrokWeb a síť XNeuvádí samostatný tokenNeuvádí samostatný token

Claude: nejtěsnější vazba na jeden index

Anthropic poskytovatele vyhledávání oficiálně nepojmenoval, nepřímých dokladů je ale hodně: Brave Search je na seznamu subdodavatelů Anthropicu a webové vyhledávání v API má parametr pojmenovaný přímo po Brave. Analýzy citací navíc opakovaně nacházejí vysokou shodu mezi tím, co Claude cituje, a předními organickými výsledky Brave.

Podle dat prezentovaných na odborné konferenci Claude výsledky nepřerovnává a pracuje s nimi v podobě, v jaké je dostane. S tím, co na stejné dotazy cituje ChatGPT, se přitom potkává jen asi v osmi procentech případů. Rozbor Profoundu našel shodu s předními organickými výsledky Brave v 86,7 procenta, šlo ale o malý vzorek, takže berte číslo jako indicii, ne jako konstantu.

Brave nabízí nástroj Submit URL, kterým si lze vyžádat načtení nové adresy. Pomůže to s objevením stránky, ne s pozicí ani s citací. Platí tu totéž co jinde: odeslání adresy je začátek, ne výsledek.

Zdroj: Search Engine Land: viditelnost v Claude může záviset na pozicích v Brave Search

ChatGPT: vlastní index místo pouhého Bingu

Rovnice „ChatGPT rovná se Bing“ už neplatí. OpenAI si postavila vlastní vyhledávací index, interně označovaný Labrador, a nejde o jeden seznam stránek: jsou to vertikální indexy pro web, PDF, videa, zprávy, odborné články, encyklopedii, lokální výsledky, finance, právo, medicínu, nákupy i obrázky.

Vlastní index přitom není jediný zdroj. ChatGPT k němu přidává výsledky dalších dodavatelů a podle placeného režimu se poměr výrazně mění: v bezplatné verzi převažuje vlastní index, v režimu s hlubším uvažováním naopak výsledky převzaté odjinud. Pro vlastníka webu z toho plyne, že jeden test v jednom účtu nevypovídá o tom, jak je na tom web celkově.

Zdroj: Peec AI: ChatGPT si postavil vlastní vyhledávací index

Google: jeden index pro Search, AI Overviews i AI Mode

AI přehledy i AI Mode běží nad stejným indexem jako klasické vyhledávání a řídí se pravidly pro Googlebota. Dobře odvedené SEO v Googlu je tady proto nejpřímější pákou; žádné zvláštní AI soubory ani speciální značkování k tomu podle dokumentace Googlu nepotřebujete.

Samostatnou kapitolou je token Google-Extended. Podle dokumentace Googlu řídí, zda obsah pomůže trénovat budoucí modely Gemini, a dokumentace pro Vertex AI k tomu dodává, že grounding nepoužije stránky, které Google-Extended zakázaly. Na zařazení ani na pořadí v Google Search vliv nemá. Zákaz tedy nic nestojí ve vyhledávání, ale odřízne vás od odpovědí v aplikaci Gemini.

Zdroj: Google: přehled běžných robotů včetně tokenu Google-Extended

Perplexity, Copilot a Grok

Perplexity převedla v dubnu 2025 vyhledávání do vlastní režie a postavila ho na otevřeném enginu Vespa, který zvládá vyhledávání i řazení v jedné vrstvě. Index plní vlastní PerplexityBot doplněný o licencovaná data a firma ho popisuje jako stovky miliard stránek.

Copilot od Microsoftu si z promptu sestaví krátký dotaz a pošle ho do Bingu; v Microsoftu 365 k tomu přidává firemní data z prostředí zákazníka. Grok kombinuje web s obsahem sítě X, což ho zvýhodňuje u čerstvých zpráv a trendů. Ani jeden nepřidává samostatný robot, se kterým by bylo potřeba zvlášť počítat.

Zdroj: Vespa.ai: Perplexity převedla vyhledávání do vlastní režie

Jak často modely vůbec sahají na web

Rozdíly jsou velké a mají přímý dopad na to, kde se o citace hraje. Claude sáhl po webu zhruba u 36 procent promptů, ChatGPT asi u 90 procent. U Clauda přitom šance na vyhledávání roste, když dotaz míří na aktuálnost, žebříčky, lokalitu nebo srovnání; u ostatních dotazů odpovídá spíš z toho, co se naučil.

Aplikace Gemini je nejméně předvídatelná: v jednom měření groundovala 41 procent odpovědí, o měsíc později 71 procent a za osm měsíců se pohybovala mezi 27 a 70 procenty. Jedno měření proto neberte jako vlastnost nástroje. Když si viditelnost měříte sami, zapisujte si datum, režim i znění dotazu, jinak neodlišíte vlastní zlepšení od kolísání systému.

Zdroj: Cloro: jak často jednotlivé AI nástroje sahají na živý web

Oddělte tréninkové roboty od vyhledávacích

Velcí dodavatelé dnes rozlišují roboty podle účelu a dávají jim samostatné identifikátory. Díky tomu můžete odmítnout trénink modelů a zároveň zůstat způsobilí k citacím ve vyhledávání. Je to jedno z mála míst, kde má vlastník webu skutečnou páku, a stojí za to ho nastavit vědomě.

Ukázka robots.txt: povolit AI vyhledávání, odmítnout trénink
# AI vyhledávání a citace – povolit
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: PerplexityBot
Allow: /

# Trénink modelů – zakázat
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

# Zakáže i grounding v aplikaci Gemini.
# Google Search ani AI Overviews to neovlivní.
User-agent: Google-Extended
Disallow: /
Co který robot dělá a co způsobí jeho zákaz
RobotK čemu sloužíCo způsobí jeho zákaz
GPTBotSběr dat pro trénink modelů OpenAI.Budoucí obsah se nepoužije k tréninku; na vyhledávání v ChatGPT to vliv nemá.
OAI-SearchBotStahování stránek pro vyhledávání v ChatGPT.Web vypadne z výsledků, které ChatGPT nabízí a cituje.
ChatGPT-UserNačtení stránky, na kterou se uživatel přímo zeptá.ChatGPT stránku neotevře, ani když ji člověk sám vloží.
ClaudeBotSběr dat pro trénink modelů Anthropicu.Budoucí obsah se nepoužije k tréninku.
Claude-SearchBotIndexace obsahu pro vyhledávání v Claude.Obsah se neindexuje pro odpovědi Claude.
Claude-UserNačtení stránky na přímý dotaz uživatele.Claude stránku neotevře; podle Anthropicu i tento robot respektuje robots.txt.
PerplexityBotIndexace obsahu pro Perplexity.Web vypadne z indexu Perplexity.
Google-ExtendedTrénink modelů Gemini a grounding v aplikacích Gemini a Vertex AI.Neovlivní Google Search ani AI Overviews, odřízne ale aplikaci Gemini.

Zdroj: Anthropic: jak Claude prochází web a jak roboty řídit v robots.txt

Ověřte, že se k vám roboti vůbec dostanou

Pravidla v robots.txt nepomůžou, pokud požadavek zastaví něco před nimi. Cloudflare u nových domén ve výchozím nastavení blokuje kategorie tréninku a agentů a vyhledávací roboty nechává povolené. Nastavení se ale mění a mnoho webů má vlastní pravidla, takže skutečný stav zjistíte jedině v administraci CDN a v serverových logách.

Druhou častou dírou je vykreslování. Většina AI robotů čte stránku jako čisté HTML a JavaScript nespouští. U e-shopů a aplikací postavených na klientském renderování tak robot uvidí prázdnou kostru, i když je v prohlížeči všechno v pořádku. Serverové vykreslení důležitého obsahu je proto předpoklad, ne optimalizace.

Zdroj: Cloudflare: nové možnosti řízení AI provozu pro všechny zákazníky

Co s tím udělat na vlastním webu

Pořadí kroků je stejné jako u běžného technického SEO: nejdřív se k vám robot musí dostat, pak vás musí mít v indexu a teprve potom se řeší, jestli je obsah dost dobrá odpověď. Přeskočit první dva kroky nejde.

  • Ověřte v logách, které AI roboty k vám skutečně chodí a které dostávají chybu nebo zákaz.
  • Zkontrolujte CDN a firewall dřív než robots.txt; výchozí ochrana bývá přísnější, než čekáte.
  • Rozhodněte vědomě o tréninku a vyhledávání zvlášť a promítněte to do robots.txt.
  • Nezůstávejte jen u Googlu: přidejte Bing Webmaster Tools a odeslání adres do Brave.
  • Zvažte IndexNow. Jedním odesláním pokryjete Bing, Seznam.cz, Yandex, Naver i Yep.
  • Důležitý obsah vykreslujte na serveru a ověřte si ho s vypnutým JavaScriptem.

Zdroj: IndexNow: okamžité oznámení změn zapojeným vyhledávačům

Časté otázky

Zaručí povolení všech robotů, že mě AI bude citovat?

Ne. Povolení je podmínka, ne záruka. Robot musí stránku najít, načíst a vyhodnotit jako dobrou odpověď na konkrétní dotaz. Zákaz naopak citaci spolehlivě vyloučí, protože obsah se do indexu vůbec nedostane.

Mám blokovat tréninkové roboty?

Je to obchodní rozhodnutí, ne technické. Zákaz tréninku nesnižuje šanci na citaci, pokud zároveň necháte povolené vyhledávací roboty. U Google-Extended platí výjimka: zákaz neovlivní Google Search, ale odřízne aplikaci Gemini.

Stačí mi dobré pozice v Googlu?

Pro AI Overviews a AI Mode ano, protože běží nad indexem Googlu. Pro Claude a ChatGPT ne: sahají do jiných indexů, takže je potřeba být dohledatelný i v Bingu a v Brave.

Proč dostávám pokaždé jinou odpověď?

Nástroje se liší v tom, jak často vůbec hledají, a jejich chování se v čase mění. Jedno měření proto nevypovídá o trendu. Zapisujte si datum, nástroj, režim i znění dotazu a srovnávejte až opakovaná pozorování.

Zdroje a další čtení

Nevíte, jestli se k vašemu webu AI roboti vůbec dostanou?

Projdeme logy, pravidla v robots.txt i nastavení CDN a řekneme si, kde má smysl začít a co je u vašeho webu ztráta času.

Probrat váš web