Máte službu, ktorú poskytujete v 40 mestách. Alebo produkt, ktorý má 300 variantov. Alebo dáta o 180 000 slovenských firmách. Pre každú kombináciu existuje dopyt, malý, ale reálny. Napísať 300 článkov ručne nie je ekonomické. Programatické SEO je postup, ako z jedného dátového zdroja a jednej šablóny vytvoriť stovky stránok, z ktorých každá odpovedá na inú konkrétnu otázku.
Je to zároveň najrýchlejšia cesta, ako si privodiť manuálnu akciu od Google. Rozdiel medzi stránkou s hodnotou a doorway page nie je v počte stránok ani v tom, či ich vygeneroval skript. Je v tom, či na stránke je niečo, čo sa inde nedá nájsť.
Stručne:
- Programatické SEO sa vyplatí len pri dopyte s opakujúcou sa štruktúrou (mesto + služba, značka + model, kategória + parameter) a len vtedy, keď máte dáta, ktoré šablónu naplnia rozdielne.
- Google nezakazuje generovanie stránok. Zakazuje doorway abuse, podľa jeho definície situáciu, keď „sú stránky alebo weby vytvorené na to, aby rankovali na konkrétne, podobné vyhľadávacie dopyty“, a scaled content abuse, teda „keď je veľa stránok vygenerovaných primárne na manipuláciu s poradím vo vyhľadávaní a nie na pomoc užívateľom“.
- Praktická hranica: ak po odstránení názvu mesta (alebo názvu modelu) zostanú dve stránky identické, nemali ste ich publikovať.
- Crawl budget je reálny limit až pri 10 000+ URL s denne sa meniacim obsahom alebo 1 mil.+ URL. Menšie weby majú skôr problém s kvalitou než s rozpočtom na prehľadávanie.
- Prvý signál zlyhania sa objaví v Search Console ako „Prehľadané – zatiaľ nezaindexované“ pri väčšine nových URL. To nie je technická chyba, to je hodnotenie kvality.
- Rozumné nasadenie je vo vlnách (najprv 20 – 50 URL), nie 800 URL jednou publikáciou.
Čo je programatické SEO a kedy dáva zmysel
Programatické SEO (anglicky programmatic SEO, skrátene pSEO) je tvorba vstupných stránok procesom, nie textom. Namiesto „napíšem článok“ nastavíte tri veci:
- dátovú tabuľku: jeden riadok = jedna budúca stránka,
- šablónu: pevnú štruktúru s premennými miestami,
- generovanie: proces, ktorý z riadkov a šablóny vyrobí URL.
Výsledkom nie je obsah „napísaný AI“. Výsledkom je obsah, ktorého unikátna časť sú dáta. Text okolo dát môže byť rovnaký, rovnako ako je na každej stránke produktu v e-shope rovnaká štruktúra, ale iná špecifikácia.
Tri typy dopytu s opakujúcou sa štruktúrou
Programatické SEO funguje len na dopyte, ktorý má vzor. Tri vzory pokrývajú väčšinu reálnych prípadov:
| Vzor | Príklad dopytu | Dátové osi | Typický počet stránok |
|---|---|---|---|
| Služba + lokalita | „kurzy angličtiny Trnava“, „odťahová služba Žilina“ | služba × mesto | 10 – 200 |
| Značka + model / typ | „náhradné diely Bosch WAN28″, „kompatibilita toneru HP 207A“ | výrobca × produkt | 100 – 10 000 |
| Kategória + parameter | „sro s obratom nad 1 mil. v SK NACE 46.51″, „byty 3+1 do 200 000 € Nitra“ | kategória × filtračný parameter | 50 – 5 000 |
Štvrtý, menej zrejmý vzor je porovnanie dvoch entít („X vs. Y“). Ten rastie kvadraticky a je najrizikovejší. Pri 60 entitách dostanete 1 770 kombinácií, z ktorých má zmysel možno 80.
Päť podmienok, keď to dáva zmysel
Programatické SEO zapnite len vtedy, keď platí všetkých päť:
- Dopyt existuje a má vzor. Overte si to na reálnych dátach, nie odhadom. Ako postupovať pri analýze kľúčových slov, rozoberáme v článku o SEO optimalizácii.
- Máte dáta na každý riadok. Nie na 70 % riadkov. Na každý, ktorý chcete publikovať.
- Dáta sa medzi riadkami reálne líšia. Ak sa mení len jedno slovo, nemáte dátový zdroj, máte šablónu s premennou.
- Stránka má čo robiť po kliku. Existuje akcia, ktorú na nej návštevník vykoná: dopyt, filtrovanie, stiahnutie, kontakt.
- Dáta sa dajú udržiavať. 400 stránok s neaktuálnymi cenami je horšie než 20 aktuálnych.
Čím sa to líši od bežnej tvorby obsahu
| Redakčný obsah | Programatické SEO | |
|---|---|---|
| Jednotka práce | článok | riadok v tabuľke + šablóna |
| Čo rozhoduje o kvalite | autorský vklad, hĺbka | kvalita a jedinečnosť dát |
| Škálovanie | lineárne (viac hodín = viac článkov) | skokové (šablóna raz, riadky kedykoľvek) |
| Hlavné riziko | nízky výkon jednotlivého článku | plošné nezaindexovanie alebo manuálna akcia |
| Údržba | aktualizácia textu | aktualizácia dátového zdroja |
| Typický dopyt | informačný, široký | veľmi konkrétny, long-tail |
Kedy to nedáva zmysel a kedy je to už spam
Toto je najdôležitejšia časť článku, pretože hranica nie je názorová. Google ju má popísanú v oficiálnych pravidlách pre spam.
Doorway abuse podľa Google
V dokumente Spam policies for Google web search má Google samostatnú sekciu Doorway abuse. Definuje ju takto: „Doorway abuse is when sites or pages are created to rank for specific, similar search queries.“, teda stránky vytvorené preto, aby rankovali na konkrétne, podobné dopyty.
Google v tej istej sekcii vymenúva konkrétne praktiky, ktoré za doorway abuse považuje:
- „Having multiple websites with slight variations to the URL and home page to maximize their reach“: viac webov s drobnými obmenami URL a domovskej stránky,
- „Having multiple domain names or pages targeted at specific regions or cities that funnel users“: viac domén alebo stránok cielených na konkrétne regióny či mestá, ktoré užívateľov len presmerujú ďalej,
- „Generating pages to funnel visitors into the actual usable or relevant portion of a site“: generovanie stránok, ktoré majú návštevníka len previesť na skutočne použiteľnú časť webu.
Tretí bod je rozhodujúci a najčastejšie prehliadaný: ak je generovaná stránka len medzikrokom k „skutočnej“ stránke, je to doorway page. Nie preto, že ju vygeneroval skript, ale preto, že samotná nemá hodnotu.
Scaled content abuse
Druhá relevantná sekcia tých istých pravidiel je Scaled content abuse: „Scaled content abuse is when many pages are generated for the primary purpose of manipulating search rankings and not helping users.“
Google pod ňu zaraďuje aj:
- „Using generative AI tools or other similar tools to generate many pages without adding value“,
- „Scraping feeds, search results, or other content to generate many pages“,
- „Creating many pages where the content makes little or no sense but contains keywords“.
Druhý bod má priamy dopad na dátový zdroj: generovať stránky zo scrapnutých feedov alebo výsledkov vyhľadávania bez pridanej hodnoty je explicitne uvedené ako porušenie. Scraping ako metóda získania dát problém nie je. Problém je publikovať scrapnuté dáta ako obsah bez vlastného vkladu.
Pozor na blízku tretiu kategóriu, Thin affiliation: „the practice of publishing content with product affiliate links where descriptions are copied directly from merchants without original content or added value“, ktorej typickým znakom je „cookie-cutter sites or templates with the same or similar content replicated within or across multiple domains“. Formulácia „templates with the same or similar content“ je presne popisom zle urobeného programatického SEO.
Test, ktorý Google ponúka sám
V dokumente Creating helpful, reliable, people-first content Google uvádza sebahodnotiace otázky. Pre programatické SEO sú rozhodujúce štyri:
- „Does the content provide original information, reporting, research, or analysis?“
- „If the content draws on other sources, does it avoid simply copying or rewriting those sources, and instead provide substantial additional value and originality?“
- „Is the content primarily made to attract visits from search engines?“
- „Is the content mass-produced by or outsourced to a large number of creators, or spread across a large network of sites?“
K automatizácii je Google v tom istom dokumente konkrétny: „If automation is used to substantially generate content“ na „the primary purpose of manipulating search rankings, that’s a violation of our spam policies.“ Zároveň sa pýta, či je použitie automatizácie „self-evident to visitors through disclosures or in other ways“.
Z toho vyplýva praktické odporúčanie, ktoré stojí jeden odstavec textu: na generovanej stránke napíšte, odkiaľ dáta sú a kedy boli naposledy aktualizované. Plní to Googlom spomínanú transparentnosť a zároveň to je informácia, ktorú návštevník naozaj chce.
Prevádzkový test troch otázok
Pred publikovaním si pri každom type generovanej stránky odpovedzte:
- Test odstránenia premennej. Odstráňte z dvoch stránok názov mesta / modelu / kategórie. Sú rozdielne? Ak nie, nepublikujte.
- Test priameho prístupu. Keby na stránku niekto prišiel z LinkedInu, nie z Google, mala by preň hodnotu? (Je to Googlova vlastná otázka o „existing or intended audience“.)
- Test ďalšieho kroku. Je stránka cieľ, alebo len rozcestník na „skutočnú“ stránku? Ak druhé, ide o doorway page podľa tretieho bodu definície.
Kedy to nedáva zmysel vôbec: pri službe, ktorú poskytujete na jednom mieste, pri produktoch, kde sa variant líši len farbou, pri témach, kde zákazník potrebuje poradenstvo a nie dáta, a vždy, keď dáta na odlíšenie jednoducho nemáte. V takých prípadoch je efektívnejších 15 dobrých stránok. Pri lokalitách to platí dvojnásobne. Pravidlá pre mestské stránky rozoberáme v článku o lokálnom SEO.
Čo musí mať každá generovaná stránka, aby mala hodnotu
Pracujte s pravidlom pomeru: aspoň 40 % obsahu nad ohybom stránky má byť unikátne pre daný riadok. Nie 40 % znakov celej stránky, ale 40 % toho, čo návštevník vidí skôr, než začne scrollovať.
1. Unikátne dáta
Dáta sú to, čo stránku odlíši. Rozdiel medzi premennou a dátami:
| Premenná (nestačí) | Dáta (stačí) |
|---|---|
| „Poskytujeme {služba} v {mesto}.“ | počet firiem v danom SK NACE v danom okrese, medziročná zmena, 5 najväčších zamestnávateľov |
| „Toner {kód} je kompatibilný s tlačiarňami.“ | konkrétny zoznam 23 modelov, výťažnosť v stranách, cena za stranu, dátum overenia |
| „Ceny {služba} sú individuálne.“ | rozpätie z 18 reálnych cenníkov, mediánová cena, čo je v cene zahrnuté |
Najsilnejšia forma sú dáta, ktoré nikto iný nemá: vlastné merania, agregácie z vlastných projektov, prepočty z verejných dát, ktoré nikto nespravil. Práve to zodpovedá Googlovej otázke na „original information, reporting, research, or analysis“.
2. Odpoveď na konkrétnu otázku
Každá stránka musí mať jednu vetu, ktorá je priamou odpoveďou na dopyt, a musí byť v prvých 100 slovách. Nie „Vitajte na stránke venovanej…“, ale „V okrese Prešov pôsobí 1 847 firiem v stavebnej výrobe, z toho 212 s obratom nad 500 tis. €.“
Štruktúra, ktorá sa drží:
- H1 = presná formulácia dopytu,
- priama odpoveď v jednej až dvoch vetách (1 – 2 čísla),
- dátový blok: tabuľka alebo graf s hodnotami pre daný riadok,
- kontext: 2 – 3 odstavce s interpretáciou, prečo sú čísla také, aké sú,
- najbližšie alternatívy: odkazy na 4 – 8 súvisiacich riadkov,
- metodika a zdroj: odkiaľ dáta sú, kedy boli aktualizované,
- CTA zodpovedajúce fáze (zvyčajne nie „kúpiť“, ale „overiť u nás“, „stiahnuť výrez“).
3. Interné prelinkovanie
Generované stránky sú bez prelinkovania „osirelé“. Google ich nemá ako nájsť a hlavne ich nemá ako hodnotiť. Funkčný model má tri vrstvy:
- Hub (rozbočovač). Jedna indexovateľná prehľadová stránka na každú dátovú os (napr.
/sluzby/cistenie-fasad/so zoznamom všetkých mest,/mesta/s abecedným zoznamom). Z nej vedú odkazy na všetky riadky. - Horizontálne odkazy medzi riadkami. Z každej stránky 4 – 8 odkazov na najbližšie súvisiace riadky (susedné okresy, kompatibilné modely, susedné cenové pásma). Nie náhodné, ale vypočítané z dát.
- Odkazy z redakčného obsahu. Aspoň niekoľko desiatok generovaných stránok má mať odkaz z bežného článku alebo zo služby. To je najsilnejší signál, že tie stránky niekam patria.
Google k štruktúre URL odporúča „readable words rather than long ID numbers“ a „using hyphens (-) instead of underscores (_) to separate words“, pričom pri cudzojazyčnom publiku radí použiť slová v jazyku publika. Pre slovenský web to znamená /cistenie-fasad/presov/, nie /service?id=12&city=304.
Dátový zdroj: odkiaľ brať dáta a kde sú mantinely
Celé programatické SEO stojí a padá na dátovom zdroji. Platí nepríjemné pravidlo: ak dáta zoženie každý za pol hodiny, stránky postavené na nich nemajú konkurenčnú výhodu.
| Zdroj | Jedinečnosť | Náklad | Riziko |
|---|---|---|---|
| Vlastné dáta (CRM, merania, cenníky, výsledky projektov) | najvyššia | čas na úpravu a anonymizáciu | musíte vyriešiť, čo môžete zverejniť |
| Verejné registre a open data (RPO, Obchodný register, register účtovných závierok, ŠÚ SR) | nízka v surovej forme, vysoká po prepočte | stredný | bez vlastného vkladu hrozí scaled content abuse |
| Dátové sety od dodávateľa | stredná | licenčný poplatok | pozor na licenčné podmienky zverejnenia |
| Scraping | závisí od zdroja | stredný až vysoký | právne aj technické, a priame riziko podľa pravidiel Google |
| Agregácia viacerých zdrojov + vlastný prepočet | najvyššia dosiahnuteľná pri verejných dátach | vysoký | nutnosť udržiavať metodiku |
Posledný riadok je jediná cesta, ako z verejných dát spraviť niečo vlastné. Surový výpis z registra je verejný údaj, ktorý má každý. Vaša analýza je prepočet: podiel firiem s rastúcim obratom v danom okrese a odvetví, index koncentrácie, medziročná zmena. Práve preto Google rozlišuje medzi „simply copying or rewriting those sources“ a „substantial additional value and originality“.
Aké konkrétne registre na Slovensku a v Česku existujú, čo v nich je a čo nie, podrobne rozoberáme v článku o databáze firiem SK a CZ.
Právne mantinely – stručne a s odkazom
Právna časť k firemným dátam, GDPR, § 116 zákona č. 452/2021 Z. z. a k tomu, kedy je scraping obhájiteľný a kedy nie, je celá v článku o databáze firiem, netreba ju tu opakovať. Pre programatické SEO z nej vyberáme štyri body, ktoré sa publikovania týkajú priamo:
- Nepublikujte osobné údaje. Mená konateľov, personalizované e-maily a kontakty na SZČO sú osobné údaje. Na generovanú stránku nepatria. Údaje o právnickej osobe (názov, IČO, sídlo, SK NACE, obrat) osobnými údajmi nie sú.
- Pri každom riadku si držte zdroj a dátum. Nielen pre vlastnú kontrolu. Uvedenie zdroja a dátumu aktualizácie priamo na stránke je zároveň signál kvality.
- Overte si licenčné podmienky. Komerčná databáza môže zakazovať zverejnenie dát na verejnom webe. Interné použitie a publikovanie sú dva rôzne režimy použitia.
- Scraping na publikovanie je iná kategória než scraping na analýzu. Zbierať verejné firemné údaje na vlastnú analýzu je obhájiteľné. Publikovať ich 1 : 1 ako obsah je presne praktika, ktorú Google uvádza pod scaled content abuse. Pridaný prepočet nie je kozmetika, je to podmienka.
Technická realizácia krok za krokom
Krok 1: dátová tabuľka
Jeden riadok = jedna URL. Minimálna schéma, ktorá sa v praxi osvedčila:
| Pole | Načo |
|---|---|
slug |
finálna URL, ručne kontrolovaná (diakritika, kolízie) |
h1, title, meta_description |
generované zo vzoru, ale s kontrolou dĺžky a duplicít |
odpoved |
jedna veta s priamou odpoveďou a číslom |
| 5 – 15 dátových polí | hodnoty, ktoré stránku odlíšia |
suvisiace |
4 – 8 slugov na horizontálne prelinkovanie |
zdroj_url, datum_aktualizacie |
transparentnosť a lastmod |
publikovat |
áno / nie; riadky s nedostatkom dát sa nepublikujú |
Pole publikovat je najdôležitejšie. Pravidlo: riadok, ktorý nemá vyplnené všetky dátové polia a odpoveď, sa negeneruje. Je lepšie publikovať 180 z 400 riadkov než 400, z ktorých 220 je prázdnych.
Krok 2: URL vzor
Jedna hierarchia, žiadne parametre, žiadne alternatívne cesty k tej istej stránke. /cistenie-fasad/presov/, nie súčasne aj /presov/cistenie-fasad/. Google priamo varuje pred tým, aby aditívne kombinácie filtrov spôsobili, že „the number of URLs (views of data) in the sites“ explodovalo, a odporúča „shorten URLs by trimming unnecessary parameters“.
Krok 3: šablóna
Šablóna má mať tri typy blokov:
- pevné (navigácia, pätička, vysvetlenie metodiky): rovnaké všade, to je v poriadku,
- premenné (dátová tabuľka, odpoveď, prelinkovanie): iné pre každý riadok,
- podmienené: zobrazia sa len vtedy, keď dáta existujú, a nikdy nevypíšu prázdne miesto ani „N/A“.
Prázdna tabuľka s nulami je horší signál než chýbajúci blok.
Krok 4: generovanie
Prakticky tri cesty: statický generátor (Astro, Next.js, Hugo) s dátami v CSV/JSON; CMS s vlastným typom obsahu a importom; alebo serverové renderovanie z databázy. Rozhodujúce nie je, ktorú zvolíte, ale aby výstup bol plne vyrenderovaný HTML. Dátový blok nesmie byť doplnený až JavaScriptom po načítaní. K voľbe riešenia sa vyjadrujeme v článku o tvorbe webu na mieru vs. šablóne.
Pred nasadením skontrolujte: duplicitné title a meta description, duplicitné h1, kolízie slugov, prázdne bloky, správne kanonické URL (každá stránka kanonizuje na seba) a to, že na každú URL vedie aspoň jeden odkaz.
Krok 5: sitemap
Podľa dokumentácie Google „All formats limit a single sitemap to 50MB (uncompressed) or 50,000 URLs.“ Pri väčšom počte URL rozdeľte sitemapy a použite index sitemapu.
Pre generované stránky navyše:
- do sitemapy patria len kanonické a indexovateľné URL; Google odporúča uvádzať „the URLs in your sitemap that you want to see in Google’s search results“,
- dajte generované URL do samostatnej sitemapy (
sitemap-mesta.xml); v Search Console potom vidíte ich indexovanie oddelene od zvyšku webu. Toto je najpraktickejší jediný trik celého článku, lastmodnastavujte zdatum_aktualizacie, nie z času buildu. Google hodnotu používa „if it’s consistently and verifiably… accurate“ a má odrážať významnú zmenu obsahu, nie prepísaný rok v pätičke.
Všeobecný technický checklist k sitemapám, kanonizácii a robots.txt je v článku o SEO optimalizácii.
Krok 6: indexovanie a crawl budget
Tu sa najčastejšie veria nepravdivé veci. Google v dokumente o riadení crawl budgetu uvádza, že optimalizácia crawl budgetu sa týka:
- „Large sites (1 million+ unique pages) with content that changes moderately often (once a week)“,
- „Medium or larger sites (10,000+ unique pages) with very rapidly changing content (daily)“,
- webov s veľkým počtom URL v stave „Discovered – currently not indexed“.
Pre web s 300 novými stránkami crawl budget nie je limit. Ak sa stránky neindexujú, dôvodom je takmer vždy kvalita, nie rozpočet na prehľadávanie.
Google rozlišuje dve veci: crawl capacity limit (koľko času Google venuje držaniu spojení na váš server, upravuje sa podľa stability odpovedí a chýb) a crawl demand (chuť crawlera prehľadávať, daná veľkosťou webu, frekvenciou zmien a kvalitou). Varuje, že „If Google spends too much time crawling URLs that it shouldn’t, Google’s crawlers might not explore the rest of your site.“
Čo z jeho odporúčaní platí pre generované stránky:
- konsolidujte duplicity a nízkohodnotné URL blokujte v
robots.txt, - „Don’t use
noindex, as Google will still request, but then drop the page“:noindexcrawl budget neušetrí, - natrvalo odstránené stránky vracajte ako 404/410, nie ako presmerovanie na domovskú stránku,
- držte sitemapy aktuálne a používajte
lastmod, - zlepšite rýchlosť odpovede servera a podporte HTTP 304.
K duplicitám Google zdôrazňuje, že uvedenie preferovanej kanonickej URL mu umožní „consolidate the signals they have for the individual URLs (such as links to them) into a single, preferred URL“, a výslovne varuje: „Don’t use the robots.txt file for canonicalization purposes. Google may still index URLs that are disallowed in robots.txt without their content.“
Krok 7: nasadenie vo vlnách
Nepublikujte 800 URL naraz. Odporúčaný postup:
| Vlna | Počet URL | Čo sledujete | Trvanie |
|---|---|---|---|
| 1 | 20 – 50 (najsilnejšie dáta) | podiel zaindexovaných, prvé impresie | 3 – 4 týždne |
| 2 | +100 – 150 | drží sa podiel indexovania? | 4 – 6 týždňov |
| 3 | zvyšok | impresie na riadok, podiel URL bez impresií | priebežne |
Ak prvá vlna nedosiahne aspoň 70 % zaindexovaných URL do troch týždňov, ďalšiu vlnu nepúšťajte. Opravte šablónu a dáta.
Ako merať úspech a ako rozpoznať, že to Google neberie
Čo sledovať
| Metrika | Kde | Zdravá hodnota po 8 – 12 týždňoch |
|---|---|---|
| Podiel zaindexovaných URL z danej sitemapy | Search Console → Indexovanie stránok, filtr podľa sitemapy | nad 70 % |
| Podiel URL s aspoň 1 impresiou | Search Console → Výkon, filtr podľa URL vzoru | nad 50 % zaindexovaných |
| Priemerné impresie na URL | Výkon | rastúci trend, nie plochá nula |
| Počet unikátnych dopytov na sekciu | Výkon → Dopyty | rastie rýchlejšie než počet URL |
| Podiel stránok s kliknutím | Výkon | nad 20 % zaindexovaných |
Definície, s ktorými pracujete, sú Googlove: impresia znamená „How many times your site appeared in Search results“, priemerná pozícia je „The average position of the topmost result from your site“.
Logika merania je dôležitejšia než absolútne čísla: pri programatickom SEO sa nemeria výkon jednotlivej stránky, ale distribúcia výkonu v celej sade. Ak 15 URL z 300 robí 90 % impresií, nepotrebujete 300 stránok, potrebujete 20 a zvyšok zrušiť.
Signály, že to Google neberie
Čítajte report Indexovanie stránok v Search Console. Google tam používa tieto stavy a ich významy:
| Stav | Googlova formulácia | Čo to pri generovaných stránkach znamená |
|---|---|---|
| Prehľadané – zatiaľ nezaindexované | „The page was crawled by Google but not indexed. It may or may not be indexed in the future; no need to resubmit.“ | Hodnotenie kvality. Google stránku videl a nepovažoval ju za hodnú indexu. Opakované odosielanie nepomôže, treba zmeniť obsah. |
| Nájdené – zatiaľ nezaindexované | „The page was found by Google, but not crawled yet. Typically, Google wanted to crawl the URL but this was expected to overload the site.“ | Kapacitný alebo prioritný problém. Pri veľkých sadách normálne, pri 50 URL signál pomalého servera. |
| Duplicita bez kanonickej URL vybranej užívateľom | duplicita, pri ktorej nie je určená preferovaná verzia | Šablóna generuje príliš podobné stránky. Toto je najtvrdší signál, že ste prekročili hranicu. |
| Duplicita, Google vybral inú kanonickú URL než užívateľ | Google a vy sa nezhodnete | To isté, len Google už vybral „víťaza“ sady. |
| Soft 404 | stránka vráti „nenájdené“ bez 404 kódu | Prázdne dátové bloky. Riadky bez dát nepublikujte. |
Praktické pravidlo: ak je po šiestich týždňoch viac než 40 % URL v stave „Prehľadané – zatiaľ nezaindexované“ alebo sa objavia duplicitné kanonické stavy, sada neprešla. Nie je to technická chyba, ktorú opravíte presmerovaním.
Riziká a čo s nimi
Duplicitný obsah a kanibalizácia
Nie je to penalizácia. Google duplicity rieši kanonizáciou. Dôsledok je však praktický: z 20 podobných stránok sa do indexu dostane jedna, zvyšok sa „zlúči“ alebo vypadne. A vzájomná kanibalizácia znamená, že si vlastné stránky konkurujú na ten istý dopyt.
Opatrenia: jeden dopyt = jedna URL (zmapujte si to pred generovaním); minimálny rozdiel v title a h1; aspoň 40 % unikátneho obsahu nad ohybom; riadky, ktoré sa od seba nelíšia dostatočne, zlúčte do jednej stránky.
Tenký obsah a manuálna akcia
V reporte Manuálne akcie v Search Console existuje typ „Tenký obsah s malou alebo žiadnou pridanou hodnotou“. Google ho definuje ako stránky, ktoré „don’t provide users with substantially unique or valuable content“, a medzi príklady uvádza „thin affiliate pages“, „scraped content or low-quality guest blog posts“ a „doorways“. Pre vážnejšie prípady existuje typ pokrývajúci rozsiahle spamové problémy vrátane scaled content abuse.
Manuálna akcia nie je algoritmický pokles, je to zásah človeka a prejaví sa oznámením v Search Console. Odstrániť ju znamená:
- opraviť všetky zasiahnuté stránky (nie vzorku),
- zabezpečiť, aby k nim Google mal prístup (žiadny login, žiadne blokovanie v
robots.txt), - v reporte Manuálne akcie zvoliť Žiadosť o kontrolu,
- popísať, čo bolo zlé, čo ste zmenili a aký to malo výsledok,
- počkať: od niekoľkých dní po niekoľko týždňov.
| Riziko | Prvý signál | Opatrenie |
|---|---|---|
| Tenký obsah | „Prehľadané – zatiaľ nezaindexované“ nad 40 % | doplniť dáta alebo zrušiť riadky |
| Duplicita | duplicitné kanonické stavy | zlúčiť riadky, zvýšiť podiel unikátneho obsahu |
| Doorway abuse | stránka je len rozcestník | dať stránke vlastný obsah, alebo ju zrušiť |
| Scaled content abuse | publikované scrapnuté dáta 1 : 1 | pridať vlastný prepočet a metodiku |
| Manuálna akcia | oznámenie v Search Console | oprava všetkých stránok + žiadosť o kontrolu |
| Neaktuálne dáta | klesajúca CTR pri stabilných impresiách | automatizovať aktualizáciu dátového zdroja |
Plán B si pripravte dopredu. Ak sada neprejde: neindexovateľné riadky nechajte dostupné pre užívateľov, ale odstráňte zo sitemapy; agregujte ich do menšieho počtu silnejších stránok; zvyšok vráťte ako 410.
Modelový príklad: „služba + mesto“ pre slovenský trh
Zadanie: firma poskytuje priemyselné čistenie fasád v celej SR, má dve prevádzky (Bratislava, Košice) a 11 rokov referencií.
Naivné riešenie: 79 stránok pre všetky okresné mestá s textom „Čistenie fasád {mesto} – zavolajte nám“. To je presne praktika, ktorú Google uvádza ako doorway abuse („multiple domain names or pages targeted at specific regions or cities that funnel users“) a ktorú ako chybu popisujeme aj v článku o lokálnom SEO.
Použiteľné riešenie: 22 stránok pre mestá, kde firma reálne realizovala aspoň dve zákazky. Dátová tabuľka:
| Pole | Príklad hodnoty (Prešov) |
|---|---|
mesto, okres, slug |
Prešov / Prešov / /cistenie-fasad/presov/ |
pocet_realizacii |
7 |
referencie |
3 konkrétne objekty s rokom a typom fasády |
prevladajuci_typ_fasady |
panel + zateplenie z 2008 – 2014 |
lokalne_specifikum |
vyššia prašnosť pri priemyselnej zóne, severná expozícia → riasy |
dojazd_z_prevadzky |
320 km z Bratislavy → práce v blokoch 3 – 5 dní |
cenove_rozpatie |
4,20 – 7,80 €/m² podľa výšky a znečistenia |
priemerny_termin |
3 – 5 týždňov od obhliadky |
pocet_bytovych_domov_v_okrese |
1 204 (verejné dáta, prepočet) |
kontakt_na_regionalneho_technika |
rolová adresa, nie osobná |
Čo tieto stránky reálne odlíši (a prečo prejdú testom odstránenia premennej):
- Vlastné referencie s konkrétnymi objektmi a rokmi: dáta, ktoré nikto iný nemá.
- Cenové rozpätie pre dané mesto, nie pre celú SR. Odráža dojazd a typ zástavby.
- Technické špecifikum lokality: typ fasády, expozícia, znečistenie. Toto je odborný vklad, nie premenná.
- Realistický termín vychádzajúci z dojazdu.
- Prepočet z verejných dát: koľko bytových domov daného typu v okrese je. Verejný údaj, vlastná agregácia.
- Fotografie z daného mesta. Rovnaká fotka na 22 stránkach podkopáva všetko ostatné.
Čo negenerovať: mestá bez realizácie; obce (v SR je ich takmer 3 000); kombinácie „čistenie fasád + {mesto} + {rok}“; stránky typu „X vs. Y“.
Prelinkovanie: hub /cistenie-fasad/ so zoznamom všetkých 22 miest a mapou; z každej stránky odkazy na 4 najbližšie mestá; odkazy z 3 – 4 redakčných článkov; odkaz na kontakt a na prehľad služby.
Výsledok, ktorý má zmysel očakávať: 22 stránok, z nich 18 – 20 zaindexovaných, 10 – 14 s impresiami, 4 – 6 s pravidelnými klikmi. To nie je ohromujúce číslo, ale je to 4 – 6 zdrojov dopytov, ktoré by ste inak nemali, a žiadne riziko. Ako si overiť, či dopyt v regióne vôbec existuje, popisujeme v článku o prieskume trhu.
Programatické SEO a AI vyhľadávanie
Programatické SEO a optimalizácia pre AI odpovede sa stretávajú v jednom bode: oboje odmeňuje konkrétne, štruktúrované, overiteľné dáta.
Dobre urobená generovaná stránka je takmer ideálny vstup pre jazykový model. Má jednu otázku v H1, priamu odpoveď v prvých vetách, čísla v tabuľke a uvedený zdroj s dátumom. To je presne formát, ktorý sa dá odcitovať.
Zle urobená generovaná stránka je pre AI bezcenná z toho istého dôvodu, pre ktorý je bezcenná pre Google. Nie je v nej žiadny fakt, ktorý by sa dal prevziať.
Tri veci, ktoré pri generovaní stojí za to pridať práve kvôli AI:
- Čísla do odpovede, nie len do tabuľky. Model prevezme vetu, nie riadok tabuľky.
- Metodika a dátum pri každom čísle. Posilňuje dôveryhodnosť zdroja.
- Hub stránka s agregáciou celej sady. Práve agregovaný prehľad („ceny čistenia fasád v 22 mestách SR“) je to, čo sa cituje ako zdroj najčastejšie.
Čo rozhoduje o tom, koho AI cituje, ako viditeľnosť v AI testovať promptmi a ako ju merať v čase, rozoberáme v samostatnom článku o GEO optimalizácii.
Časté otázky o programatickom SEO (FAQ)
Čo je programatické SEO?
Tvorba vstupných stránok z dátového zdroja a šablóny namiesto písania jednotlivých textov. Jeden riadok dátovej tabuľky sa stane jednou URL. Unikátnou časťou obsahu sú dáta, nie text okolo nich.
Je programatické SEO proti pravidlám Google?
Samo o sebe nie. Google v pravidlách pre spam zakazuje doorway abuse („sites or pages… created to rank for specific, similar search queries“) a scaled content abuse („many pages… generated for the primary purpose of manipulating search rankings and not helping users“). Rozhoduje teda účel a hodnota stránok, nie spôsob ich vytvorenia.
Kde je presná hranica medzi užitočnou stránkou a doorway page?
Prevádzkový test: odstráňte z dvoch stránok premennú (mesto, model, kategóriu). Ak sú potom identické, ide o doorway pages. Druhý test je Googlova vlastná otázka, či máte „existing or intended audience“, pre ktoré by stránka mala hodnotu aj pri priamom príchode bez vyhľadávača.
Koľko stránok sa dá vygenerovať naraz?
Technicky neobmedzene, prakticky nasadzujte vo vlnách: prvá 20 až 50 URL. Ak sa z prvej vlny do troch týždňov nezaindexuje aspoň 70 % URL, problém je v šablóne alebo dátach a ďalšia vlna ho len rozšíri.
Musím riešiť crawl budget?
Podľa dokumentácie Google sa optimalizácia crawl budgetu týka hlavne „Large sites (1 million+ unique pages)“ s obsahom meniacim sa raz týždenne a „Medium or larger sites (10,000+ unique pages)“ s denne sa meniacim obsahom. Pri 300 nových URL je príčinou neindexovania takmer vždy kvalita.
Ako zistím, že Google generované stránky neberie?
V Search Console v reporte Indexovanie stránok. Rozhodujúci stav je „Prehľadané – zatiaľ nezaindexované“. Google ho popisuje ako „The page was crawled by Google but not indexed“ a dodáva, že opakované odoslanie netreba. Je to hodnotenie kvality, nie technická chyba. Druhý zlý signál sú duplicitné kanonické stavy.
Pomôže, keď obsah vygeneruje AI?
Pomôže s formuláciami, nie s hodnotou. Google uvádza, že ak je automatizácia použitá na generovanie obsahu primárne „for the primary purpose of manipulating search rankings, that’s a violation of our spam policies“, a medzi praktiky scaled content abuse zaraďuje „using generative AI tools… to generate many pages without adding value“. Hodnotu musia doniesť dáta.
Môžem generovať stránky zo scrapnutých dát?
Zo scrapnutých dát ako podkladu áno, ich publikovanie 1 : 1 nie. Google priamo uvádza „scraping feeds, search results, or other content to generate many pages“ ako praktiku scaled content abuse. Pridajte vlastný prepočet, agregáciu alebo interpretáciu. Právnu stránku zberu dát rozoberáme v článku o databáze firiem.
Ako riešiť sitemapu pri stovkách URL?
Jedna sitemapa smie mať podľa Google najviac „50MB (uncompressed) or 50,000 URLs“. Generované URL dajte do samostatnej sitemapy. V Search Console potom vidíte ich indexovanie oddelene od zvyšku webu. lastmod nastavujte z reálneho dátumu aktualizácie dát.
Čo robiť, keď sada neprejde?
Riadky, ktoré sa neindexujú, odstráňte zo sitemapy a nechajte dostupné pre užívateľov; alebo ich zlúčte do menšieho počtu silnejších stránok; zvyšok vráťte ako 410. Na nízkohodnotné URL nepoužívajte noindex s cieľom ušetriť crawl budget. Google upozorňuje: „Don’t use noindex, as Google will still request, but then drop the page.“
Oplatí sa programatické SEO malej firme?
Len vtedy, keď má dáta. Firma s 20 referenciami v 8 mestách má na 8 dobrých stránok. Firma s jednou prevádzkou a bez vlastných dát nemá na žiadnu. Lepšie urobí, keď investuje do 10 kvalitných stránok.
Programatické SEO s Dataswans
Programatické SEO je u nás prienik troch vecí, ktoré robíme: dáta, automatizácia a SEO.
- audit dopytu: či má daná téma opakujúcu sa štruktúru a aký je reálny objem na riadok,
- príprava dátového zdroja: z vlastných dát, verejných registrov alebo riadeného zberu, vrátane prepočtov, ktoré z verejných dát spravia vlastnú analýzu,
- návrh šablóny a kontrola voči pravidlám Google pred publikovaním, nie po ňom,
- generovanie, sitemapy, prelinkovanie a nasadenie vo vlnách,
- meranie distribúcie výkonu v sade a rozhodnutie, čo škálovať a čo zrušiť,
- automatizovaná aktualizácia dát, aby stránky nezostarli.
Chcem posúdiť, či má programatické SEO zmysel pre môj web. Kontaktujte nás
Súvisiace služby: B2B databáza firiem a analytika ako dátový zdroj a AI implementácia a vývoj na generovanie a údržbu.
Súvisiace témy: SEO optimalizácia ako základ, databáza firiem SK a CZ a prieskum trhu ako dátová vrstva, lokálne SEO pre mestské stránky, GEO optimalizácia pre viditeľnosť v AI a tvorba webu na mieru vs. šablóna pre technické riešenie.
Zdroje
- Google Search Central – Spam policies for Google web search (sekcie Doorway abuse, Scaled content abuse, Thin affiliation): https://developers.google.com/search/docs/essentials/spam-policies
- Google Search Central – Creating helpful, reliable, people-first content (sebahodnotiace otázky, automatizácia a AI, rámec Who/How/Why): https://developers.google.com/search/docs/fundamentals/creating-helpful-content
- Google Search Central – Large site owner’s guide to managing your crawl budget (hranice 10 000+ a 1 mil.+ URL, crawl capacity limit vs. crawl demand, odporúčania k
noindex, 404/410, sitemapám): https://developers.google.com/search/docs/crawling-indexing/large-site-managing-crawl-budget - Google Search Central – Build and submit a sitemap (limit 50 000 URL / 50 MB, index sitemapy,
lastmod, len kanonické URL): https://developers.google.com/search/docs/crawling-indexing/sitemaps/build-sitemap - Google Search Central – Consolidate duplicate URLs (kanonizácia, konsolidácia signálov, varovanie pred
robots.txtna kanonizáciu): https://developers.google.com/search/docs/crawling-indexing/consolidate-duplicate-urls - Google Search Central – Keep a simple URL structure (čitateľné slová, spojovníky, obmedzenie parametrov, explózia filtračných kombinácií): https://developers.google.com/search/docs/crawling-indexing/url-structure
- Google Search Console Help – Page Indexing report (stavy „Crawled – currently not indexed“, „Discovered – currently not indexed“, duplicity, soft 404): https://support.google.com/webmasters/answer/7440203
- Google Search Console Help – Performance report (definície impresií, klikov, CTR a priemernej pozície): https://support.google.com/webmasters/answer/7576553
- Google Search Console Help – Manual Actions report (typ „Thin content with little or no added value“, žiadosť o kontrolu): https://support.google.com/webmasters/answer/9044175
Stav k 2. 10. 2026. Citácie z dokumentácie Google sú uvedené v pôvodnom jazyku, aby bolo zrejmé presné znenie. Pravidlá pre spam Google priebežne upravuje, pred väčším projektom si ich overte v aktuálnej verzii.