Retrieval pipeline

Retrieval pipeline je celý reťazec krokov, ktorý prebehne medzi tým, ako používateľ položí otázku, a tým, ako sa mu zobrazí odpoveď s odkazmi. Pochopenie tohto reťazca je pre optimalizáciu zásadné, pretože každý krok predstavuje samostatné miesto, kde sa dá vypadnúť – a väčšina obsahu vypadne skôr, než sa vôbec dostane k modelu. Prvým krokom je spracovanie dopytu. Systém otázku nevezme doslovne, ale rozloží ju na čiastkové dopyty, doplní chýbajúci kontext z predchádzajúcej konverzácie a odhadne zámer. Otázka o vhodnom riešení pre malú firmu sa tak rozpadne na dopyty o cenách, o funkciách, o alternatívach a o skúsenostiach používateľov. Už tu vzniká prvá príležitosť: čím viac čiastkových dopytov dokáže váš obsah pokryť, tým viac vstupov do ďalších krokov máte. Druhým krokom je hrubé vyhľadanie kandidátov. Pre každý čiastkový dopyt sa z indexu vytiahne množina dokumentov, spravidla kombináciou vyhľadávania podľa slov a podľa významovej blízkosti. Tu rozhoduje, či je váš obsah vôbec v indexe, či je dostupný robotom a či sa kľúčové informácie načítajú bez spustenia skriptov. Obsah skrytý za interaktívnym prvkom v tomto kroku neexistuje. Tretím krokom je preraďovanie. Z desiatok či stoviek kandidátov sa presnejším modelom vyberú tie pasáže, ktoré na konkrétny čiastkový dopyt odpovedajú najlepšie. Nerozhoduje autorita celého webu, ale zhoda konkrétnej pasáže s konkrétnou otázkou. Práve preto sa v odpovediach objavujú malé weby vedľa veľkých značiek. Štvrtým krokom je zostavenie kontextu. Vybrané pasáže sa vložia do vstupu modelu, pričom ich počet je obmedzený – rádovo jednotky až desiatky. Všetko ostatné sa do odpovede nedostane. Zároveň platí, že model spoľahlivejšie pracuje s informáciou na začiatku a na konci vloženého textu, takže tvrdenie skryté uprostred dlhého odseku má menšiu šancu prejsť. Piatym krokom je generovanie odpovede. Model formuluje text tak, aby sa opieral o vložené pasáže, a priraďuje k tvrdeniam zdroje. Uprednostní pasáže, ktoré tvrdenie potvrdzujú jednoznačne a bez domýšľania – teda konkrétne čísla, definície v jednej vete, jasné podmienky. Vágne marketingové formulácie sa ukotviť nedajú, a preto z odpovede vypadnú, aj keď stránka v klasickom vyhľadávaní ranguje dobre. Šiestym krokom je overenie a zobrazenie. Systém skontroluje súlad tvrdení so zdrojmi, doplní odkazy a odpoveď zobrazí. V tejto fáze sa rozhoduje aj o poradí uvedených značiek, ktoré nie je náhodné a ovplyvňuje ho zhoda s tým, čo tvrdia ostatné zdroje. Praktický záver z celého reťazca je jednoduchý. Optimalizácia pre generatívne vyhľadávanie nie je jedna činnosť, ale odstraňovanie prekážok v šiestich rôznych bodoch: technická dostupnosť pre roboty, existencia pasáží k jednotlivým podotázkam, formulácia odpovede hneď v prvej vete, konkrétnosť údajov, konzistencia s ostatnými zdrojmi a jednoznačná identita firmy. Zanedbanie ktoréhokoľvek z nich znamená, že práca na ostatných je zbytočná. Pri plánovaní práce sa preto oplatí postupovať v poradí, v akom reťazec beží. Najprv sa overí technická dostupnosť, teda či roboty na obsah vôbec dosiahnu a či sa text načíta bez skriptu. Potom sa doplnia chýbajúce odpovede na čiastkové dopyty, ktoré vyjdú z mapovania otázok. Následne sa upravia formulácie tak, aby prvá veta každej sekcie odpovedala priamo a obsahovala konkrétny údaj. Napokon sa zosúladia informácie o firme naprieč externými zdrojmi, aby pri overovaní nevznikali rozpory. Obrátené poradie, teda písanie nového obsahu na weboch, ku ktorým sa roboty nedostanú, je najčastejšia príčina toho, prečo investícia do obsahu neprinesie v generatívnom vyhľadávaní žiadny výsledok. Rovnako sa oplatí sledovať, v ktorom kroku reťazca strácate najviac – to sa dá odhadnúť z toho, či ste v odpovediach úplne neprítomní, spomínaní bez odkazu, alebo citovaní len pri okrajových otázkach.

Pozri aj: query fan-out, reranking, top-k retrieval.