Kosínusová podobnosť

Kosínusová podobnosť je spôsob, akým sa v vektorovom vyhľadávaní meria, nakoľko si dva texty významovo zodpovedajú. Každý text sa prevedie na číselnú reprezentáciu a porovná sa smer týchto reprezentácií – čím sú si bližšie, tým vyššia je podobnosť. Prakticky to znamená, že systém nehľadá zhodné slová, ale blízky význam, takže odsek o znížení nákladov na energie sa nájde aj na dopyt o úspore za elektrinu. Pre tvorbu obsahu z toho vyplývajú dva závery. Prvý: text sústredený na jednu tému má jasnejšiu reprezentáciu než odsek miešajúci tri témy, ktorý skončí významovo nikde. Druhý: príliš krátke útržky bez kontextu majú nespoľahlivú reprezentáciu, preto má odsek obsahovať celé tvrdenie vrátane pomenovania témy.

Pozri aj: chunking obsahu, hybridné vyhľadávanie, top-k retrieval.