Text-to-video je kategória AI modelov generujúcich video sekvencie priamo z textového zadania, vrátane pohybu, kompozície scény a v niektorých prípadoch aj zvuku. Predstaviteľmi tejto kategórie sú Sora, Runway alebo Google Veo, ktoré umožňujú rýchle prototypovanie video obsahu bez potreby kamery, hercov či drahej produkcie.