"تحويل النص إلى فيديو" هي فئة من نماذج الذكاء الاصطناعي التي تولد مقاطع فيديو مباشرةً من مدخلات نصية، بما في ذلك الحركة وتركيب المشهد، وفي بعض الحالات الصوت أيضًا. ومن أبرز نماذج هذه الفئة «سورا» (Sora) و«رنواي» (Runway) و«جوجل فيو» (Google Veo)، التي تتيح إنشاء نماذج أولية سريعة لمحتوى الفيديو دون الحاجة إلى كاميرا أو ممثلين أو إنتاج باهظ التكلفة.