الذكاء الاصطناعي متعدد الوسائط

يشير مصطلح «الذكاء الاصطناعي متعدد الوسائط» إلى نموذج قادر على معالجة وتوليد عدة أنواع من البيانات في آن واحد — النصوص، والصور، والصوت، والفيديو — في إطار إجابة واحدة أو مهمة واحدة. فهي تتيح، على سبيل المثال، وصف محتوى صورة تم تحميلها بالكلمات، أو الإجابة على سؤال حول مقطع فيديو، أو العكس، أي إنتاج مخرجات مرئية أو صوتية بناءً على مهمة نصية، مما يوسع بشكل كبير من الطرق التي يمكن للناس من خلالها التواصل مع الذكاء الاصطناعي.