Multimodálna AI označuje model schopný súčasne spracúvať a generovať viacero typov dát – text, obrázky, zvuk či video – v rámci jednej odpovede alebo jednej úlohy. Umožňuje napríklad opísať obsah nahraného obrázka slovami, odpovedať na otázku o videu alebo naopak z textového zadania vygenerovať obrazový či zvukový výstup, čo výrazne rozširuje spôsoby, akými môžu ľudia s AI komunikovať.