Meta lance Muse Image et Muse Video : Compléter la matrice multimodale « compréhension + génération »
Meta a publié Muse Image et Muse Video le 7 juillet, de nouveaux modèles de la série Muse pour la génération d'images et de vidéos respectivement. Avec Muse Spark (compréhension/raisonnement multimodal), ils forment une matrice multimodale « compréhension + génération », poursuivant la stratégie double « open source + avant-gardiste ».
Le 7 juillet, Meta a publié deux nouveaux modèles : Muse Image et Muse Video, respectivement pour la génération d'images et de vidéos. L'importance de ces deux modèles ne peut être clairement vue que dans la disposition multimodale de Meta - ils ne constituent pas « un autre modèle génératif » isolément, mais comblent le vide du côté « génératif » de la série Muse, rendant la matrice multimodale de Meta complète pour la première fois.
Une matrice complète de "compréhension + génération"
En rassemblant la série Muse, la logique de mise en page de Meta est très claire :
| Modèle | Orientation | Caractère |
|---|
Avis