ACE-Étape 1.5 Gratuit

-

ACE-Step 1.5 est un modèle de base musical open source lancé conjointement par ACE Studio et StepFun. Il se concentre sur le déploiement local, la génération à haut débit et le chant de paroles multilingues. Il prend en charge les chansons générées par texte, les reprises, les redessins, la séparation des pistes audio et d'autres capacités d'édition, et peut être exécuté avec 4 Go de mémoire vidéo.

ACE-Étape 1.5 Interface du produit

Revue complète de #ACE-Step 1.5

Paramètres et statistiques de base

Projet Spécifications
Positionnement du produit Modèle de base de musique open source
Développeur ACE Studio + StepFun
Architecture LM (Planification de chansons) + DiT (Rendu acoustique) Mix
Vitesse de génération A100 ≈ 2 secondes/chanson, RTX 3090 ≈ 10 secondes/chanson
Mémoire vidéo minimale 4 Go (certaines configurations)
Plateformes prises en charge CUDA, Apple Silicon, ROCm, Intel XPU
Licence Open Source MIT
Langage des paroles Plus de 50 langues

ACE-Step 1.5 est probablement le modèle de génération de musique open source le plus convivial actuellement disponible. Le seuil de 4 Go de mémoire vidéo signifie que les cartes graphiques grand public des cinq dernières années peuvent fonctionner, ce qui constitue une bouffée d'air frais dans le domaine de la génération musicale qui nécessite souvent un A100.

Reconnaissance des utilisateurs et du marché

ACE-Step 1.5 gagne rapidement du terrain dans la communauté de génération de musique open source. Par rapport aux produits fermés tels que Suno, ses différences sont : ① Licence MIT, gratuite pour un usage commercial et un développement secondaire ; ② Prise en charge du déploiement local, les données ne quittent pas l'appareil ; ③ Fournir un pipeline d'édition complet (générer → reprendre → redessiner → diviser les pistes), qui n'est pas aussi simple que « générer une chanson ». Par rapport à SongGeneration, les avantages exceptionnels d'ACE-Step sont la vitesse d'inférence inférieure et les besoins en mémoire graphique réduits.

Vérification de la publicité : "4 à 8 étapes d'inférence distillée, A100 génère la chanson entière en 2 secondes environ" - Cette vitesse est réalisable avec des clips courts (10 à 30 secondes), mais le temps d'inférence augmente considérablement lors de la génération d'une chanson complète de 3 à 5 minutes. L'inférence par distillation a des effets d'accélération évidents tout en conservant la qualité sonore, mais la qualité sonore peut souffrir d'une perte de détails à un nombre de pas extrêmement faible.

Avantage de coût

Dimensions Descriptif
Code Gratuit sous licence MIT
Poids du modèle Téléchargement public
Démo en ligne Essai gratuit
Auto-déploiement Les RTX 3090/4090 peuvent fonctionner sans problème

VÉRITÉ GRATUITE : licence MIT, code et poids de modèle téléchargeables gratuitement. Le coût le plus bas du matériel auto-déployé se reflète dans la carte graphique existante - si vous disposez d'un modèle RTX 3090 ou supérieur, le coût supplémentaire est presque nul ; si vous devez acheter du nouveau matériel, un RTX 4060 (mémoire vidéo de 4 Go) pour environ 2 000 à 3 000 yuans peut répondre aux exigences minimales. Pour les utilisateurs qui souhaitent simplement l’essayer, la démo en ligne est l’option la moins coûteuse.

Fonctions principales

  • Chanson générée par texte : saisissez les paroles et la description du style, et l'IA générera une chanson complète. Toute durée comprise entre 10 secondes et 10 minutes est prise en charge.
  • Plus de 50 paroles et chants en langues : prend en charge les langues traditionnelles telles que le chinois, l'anglais, le japonais et le coréen, ainsi que plusieurs langues mineures. Il s'agit d'une fonctionnalité différenciante essentielle pour les créateurs qui ont besoin de contenu musical multilingue (par exemple, les bandes sonores de jeux qui nécessitent des versions chantées dans différentes langues).
  • Couvrir et redessiner : saisissez un morceau d'audio et l'IA le réinterprétera avec un style ou une voix différente. Convient pour adapter des chansons existantes.
  • Séparation et complétion des pistes : séparez les chansons en pistes vocales et d'accompagnement, ou en segments complets. De la « génération d'une chanson » à « l'édition d'une chanson », il couvre davantage d'aspects de la production musicale.
  • Formation personnalisée LoRA : Entraînez-vous au style personnel LoRA avec un petit nombre de chansons. Pour les créateurs au style fixe, la cohérence après ajustement sera bien meilleure qu’un modèle général.

Evolution du modèle et de la version

Scène Temps Changements clés Importance actuelle
ACE-Étape 1.0 ~2026-03 Établir un lien principal texte-chanson pour former des capacités de génération acoustique de base Prouver que le modèle musical open source peut générer des chansons complètes
ACE-Étape 1.5 ~2026-06 Étendu à plus de 50 paroles, couvertures, redessins, séparations de pistes et formation LoRA Mise à niveau de « peut générer » à « peut modifier et personnaliser »

Le chemin de versionnage d'ACE-Step est très clair : terminez d'abord le processus de génération de chansons à partir du texte, puis complétez les sections d'édition que les créateurs utiliseront réellement. La version 1.0 ressemble davantage à une base de référence open source, tandis que la version 1.5 commence à se rapprocher d'un flux de travail musical complet, en particulier les capacités de couverture, de redessinage et de division de piste, faisant passer le modèle d'un générateur unique à un outil de production pouvant être modifié à plusieurs reprises.

Le positionnement de la version actuelle n'est pas de rivaliser avec les plates-formes à source fermée pour la meilleure qualité sonore du produit fini, mais d'utiliser des seuils matériels plus bas et des licences plus souples pour faire du « modèle de base musical exécutable localement » un choix réalisable en ingénierie. Pour les chercheurs et les développeurs, la 1.5 constitue déjà une étape plus complète qu'une pure démo.

Avantages techniques

Points techniques Mécanisme d'action Effets réels
Architecture hybride LM + DiT Planifiez d'abord la structure de la chanson, puis restituez les détails acoustiques Un sentiment de contrôle plus stable sur la mélodie, le rythme et le timbre
Inférence distillée Échantillonnage complet en moins d'étapes Réduit considérablement le temps d'attente lors d'un déploiement local
Modélisation de paroles multilingues Lier la compréhension des paroles et la génération du chant Rendre les chansons multilingues et le contenu localisé plus fluides
Formation personnalisée LoRA Utiliser un petit nombre d'échantillons pour injecter des préférences de style Plus adapté à la réutilisation par les créateurs avec des styles fixes

L'avantage d'ACE-Step 1.5 n'est pas seulement qu'il est « open source », mais qu'il combine vitesse, seuil de mémoire et capacités d'édition. De nombreux modèles open source similaires peuvent produire des sons, mais il est difficile de prendre en compte à la fois la vitesse de génération, la post-édition et la licence commerciale ; la différenciation d'ACE-Step 1.5 est de regrouper ces détails dans une base créative relativement complète.

Vérification de la publicité : Le responsable souligne que 4 Go de mémoire vidéo peuvent être exécutés et que 4 à 8 étapes d'accélération de la distillation sont essentiellement établies. Cet argument de vente est fondamentalement vrai pour le "running", mais il existe une condition supplémentaire pour "une sortie stable de chansons entières de haute qualité". Les extraits de code à court terme, la génération de brouillons et l'édition partielle sont plus proches de sa zone de confort ; si vous recherchez des produits finis haute fidélité à long terme, le matériel, le temps d'inférence et les coûts de post-traitement continueront d'augmenter.

Comment utiliser

Entrée Exigences minimales Comment démarrer
Démo en ligne Accessible par navigateur Entrez directement les paroles et la description du style, vérifiez d'abord le timbre et la direction du rythme
Inférence locale 4 Go+ de mémoire vidéo, CUDA ou Apple Silicon sont recommandés Après avoir téléchargé les poids, configurez le contexte en fonction de l'entrepôt officiel et exécutez le script d'inférence de base
Formation personnalisée Mémoire vidéo supplémentaire et un petit nombre d'échantillons d'entraînement Renforcez votre style personnel ou le ton de votre marque grâce au réglage fin de LoRA

Le moyen le plus rapide de commencer consiste à utiliser d’abord la démo en ligne pour confirmer la structure des mots d’invite, puis à décider si vous souhaitez la déployer localement. Pour la plupart des équipes, il est plus rentable de tester d'abord « si la description du style des paroles peut être stabilisée pour produire un brouillon utilisable » plutôt que de manipuler la carte graphique dès le début.

Lorsqu'elles sont utilisées localement, les adresses de configuration minimales « peuvent s'exécuter » et non « haut débit ». Si vous souhaitez générer, reprendre et suivre de longues chansons en même temps, l'appareil 3090/4090 sera évidemment plus pratique. Pour les entreprises ou les studios, il est recommandé de le mettre dans le processus « génération de brouillon + raffinement manuel », plutôt que de remplacer directement le lien de production complet.

Prix des produits

Le modèle de tarification est soumis à la page officielle en temps réel. Habituellement, un système freemium ou d'abonnement est utilisé et les fonctions de base peuvent être utilisées gratuitement. Les fonctions avancées ou l'utilisation à haute fréquence nécessitent des abonnements payants, et il est conseillé aux utilisateurs d'évaluer la solution optimale en fonction de l'utilisation réelle.

Scénarios d'application

  • Génération rapide de bande sonore : générez une musique de fond personnalisée pour les vidéos, les podcasts et les jeux. Entrez « Style chinois, mélodieux 2 minutes » et obtenez un brouillon de bande sonore utilisable dans les 30 secondes.
  • Reprise et adaptation : Reprenez une chanson dans différents styles - changez une chanson pop en version jazz ou traduisez une chanson anglaise en version chinoise. Convient aux créateurs de contenu pour effectuer une création secondaire.
  • Enseignement et expérimentation musicale : utilisez l'IA pour générer différents styles de passages musicaux comme exemples pédagogiques, ou mener des expériences acoustiques.

Scénario de dissuasion : si vous avez besoin d'une qualité de mixage professionnelle au niveau de l'édition, les chansons générées par l'IA sont toujours inférieures aux studios d'enregistrement professionnels en termes de superposition de qualité sonore et de détails de mixage. ACE-Step convient aux étapes de brouillon et de démonstration, pas à la version finale.

Personnes concernées

  • Musiciens indépendants : vérifiez rapidement les mélodies et la direction des arrangements pendant le processus de création, la licence MIT autorise une utilisation commerciale. Il n'y a pas lieu de s'inquiéter des litiges en matière de droits d'auteur ou des problèmes de partage de plateforme.
  • Content Creator : générez rapidement des bandes sonores et de la musique de fond pour les vidéos et les podcasts afin de réduire les risques de droits d'auteur. Par rapport à l’achat de licences commerciales sur les plateformes musicales, le coût de l’auto-génération est bien inférieur.
  • Audio AI Developer : créez des applications de génération de musique basées sur ACE-Step, avec moins de restrictions sous la licence MIT. Il est nécessaire de veiller à savoir si la qualité sonore des résultats du modèle peut répondre aux attentes des utilisateurs et si le coût d'inférence est économique après la mise à l'échelle.
  • Game Audio Team : générez une musique de fond personnalisée et des chansons thématiques pour le jeu. La licence MIT peut être intégrée dans des produits commerciaux, mais la qualité sonore et la cohérence des effets sonores nécessitent un traitement supplémentaire.

Limites actuelles : ACE-Step 1.5 a une prise en charge limitée pour certaines langues mineures en termes de précision de prononciation des paroles. Les paroles dans les langues à alphabet non latin (comme le chinois et le japonais) présentent parfois des écarts de prononciation, qui nécessitent une correction manuelle ou un post-enregistrement.

Résumé et Outlook

Elle propose des solutions compétitives dans son domaine et sa valeur fondamentale réside dans l’abaissement du seuil d’utilisation de l’IA dans ce domaine.

Limites actuelles : Certaines fonctionnalités avancées nécessitent un abonnement payant et la version gratuite comporte des restrictions de fonction ou d'utilisation ; les détails techniques spécifiques et les critères de performance n’ont pas encore été entièrement divulgués.

Outils associés : elevenlabs, udio

Informations de version

  • ACE-Étape 1.5 :Prend en charge la génération de texte de paroles de chansons dans plus de 50 langues, la repeinture de couverture, la séparation des pistes audio et la formation personnalisée LoRA.
  • ACE-Étape 1.0 :Modèle de génération de musique de base, prenant en charge la conversion texte en chanson.

Avis des utilisateurs

  • Chargement des avis...