FS-DFM
Gratuit
FS-DFM (Few-Step Discrete Flow-Matching) est un modèle de langage de correspondance de flux discret en quelques étapes publié conjointement par Apple et l'Ohio State University. L'échantillonnage en 8 étapes peut être comparable à la qualité de base en 1 024 étapes, atteignant une accélération jusqu'à 128 fois.
FS-DFM : modèle de génération de texte correspondant à un flux discret en quelques étapes
Paramètres et statistiques de base
| Projet | Détails |
|---|---|
| Nom du produit | FS-DFM (adaptation de flux discret en quelques étapes) |
| Type de produit | Modèle de recherche Open Source/Modèle de langage de diffusion |
| Formulaire de livraison | Code Open Source PyTorch |
| Langues prises en charge | Anglais |
| Organisation de Développement | Recherche Apple ML / Université d'État de l'Ohio |
| Papier inclus | ICLR 2026 |
| Licence Open Source | Personnaliser la licence Apple Open Source |
| Paramètres du modèle | 1.3B (poids pré-entraînés fournis) |
Les informations ci-dessus sont basées sur arXiv:2509.20624 et le référentiel GitHub.
FS-DFM (Few-Step Discrete Flow-Matching) est un modèle de langage de correspondance de flux discret proposé conjointement par Apple et l'Ohio State University. La principale avancée est la suivante : Il suffit de 8 étapes d'échantillonnage pour atteindre le niveau de perplexité de 1 024 étapes du modèle de diffusion discrète traditionnel, ce qui permet d'obtenir une accélération de génération allant jusqu'à 128 fois. Cette réalisation brise le goulot d'étranglement inhérent à « l'échange d'étapes d'itération contre de la qualité » dans le modèle de langage de diffusion et réduit la génération de textes longs de quelques minutes à quelques secondes.
Un bref commentaire en une phrase : Il ne s'agit pas d'un produit de chat destiné aux utilisateurs finaux, mais d'une avancée de recherche importante pour Apple visant à pousser le modèle de diffusion discrète vers une utilisation pratique - cela prouve que "l'échantillonnage en moins d'étapes + la correspondance de flux" peuvent rivaliser avec les modèles autorégressifs en termes de débit sur les tâches de modélisation du langage.
Reconnaissance des utilisateurs et du marché
- Reconnaissance académique : l'article a été inclus dans la plus grande conférence internationale ICLR 2026, et les évaluateurs ont évalué son progrès substantiel dans la direction d'un échantillonnage en quelques étapes de modèles de langage de diffusion discrets.
- Écosystème Open Source : le référentiel GitHub
apple/ml-fs-dfmfournit une implémentation complète de PyTorch, des poids de pré-formation (1,3B), des scripts de formation et d'évaluation, et la communauté peut directement reproduire et développer des secondaires. - Attention des médias : plusieurs médias d'IA (tels que des vidéos d'interprétation technologique associées ont été visionnés par dizaines de milliers).
- Influence technique : La combinaison des "étapes d'échantillonnage comme formation de paramètres explicites + distillation de l'enseignant + solveur discret personnalisé" proposée par FS-DFM fournit une nouvelle base pour la recherche ultérieure sur des modèles de diffusion discrète.
Avantage de coût
| Dimension du coût | Descriptif |
|---|---|
| Poids du modèle | Gratuit et open source, fournissant 1,3 milliard de téléchargements de points de contrôle pré-formation |
| Codes | Licence entièrement open source, de type MIT |
| Coût de la formation | Ressources GPU requises (CUDA 11.0+), le coût de la formation dépend de la configuration matérielle |
| Coût d'inférence | 8 étapes d'échantillonnage peuvent atteindre une qualité élevée, réduisant la consommation d'énergie de calcul d'inférence de 128 fois par rapport à la ligne de base en mille étapes |
Le principal coût de FS-DFM est de réduire la surcharge d'inférence de O (mille étapes) à O (8 étapes), ce qui a une importance directe pour l'optimisation de la latence et du débit dans les scénarios de déploiement. Pour les chercheurs, le code source et les pondérations entièrement ouverts éliminent le coût d’une mise en œuvre répétée ; pour les équipes d'ingénierie, les caractéristiques de l'échantillonnage en quelques étapes facilitent l'intégration dans les pipelines de génération de texte en temps réel.
Il convient de noter que la formation d’un ensemble de modèles FS-DFM nécessite toujours la prise en charge d’un cluster GPU à grande échelle. Le poids de 1,3 milliard fourni par l'open source peut répondre à la plupart des besoins expérimentaux et de réglage fin.
Fonctions principales
- Correspondance de flux discrets en quelques étapes : utilisez le nombre d'étapes d'échantillonnage comme paramètre explicite pour entraîner le modèle, afin qu'il puisse être généré de manière stable sous différents budgets d'étapes. Huit étapes d'échantillonnage peuvent atteindre le niveau de perplexité de l'appariement de flux discret traditionnel en 1 024 étapes.
- solveur discret personnalisé : fournit
mixture_euler,mixture_euler_with_cumulative_scalaret d'autres solveurs discrets, prenant en charge deux distributions sources deuniformetmask. - Cadre de distillation de l'enseignant : en distillant les connaissances d'un modèle d'enseignant à longue trajectoire vers un modèle d'élève en quelques étapes, il améliore la qualité de l'échantillonnage en quelques étapes et évite le dépassement de probabilité ou l'instabilité du gradient.
- Chaîne d'outils open source complète : comprenant trois modules majeurs : pré-formation, formation et évaluation. Fournit un point de contrôle de pré-entraînement des paramètres 1,3B et prend en charge la perplexité et l'évaluation ELBO.
- Prise en charge de l'architecture Transformer : Basé sur l'architecture standard de Transformer, il prend en charge la taille du vocabulaire configurable, la régularisation des abandons et la formation distribuée.
[Vue d'expert] : Le véritable point fort de FS-DFM n'est pas la simple amélioration de la vitesse, mais sa conception de « généralisation par étapes » : une fois le modèle entraîné avec une cohérence par étapes, le même poids peut être commuté de manière flexible selon différentes exigences de délai/qualité. Cela signifie que les équipes d'ingénierie peuvent ajuster dynamiquement le nombre d'étapes d'échantillonnage au moment du déploiement en fonction des capacités matérielles et de la charge en temps réel, plutôt que de conserver des modèles indépendants pour chaque scénario. Cette élasticité est extrêmement précieuse dans les déploiements de servitisation LLM.
Evolution du modèle et de la version
| Version | Dates | Événement |
|---|---|---|
| arXiv première version | 2025-09-24 | L'article a été publié pour la première fois sur arXiv:2509.20624 |
| GitHub Open Source | 2025-09-24 | L'entrepôt apple/ml-fs-dfm est rendu public simultanément, y compris le code complet et le poids |
| Accepté par ICLR 2026 | 2026-01 | L'article a été accepté par l'ICLR 2026 (la date précise est soumise au calendrier de la conférence) |
| Libération de poids | 2026-02 | Fournir le téléchargement des points de contrôle de pré-formation FS-DFM et DFM 1,3B |
Le projet n'a pas fait l'objet d'itérations de versions commerciales et toutes les versions sont des versions open source orientées vers la recherche.
Avantages techniques
-
Formation cohérente par étapes : en utilisant le nombre d'étapes d'échantillonnage comme paramètre d'entrée explicite, le modèle partage le même ensemble de poids sous différents budgets d'étape, éliminant ainsi le besoin de configurer une formation distincte pour chaque étape. En termes d'ingénierie, cela signifie qu'une session de formation peut couvrir tout le spectre des scénarios d'inférence, depuis l'extrêmement rapide (2 à 4 étapes) jusqu'à la haute qualité (64 à 128 étapes).
-
Règle de mise à jour fiable : le solveur discret de FS-DFM contrôle la direction du transfert de probabilité à travers la barrière énergétique (barrière énergétique) et coopère avec la normalisation par morceaux DT pour garantir que chaque étape déplace la masse de probabilité dans la « bonne direction » sans dépassement. Comparé au problème courant de dérive de probabilité dans la diffusion discrète traditionnelle, ce mécanisme améliore considérablement la stabilité de la génération dans des scénarios en quelques étapes.
-
Distillation enseignant-élève : distillez les connaissances de la trajectoire de l'enseignant RK4 vers le modèle de l'élève, afin que le modèle de l'élève puisse toujours maintenir un résultat de haute qualité en un très petit nombre d'étapes. Le modèle distillé en 8 étapes est comparable au modèle enseignant en 1024 étapes en termes de perplexité, réduisant la latence d'inférence de deux ordres de grandeur.
-
Sélection flexible du solveur : prend en charge deux stratégies de distribution de sources,
uniformetmask, ainsi que plusieurs solveurs ODE tels quemixture_euleretmixture_euler_with_cumulative_scalar. Les chercheurs peuvent librement les combiner selon différentes caractéristiques des données.
Comment utiliser
FS-DFM est fourni en tant que projet PyTorch open source et n'est pas un service SaaS. Avant utilisation, vous devez préparer l'environnement Python 3.8+ et CUDA 11.0+.
Installation
# Cloner le dépôt
clone git https://github.com/apple/ml-fs-dfm.git
cd ml-fs-dfm
#Créer un contexte conda
conda env créer -f fsdfm_environment.yml
conda active FSDFM
# Installer le mode développement
pip install -e .
Évaluation du modèle
# Téléchargez des poids pré-entraînés et exécutez l'évaluation
python fs_dfm/run_eval.py \
--work_dir "/chemin/vers/sortie" \
--ngpus 1 \
--perplexity_n_samples 320 \
--eval_elbo\
--eval_perplexité \
--pre_trained_model_path "/chemin/vers/checkpoint.pth"
Formation du modèle
python fs_dfm/run_train.py \
data.cache_dir=${CACHE_DIR:-./cache_dir}
Les paramètres de configuration clés se trouvent dans fs_dfm/configs/config.yaml, notamment sampling_steps (nombre d'étapes d'échantillonnage), source_distribution (type de distribution source), temperature (température d'échantillonnage), etc.
Processus d'utilisation typique
Cloner le référentiel → Configurer l'environnement → Télécharger les poids pré-entraînés → Exécuter le script d'évaluation/formation → Analyser les résultats de sortie. Pour des instructions complètes, veuillez vous référer au fichier README du référentiel GitHub.
Prix des produits
FS-DFM est un projet de recherche purement open source et n'implique pas de tarification commerciale :
| Projet | Coût |
|---|---|
| Code source | Gratuit (dépôt public GitHub) |
| Poids pré-entraînés (1,3B) | Téléchargement gratuit |
| Accès papier | Gratuit (accès ouvert arXiv) |
| Licence commerciale | Soumis aux termes du dossier LICENSE de l'entrepôt |
| Raisonnement cloud | Aucun service d'hébergement officiel, vous devez déployer vous-même |
Les chercheurs universitaires et industriels peuvent obtenir tous les codes et poids sans frais, mais les ressources matérielles GPU nécessaires à la formation ou à l'inférence sont à la charge de l'utilisateur.
Scénarios d'application
- Recherche sur le modèle de langage de diffusion : comme base d'échantillonnage en quelques étapes pour l'appariement de flux discrets, utilisée pour des expériences comparatives, des études d'ablation et le développement de nouveaux solveurs.
- Génération efficace de texte long : convient aux scénarios qui nécessitent la génération parallèle de séquences longues (telles que 1 024 jetons) mais qui sont sensibles à la latence, comme la génération de résumés, la sortie structurée et la complétion de code.
- Service d'inférence de texte à faible latence : l'échantillonnage en 8 étapes compresse le délai d'inférence de plusieurs dizaines de secondes au niveau des milliers d'étapes au deuxième niveau, ce qui convient aux backends de services en ligne ayant des exigences élevées en temps réel.
- Réglage précis de petits échantillons et adaptation de domaine : basé sur des poids de pré-entraînement de 1,3 B, il peut rapidement s'adapter à des domaines spécifiques (tels que les documents juridiques, les textes médicaux) grâce à un réglage fin des tâches en aval.
Personnes concernées
- Chercheur en IA (direction PNL/modèle génératif) : FS-DFM fournit une base de référence complète pour l'échantillonnage en quelques étapes de correspondance de flux discrets et convient comme méthode de mise en œuvre et de comparaison de référence pour la recherche de modèles de langage de diffusion.
- Ingénieur Deep Learning : Intéressé par la génération de texte accélérée avec un échantillonnage en quelques étapes et a besoin d'une solution open source reproductible pour l'évaluation et l'intégration.
- Équipe d'optimisation de l'inférence de grands modèles : une équipe d'ingénieurs confrontée au goulot d'étranglement du débit de l'inférence de modèle autorégressif et qui explore des alternatives non autorégressives.
- Étudiants universitaires et établissements universitaires : des projets de cours, des projets de fin d'études ou des explorations académiques peuvent être réalisés sur la base de code open source et de poids pré-entraînés.
[Ne convient pas aux limites] :
- Pas pour les consommateurs finaux (pas d'interface utilisateur Web, pas d'application, pas de service SaaS).
- Ne convient pas aux scénarios nécessitant un dialogue interactif de type ChatGPT (FS-DFM est un modèle génératif plutôt qu'un modèle de dialogue).
- Ne convient pas aux utilisateurs de code zéro/low-code, nécessite des fonctionnalités de PyTorch et de ligne de commande.
- La génération directe du chinois n'est pas prise en charge (les données de pré-formation sont principalement en anglais et la génération du chinois nécessite des réglages supplémentaires).
Résumé et Outlook
FS-DFM constitue une avancée substantielle d'Apple dans le domaine des modèles de langage à diffusion discrète. Grâce à la triple combinaison de formation à la cohérence des étapes + règles de mise à jour fiables + distillation de l'enseignant, les étapes d'échantillonnage du modèle de langage de diffusion sont compressées de milliers d'étapes à un chiffre, tout en maintenant la qualité sans dégradation. Génération de 1 024 jetons en 8 étapes et accélération de 128 fois dans la perplexité, ce qui correspond à la ligne de base en mille étapes - ces chiffres rendent possible pour la première fois la génération de texte non autorégressive dans la dimension d'efficacité pour rivaliser avec les modèles autorégressifs.
D'un point de vue industriel, l'importance de FS-DFM est bien plus qu'un simple article de conférence : il montre que la voie technique de la « correspondance de flux discrets » dépasse de loin la diffusion discrète traditionnelle en termes de potentiel d'échantillonnage à pas courts, offrant ainsi une nouvelle direction paradigmatique pour une génération de texte efficace à l'avenir. Si cette voie peut être vérifiée en continu sur des échelles de modèle plus grandes (> 10B) et sur des tâches plus complexes, elle devrait changer le modèle de sélection d'architecture dans le domaine de la génération de textes longs.
[Évaluation des risques d'approvisionnement/d'adoption] :
- FS-DFM est un pur projet de recherche sans SLA commercial ni support technique. Le déploiement en production nécessite que l’équipe supporte les coûts d’ingénierie.
- L'échelle du modèle 1.3B est relativement petite dans le grand écosystème de modèles actuel, et il ne peut pas rivaliser avec les modèles commerciaux tels que GPT et Claude en termes de capacités complexes de raisonnement et de suivi d'instructions.
- Les termes de la licence open source doivent être soigneusement examinés pour confirmer leur conformité dans les scénarios commerciaux.
- Le rythme de maintenance du projet est soumis à l'équipe de recherche, et les mises à jour ou réponses aux problèmes à long terme ne sont pas garanties.
- Il est recommandé de le positionner comme un « composant améliorant l'efficacité pour des scénarios spécifiques » plutôt que comme une base générale de génération de texte, et de donner la priorité à l'évaluation dans les tâches sensibles aux délais, comportant de longues séquences et ayant des exigences de qualité contrôlables.
Outils associés : hugging-face, replicate
Informations de version
- Version ICLR 2026 :La version finale du document arXiv:2509.20624, qui contient l'architecture complète du modèle et le code de formation de FS-DFM, a été incluse dans l'ICLR 2026.
- engagement initial :L'article a été publié pour la première fois sur arXiv et le code open source a été rendu public simultanément.
Avis des utilisateurs