एफएस-डीएफएम मुफ्त

-

एफएस-डीएफएम (फ्यू-स्टेप डिस्क्रीट फ्लो-मैचिंग) एप्पल और ओहियो स्टेट यूनिवर्सिटी द्वारा संयुक्त रूप से जारी किया गया कुछ-स्टेप डिस्क्रीट फ्लो मैचिंग भाषा मॉडल है। 8-चरणीय नमूनाकरण की तुलना 1024-चरणीय आधारभूत गुणवत्ता से की जा सकती है, जो 128 गुना तक त्वरण प्राप्त करता है।

एफएस-डीएफएम उत्पाद इंटरफेस

एफएस-डीएफएम: कुछ-चरणीय पृथक प्रवाह मिलान पाठ पीढ़ी मॉडल

मुख्य पैरामीटर और आँकड़े

प्रोजेक्ट विवरण
उत्पाद का नाम एफएस-डीएफएम (कुछ-चरणीय पृथक प्रवाह-मिलान)
उत्पाद प्रकार ओपन सोर्स रिसर्च मॉडल/डिफ्यूजन लैंग्वेज मॉडल
डिलिवरी फॉर्म PyTorch ओपन सोर्स कोड
समर्थित भाषाएँ अंग्रेजी
विकास संगठन एप्पल एमएल रिसर्च / ओहियो स्टेट यूनिवर्सिटी
पेपर शामिल आईसीएलआर 2026
ओपन सोर्स लाइसेंस Apple ओपन सोर्स लाइसेंस को अनुकूलित करें
मॉडल पैरामीटर 1.3बी (पूर्व-प्रशिक्षित वजन प्रदान किया गया)

उपरोक्त जानकारी arXiv:2509.20624 और GitHub रिपॉजिटरी पर आधारित है।

एफएस-डीएफएम (फ्यू-स्टेप डिस्क्रीट फ्लो-मैचिंग) एप्पल और ओहियो स्टेट यूनिवर्सिटी द्वारा संयुक्त रूप से प्रस्तावित एक अलग प्रवाह मिलान भाषा मॉडल है। मुख्य सफलता यह है कि: पारंपरिक असतत प्रसार मॉडल के 1024-चरणीय गड़बड़ी स्तर तक पहुंचने के लिए नमूनाकरण के केवल 8 चरण लगते हैं, जिससे 128 गुना तक की पीढ़ी त्वरण प्राप्त होता है। यह उपलब्धि प्रसार भाषा मॉडल में "गुणवत्ता के लिए पुनरावृत्ति चरणों का आदान-प्रदान" की अंतर्निहित बाधा को तोड़ती है, और लंबी पाठ पीढ़ी को मिनटों से सेकंड तक संपीड़ित करती है।

एक वाक्य में एक संक्षिप्त टिप्पणी: यह अंतिम उपयोगकर्ताओं के लिए एक चैट उत्पाद नहीं है, बल्कि असतत प्रसार मॉडल को व्यावहारिक उपयोग में लाने के लिए ऐप्पल के लिए एक महत्वपूर्ण शोध सफलता है - यह साबित करता है कि "कम-चरण नमूनाकरण + प्रवाह मिलान" भाषा मॉडलिंग कार्यों पर थ्रूपुट के लिए ऑटोरेग्रेसिव मॉडल के साथ प्रतिस्पर्धा कर सकता है।

उपयोगकर्ता और बाज़ार की पहचान

  • अकादमिक मान्यता: पेपर को शीर्ष अंतरराष्ट्रीय सम्मेलन आईसीएलआर 2026 में शामिल किया गया है, और समीक्षकों ने असतत प्रसार भाषा मॉडल के कुछ-चरणीय नमूने की दिशा में इसकी पर्याप्त प्रगति का मूल्यांकन किया है।
  • ओपन सोर्स इकोसिस्टम: GitHub रिपोजिटरी apple/ml-fs-dfm पूर्ण PyTorch कार्यान्वयन, पूर्व-प्रशिक्षण भार (1.3B), प्रशिक्षण और मूल्यांकन स्क्रिप्ट प्रदान करता है, और समुदाय सीधे पुनरुत्पादन और माध्यमिक विकास कर सकता है।
  • मीडिया का ध्यान: एकाधिक एआई मीडिया (जैसे संबंधित प्रौद्योगिकी व्याख्या वीडियो हजारों की संख्या में देखे गए हैं)।
  • तकनीकी प्रभाव: एफएस-डीएफएम द्वारा प्रस्तावित "स्पष्ट पैरामीटर प्रशिक्षण + शिक्षक आसवन + कस्टम असतत सॉल्वर के रूप में नमूनाकरण चरण" का संयोजन बाद के असतत प्रसार मॉडल अनुसंधान के लिए एक नई आधार रेखा प्रदान करता है।

लागत लाभ

लागत आयाम विवरण
मॉडल वजन मुफ़्त और खुला स्रोत, 1.3बी प्री-ट्रेनिंग चेकपॉइंट डाउनलोड प्रदान करता है
कोड पूरी तरह से खुला स्रोत, एमआईटी जैसा लाइसेंस
प्रशिक्षण लागत आवश्यक GPU संसाधन (CUDA 11.0+), प्रशिक्षण लागत हार्डवेयर कॉन्फ़िगरेशन पर निर्भर करती है
अनुमान लागत नमूनाकरण के 8 चरण उच्च गुणवत्ता प्राप्त कर सकते हैं, हजार-चरण बेसलाइन की तुलना में अनुमान कंप्यूटिंग बिजली की खपत को 128 गुना कम कर सकते हैं

एफएस-डीएफएम का मुख्य लागत मूल्य अनुमान ओवरहेड को ओ (हजार कदम) से घटाकर ओ (8 कदम) करना है, जिसका परिनियोजन परिदृश्यों में विलंबता और थ्रूपुट अनुकूलन के लिए प्रत्यक्ष महत्व है। शोधकर्ताओं के लिए, पूरी तरह से खुला स्रोत कोड और वज़न बार-बार कार्यान्वयन की लागत को खत्म कर देता है; इंजीनियरिंग टीमों के लिए, कुछ-चरणीय नमूने की विशेषताएं वास्तविक समय पाठ पीढ़ी पाइपलाइनों में एकीकृत करना आसान बनाती हैं।

यह ध्यान दिया जाना चाहिए कि एफएस-डीएफएम मॉडल के एक सेट को प्रशिक्षित करने के लिए अभी भी बड़े पैमाने पर जीपीयू क्लस्टर के समर्थन की आवश्यकता होती है। ओपन सोर्स द्वारा प्रदान किया गया 1.3B वजन अधिकांश प्रयोगात्मक और फाइन-ट्यूनिंग आवश्यकताओं को पूरा कर सकता है।

मुख्य कार्य

  • कुछ-चरणीय पृथक प्रवाह मिलान: मॉडल को प्रशिक्षित करने के लिए एक स्पष्ट पैरामीटर के रूप में नमूना चरणों की संख्या का उपयोग करें, ताकि इसे विभिन्न चरण बजट के तहत स्थिर रूप से उत्पन्न किया जा सके। आठ नमूना चरण पारंपरिक 1024-चरण असतत प्रवाह मिलान के उलझन स्तर तक पहुंच सकते हैं।
  • कस्टम असतत सॉल्वर: 'मिक्सचर_यूलर', 'मिक्सचर_यूलर_विथ_क्यूमुलेटिव_स्केलर' और अन्य असतत सॉल्वर प्रदान करता है, जो 'यूनिफ़ॉर्म' और 'मास्क' के दो स्रोत वितरण का समर्थन करता है।
  • शिक्षक आसवन ढांचा: एक लंबे-प्रक्षेपवक्र शिक्षक मॉडल से कुछ-चरणीय छात्र मॉडल तक ज्ञान को आसवित करके, यह कुछ-चरणीय नमूने की गुणवत्ता में सुधार करता है और संभावना ओवरशूट या ग्रेडिएंट अस्थिरता से बचाता है।
  • पूर्ण-प्रक्रिया ओपन सोर्स टूल श्रृंखला: जिसमें तीन प्रमुख मॉड्यूल शामिल हैं: पूर्व-प्रशिक्षण, प्रशिक्षण और मूल्यांकन। 1.3बी पैरामीटर प्री-ट्रेनिंग चेकपॉइंट प्रदान करता है और उलझन और ईएलबीओ मूल्यांकन का समर्थन करता है।
  • ट्रांसफार्मर आर्किटेक्चर समर्थन: मानक ट्रांसफार्मर आर्किटेक्चर के आधार पर, यह कॉन्फ़िगर करने योग्य शब्दावली आकार, ड्रॉपआउट नियमितीकरण और वितरित प्रशिक्षण का समर्थन करता है।

[विशेषज्ञ दृष्टिकोण]: एफएस-डीएफएम का वास्तविक आकर्षण साधारण गति में सुधार नहीं है, बल्कि इसका "चरण सामान्यीकरण" डिज़ाइन है - मॉडल को चरण स्थिरता के साथ प्रशिक्षित करने के बाद, समान वजन को अलग-अलग देरी/गुणवत्ता आवश्यकताओं के तहत लचीले ढंग से स्विच किया जा सकता है। इसका मतलब यह है कि इंजीनियरिंग टीमें प्रत्येक परिदृश्य के लिए स्वतंत्र मॉडल बनाए रखने के बजाय हार्डवेयर क्षमताओं और वास्तविक समय लोड के आधार पर तैनाती के समय नमूना चरणों की संख्या को गतिशील रूप से समायोजित कर सकती हैं। एलएलएम सेवा परिनियोजन में यह लोच अत्यंत मूल्यवान है।

मॉडल और संस्करण विकास

संस्करण दिनांक घटना
arXiv पहला संस्करण 2025-09-24 पेपर पहली बार arXiv:2509.20624 पर प्रकाशित हुआ था
गिटहब ओपन सोर्स 2025-09-24 एप्पल/एमएल-एफएस-डीएफएम गोदाम को पूर्ण कोड और वजन सहित एक साथ सार्वजनिक किया गया है
आईसीएलआर 2026 द्वारा स्वीकृत 2026-01 पेपर आईसीएलआर 2026 द्वारा स्वीकार किया गया था (विशिष्ट तिथि सम्मेलन कार्यक्रम के अधीन है)
वजन मुक्ति 2026-02 1.3बी एफएस-डीएफएम और डीएफएम प्री-ट्रेनिंग चेकपॉइंट डाउनलोड प्रदान करें

परियोजना में व्यावसायिक संस्करण की पुनरावृत्ति नहीं हुई है, और सभी रिलीज़ अनुसंधान-उन्मुख ओपन सोर्स संस्करण हैं।

तकनीकी लाभ

  • चरण-संगत प्रशिक्षण: एक स्पष्ट इनपुट पैरामीटर के रूप में नमूनाकरण चरणों की संख्या का उपयोग करते हुए, मॉडल अलग-अलग चरण बजट के तहत वजन का एक ही सेट साझा करता है, जिससे प्रत्येक चरण के लिए अलग-अलग प्रशिक्षण को कॉन्फ़िगर करने की आवश्यकता समाप्त हो जाती है। इंजीनियरिंग के संदर्भ में, इसका मतलब यह है कि एक प्रशिक्षण सत्र बेहद तेज (2-4 कदम) से लेकर उच्च गुणवत्ता (64-128 कदम) तक अनुमान परिदृश्यों के पूरे स्पेक्ट्रम को कवर कर सकता है।

  • विश्वसनीय अद्यतन नियम: एफएस-डीएफएम का असतत सॉल्वर ऊर्जा बाधा (ऊर्जा बाधा) के माध्यम से संभाव्यता हस्तांतरण की दिशा को नियंत्रित करता है, और यह सुनिश्चित करने के लिए डीटी टुकड़े-टुकड़े सामान्यीकरण के साथ सहयोग करता है कि प्रत्येक चरण संभाव्यता द्रव्यमान को ओवरशूटिंग के बिना "सही दिशा" में ले जाता है। पारंपरिक असतत प्रसार में सामान्य संभाव्यता बहाव समस्या की तुलना में, यह तंत्र कुछ-चरण परिदृश्यों में पीढ़ी स्थिरता में काफी सुधार करता है।

  • शिक्षक-छात्र आसवन: आरके4 शिक्षक प्रक्षेपवक्र से छात्र मॉडल तक ज्ञान का प्रसार करें, ताकि छात्र मॉडल अभी भी बहुत कम चरणों में उच्च गुणवत्ता वाले आउटपुट को बनाए रख सके। डिस्टिल्ड 8-स्टेप मॉडल उलझन के मामले में 1024-स्टेप शिक्षक मॉडल के बराबर है, जो परिमाण के दो आदेशों द्वारा अनुमान विलंबता को कम करता है।

  • लचीला सॉल्वर चयन: दो स्रोत वितरण रणनीतियों, यूनिफ़ॉर्म और मास्क, और कई ओडीई सॉल्वर जैसे मिक्सचर_यूलर और मिक्सचर_यूलर_विथ_क्यूमुलेटिव_स्केलर का समर्थन करता है। शोधकर्ता विभिन्न डेटा विशेषताओं के अनुसार उन्हें स्वतंत्र रूप से संयोजित कर सकते हैं।

कैसे उपयोग करें

FS-DFM एक ओपन सोर्स PyTorch प्रोजेक्ट के रूप में वितरित किया गया है और यह SaaS सेवा नहीं है। उपयोग से पहले, आपको Python 3.8+ और CUDA 11.0+ वातावरण तैयार करना होगा।

स्थापना

# क्लोन रिपोजिटरी
गिट क्लोन https://github.com/apple/ml-fs-dfm.git
सीडी एमएल-एफएस-डीएफएम

#कोंडा संदर्भ बनाएं
conda env create -f fsdfm_environment.yml
कोंडा एफएसडीएफएम को सक्रिय करें

# विकास मोड स्थापित करें
पिप इंस्टाल -ई।

मॉडल मूल्यांकन

# पूर्व-प्रशिक्षित वजन डाउनलोड करें और मूल्यांकन चलाएं
पायथन fs_dfm/run_eval.py \
    --work_dir "/पथ/से/आउटपुट" \
    --ngpus 1 \
    --perplexity_n_samples 320 \
    --eval_elbo \
    --eval_perplexity \
    --pre_trained_model_path "/path/to/checkpoint.pth"

मॉडल प्रशिक्षण

पायथन fs_dfm/run_train.py \
    data.cache_dir=${CACHE_DIR:-./cache_dir}

मुख्य कॉन्फ़िगरेशन पैरामीटर fs_dfm/configs/config.yaml में स्थित हैं, जिसमें sampling_steps (नमूना चरणों की संख्या), source_distribution (स्रोत वितरण प्रकार), तापमान (नमूना तापमान), आदि शामिल हैं।

विशिष्ट उपयोग प्रक्रिया

रिपॉजिटरी को क्लोन करें → पर्यावरण को कॉन्फ़िगर करें → पूर्व-प्रशिक्षित वजन डाउनलोड करें → मूल्यांकन/प्रशिक्षण स्क्रिप्ट चलाएँ → आउटपुट परिणामों का विश्लेषण करें। संपूर्ण निर्देशों के लिए, कृपया GitHub रिपॉजिटरी README देखें।

उत्पाद का मूल्य निर्धारण

एफएस-डीएफएम पूरी तरह से एक खुला स्रोत अनुसंधान परियोजना है और इसमें वाणिज्यिक मूल्य निर्धारण शामिल नहीं है:

प्रोजेक्ट लागत
स्रोत कोड मुफ़्त (GitHub सार्वजनिक भंडार)
पूर्व-प्रशिक्षित वजन (1.3बी) मुफ्त डाउनलोड
पेपर एक्सेस निःशुल्क (arXiv ओपन एक्सेस)
वाणिज्यिक लाइसेंस गोदाम लाइसेंस फ़ाइल की शर्तों के अधीन
बादल तर्क कोई आधिकारिक होस्टिंग सेवा नहीं, स्वयं ही तैनात करने की आवश्यकता है

शैक्षणिक और औद्योगिक शोधकर्ता शून्य लागत पर सभी कोड और वेट प्राप्त कर सकते हैं, लेकिन प्रशिक्षण या अनुमान के लिए आवश्यक जीपीयू हार्डवेयर संसाधन उपयोगकर्ता द्वारा वहन किए जाते हैं।

अनुप्रयोग परिदृश्य

  • डिफ्यूजन लैंग्वेज मॉडल रिसर्च: अलग-अलग प्रवाह मिलान के लिए कुछ-चरणीय नमूना आधार रेखा के रूप में, तुलनात्मक प्रयोगों, पृथक्करण अध्ययन और नए सॉल्वर विकास के लिए उपयोग किया जाता है।
  • लंबे पाठ की कुशल पीढ़ी: उन परिदृश्यों के लिए उपयुक्त जिनके लिए लंबे अनुक्रमों की समानांतर पीढ़ी की आवश्यकता होती है (जैसे कि 1024 टोकन) लेकिन विलंबता के प्रति संवेदनशील होते हैं, जैसे सारांश पीढ़ी, संरचित आउटपुट और कोड पूर्णता।
  • कम-विलंबता पाठ अनुमान सेवा: 8-चरणीय नमूनाकरण अनुमान विलंब को हजार-चरण स्तर पर दसियों सेकंड से दूसरे स्तर तक संपीड़ित करता है, जो उच्च वास्तविक समय आवश्यकताओं के साथ ऑनलाइन सेवा बैकएंड के लिए उपयुक्त है।
  • छोटा नमूना फाइन-ट्यूनिंग और डोमेन अनुकूलन: 1.3बी पूर्व-प्रशिक्षण भार के आधार पर, यह डाउनस्ट्रीम कार्यों पर फाइन-ट्यूनिंग के माध्यम से विशिष्ट क्षेत्रों (जैसे कानूनी दस्तावेज, चिकित्सा पाठ) को जल्दी से अनुकूलित कर सकता है।

लागू लोग

  • एआई शोधकर्ता (एनएलपी/जेनरेटिव मॉडल दिशा): एफएस-डीएफएम कुछ-चरणीय नमूने से मेल खाने वाले असतत प्रवाह के लिए एक पूर्ण आधार रेखा प्रदान करता है और प्रसार भाषा मॉडल अनुसंधान के लिए संदर्भ कार्यान्वयन और तुलना विधि के रूप में उपयुक्त है।
  • डीप लर्निंग इंजीनियर: कुछ-चरणीय नमूने के साथ त्वरित पाठ निर्माण में रुचि है, और मूल्यांकन और एकीकरण के लिए एक प्रतिलिपि प्रस्तुत करने योग्य ओपन सोर्स समाधान की आवश्यकता है।
  • बड़ी मॉडल अनुमान अनुकूलन टीम: एक इंजीनियरिंग टीम जो ऑटोरेग्रेसिव मॉडल अनुमान के थ्रूपुट बाधा का सामना करती है और गैर-ऑटोरेग्रेसिव विकल्पों की खोज कर रही है।
  • कॉलेज के छात्र और शैक्षणिक संस्थान: पाठ्यक्रम परियोजनाएं, स्नातक परियोजनाएं या शैक्षणिक अन्वेषण ओपन सोर्स कोड और पूर्व-प्रशिक्षित भार के आधार पर किया जा सकता है।

[सीमाओं के लिए उपयुक्त नहीं]:

  • अंतिम उपभोक्ताओं के लिए नहीं (कोई वेब यूआई नहीं, कोई ऐप नहीं, कोई SaaS सेवा नहीं)।
  • उन परिदृश्यों के लिए उपयुक्त नहीं है जिनके लिए चैटजीपीटी-जैसे इंटरैक्टिव संवाद की आवश्यकता होती है (एफएस-डीएफएम एक संवाद मॉडल के बजाय एक जेनरेटिव मॉडल है)।
  • शून्य-कोड/कम-कोड उपयोगकर्ताओं के लिए उपयुक्त नहीं, इसके लिए PyTorch और कमांड लाइन क्षमताओं की आवश्यकता होती है।
  • चीनी की प्रत्यक्ष पीढ़ी समर्थित नहीं है (पूर्व-प्रशिक्षण डेटा मुख्य रूप से अंग्रेजी में है, और चीनी पीढ़ी को अतिरिक्त फाइन-ट्यूनिंग की आवश्यकता है)।

सारांश और आउटलुक

एफएस-डीएफएम असतत प्रसार भाषा मॉडल के क्षेत्र में ऐप्पल द्वारा एक महत्वपूर्ण प्रगति है। चरण संगतता प्रशिक्षण + विश्वसनीय अद्यतन नियम + शिक्षक आसवन के ट्रिपल संयोजन के माध्यम से, प्रसार भाषा मॉडल के नमूना चरणों को बिना किसी गिरावट के गुणवत्ता बनाए रखते हुए हजारों चरणों से एकल अंकों तक संपीड़ित किया जाता है। 8 चरणों में 1024 टोकन का निर्माण, और उलझन में 128 गुना त्वरण जो कि हजार-चरण बेसलाइन के समान है - ये संख्याएं ऑटोरेग्रेसिव मॉडल के साथ प्रतिस्पर्धा करने के लिए दक्षता आयाम में पहली बार गैर-ऑटोरेग्रेसिव टेक्स्ट पीढ़ी को संभव बनाती हैं।

उद्योग के दृष्टिकोण से, एफएस-डीएफएम का महत्व सिर्फ एक शीर्ष सम्मेलन पेपर से कहीं अधिक है: यह दर्शाता है कि "असतत प्रवाह मिलान" का तकनीकी मार्ग लघु-चरण नमूना क्षमता के संदर्भ में पारंपरिक असतत प्रसार से कहीं अधिक है, जो भविष्य में कुशल पाठ पीढ़ी के लिए एक नई प्रतिमान दिशा प्रदान करता है। यदि इस मार्ग को बड़े मॉडल स्केल (>10बी) और अधिक जटिल कार्यों पर लगातार सत्यापित किया जा सकता है, तो इससे लंबी पाठ पीढ़ी के क्षेत्र में आर्किटेक्चर चयन पैटर्न में बदलाव की उम्मीद है।

[खरीद/गोद लेने का जोखिम मूल्यांकन]:

  • एफएस-डीएफएम एक शुद्ध अनुसंधान परियोजना है जिसमें कोई वाणिज्यिक एसएलए या तकनीकी सहायता नहीं है। उत्पादन परिनियोजन के लिए टीम को इंजीनियरिंग लागत वहन करने की आवश्यकता होती है।
  • मौजूदा बड़े मॉडल पारिस्थितिकी तंत्र में 1.3बी मॉडल का पैमाना अपेक्षाकृत छोटा है, और यह जटिल तर्क और निर्देश निम्नलिखित क्षमताओं के मामले में जीपीटी और क्लाउड जैसे वाणिज्यिक मॉडल के साथ प्रतिस्पर्धा नहीं कर सकता है।
  • व्यावसायिक परिदृश्यों में अनुपालन की पुष्टि के लिए ओपन सोर्स लाइसेंस शर्तों की सावधानीपूर्वक समीक्षा की जानी चाहिए।
  • परियोजना रखरखाव लय अनुसंधान टीम के अधीन है, और दीर्घकालिक अपडेट या समस्या प्रतिक्रियाओं की गारंटी नहीं है।
  • इसे सामान्य पाठ निर्माण आधार के बजाय "विशिष्ट परिदृश्यों के लिए दक्षता बढ़ाने वाले घटक" के रूप में स्थापित करने की सिफारिश की जाती है, और उन कार्यों में मूल्यांकन को प्राथमिकता दी जाती है जो विलंब-संवेदनशील हैं, लंबे अनुक्रम हैं, और नियंत्रणीय गुणवत्ता की आवश्यकताएं हैं।

संबंधित टूल: <एक्सलिंक टाइप='टूल' स्लग='हगिंग-फेस'>, <एक्सलिंक टाइप='टूल' स्लग='रेप्लिकेट'>

संस्करण जानकारी

  • आईसीएलआर 2026 संस्करण :पेपर arXiv:2509.20624 का रिलीज़ संस्करण, जिसमें FS-DFM का संपूर्ण मॉडल आर्किटेक्चर और प्रशिक्षण कोड शामिल है, को ICLR 2026 में शामिल किया गया है।
  • प्रारंभिक प्रतिबद्धता :पेपर को पहली बार arXiv पर प्रकाशित किया गया था, और ओपन सोर्स कोड को एक साथ सार्वजनिक किया गया था।

उपयोगकर्ता समीक्षाएं

  • समीक्षाएं लोड हो रही हैं...