UM
Gratuit
Mu est un modèle de langage d'encodeur-décodeur de 330 millions de paramètres lancé par Microsoft, spécialement optimisé pour les appareils NPU et Edge. Il pilote les agents IA dans les paramètres Windows sur les PC Copilot+, convertissant les instructions en langage naturel en actions système en temps réel, atteignant des vitesses d'inférence de plus de 200 jetons/s sur Surface Laptop 7.
Mu : le modèle de langage à petits paramètres de Microsoft spécialement créé pour NPU
Paramètres et statistiques de base de Mu
Mu est un modèle de langage à petits paramètres (SLM) officiellement publié par l'équipe Windows Applied Sciences de Microsoft en juin 2025. Il se concentre sur un fonctionnement efficace sur les NPU (Neural Processing Unit) et les appareils de périphérie. Il est intégré aux paramètres Windows du PC Copilot+ et sert de moteur d'inférence pour l'agent IA, mappant les instructions en langage naturel de l'utilisateur dans les opérations de paramètres du système en temps réel.
| Projets | Informations publiques |
|---|---|
| Développeur | Microsoft (Microsoft) |
| Architecture modèle | Transformateur codeur-décodeur |
| Taille du paramètre | 330 millions (330M) |
| Vitesse d'inférence | Plus de 100 jetons/s (NPU), plus de 200 jetons/s (Surface Laptop 7) |
| Contexte de saisie | Des dizaines de milliers de jetons |
| Taux de sortie | Plus de 100 jetons/s |
| Formulaire de déploiement | Inférence côté appareil, entièrement déchargée sur NPU |
| Méthode de quantification | PTQ (quantification post-entraînement), entier 8 bits/16 bits |
| Matériel de formation | GPU A100 (Azure Machine Learning) |
| Données de pré-formation | Des centaines de milliards de jetons éducatifs de haute qualité |
| Source distillée | Modèles de la série Microsoft Phi |
| Méthode de réglage fin | LoRA (adaptation de bas rang) |
| Plateformes prises en charge | Windows 11 (Copilot+ PC, aperçu Dev Channel Insider) |
| Méthode de publication | Intégré dans la zone de recherche des paramètres Windows, aucune installation indépendante requise |
Différence de positionnement : par rapport au Phi-3.5-mini (un modèle à petits paramètres également produit par Microsoft), la taille du paramètre Mu est environ 10 fois plus petite (330 M contre 3,3 B), mais ses performances sur des tâches spécifiques (telles que la compréhension du code CodeXGlue) sont proches. Il ne vise pas les capacités générales de dialogue, mais se concentre sur les tâches de « mappage entrées-sorties » - le scénario le plus typique est de « comprendre les intentions de paramétrage du système de l'utilisateur et de les convertir en instructions d'utilisation précises ».
Implications du choix d'architecture : Mu utilise une architecture de codeur-décodeur plutôt qu'une architecture de décodeur pure. L'encodeur traite toutes les entrées en même temps pour générer une représentation potentielle, et le décodeur génère uniquement une sortie basée sur cette représentation, évitant ainsi le gaspillage de calcul lié au retraitement de toutes les entrées à chaque fois que le modèle de décodeur génère un jeton. Les données officielles montrent qu'au même niveau de NPU, le délai du premier jeton de l'architecture codeur-décodeur est réduit d'environ 47 % et la vitesse de décodage est augmentée d'environ 4,7 fois. Ceci est essentiel pour les scénarios interactifs qui nécessitent une réponse inférieure à la seconde, comme la configuration d'un champ de recherche.
Utilisateurs de Mu et reconnaissance du marché
Mu n'est pas un produit ouvert au public en téléchargement, mais est fourni aux utilisateurs dans le cadre des capacités du système Windows 11, de sorte que son « acceptation par le marché » se reflète dans les décisions d'adoption internes de Microsoft et les commentaires de la communauté Windows Insider.
Vérification interne de Microsoft : Mu a passé avec succès la double acceptation interne stricte de Microsoft en matière d'exactitude et de latence. Dans le scénario de l'agent de configuration Windows, la version optimisée de LoRA de Mu a atteint une précision globale de 0,738 (F1) sur des centaines de paramètres système, et le temps de réponse a été contrôlé dans les 500 ms, répondant ainsi aux exigences de conception d'interaction de l'équipe UX. En revanche, bien que Phi LoRA ait une précision plus élevée (0,815), il a été vaincu parce que le modèle était trop grand pour atteindre l'objectif de latence - cela montre que le positionnement de Mu n'est pas « le plus fort », mais « juste avec des ressources limitées ».
Comparaison au niveau des tâches avec Phi-3.5-mini :
| Tâche d'évaluation | Après avoir affiné Mu (330M) | Après avoir peaufiné le Phi-3.5-mini (3.3B) |
|---|---|---|
| SQUAD (Compréhension écrite) | 0,692 | 0,846 |
| CodeXGlue (compréhension du code) | 0,934 | 0,930 |
| Agent de paramètres Windows | 0,738 | 0,815 |
Mu surpasse même Phi-3.5-mini, qui a des paramètres 10 fois plus grands, par un léger avantage dans la tâche de compréhension du code (CodeXGlue), indiquant que l'architecture codeur-décodeur présente un avantage naturel en termes d'efficacité des paramètres dans les tâches de « mappage entrée-sortie ».
Échelle de couverture : l'agent de paramètres Windows prend en charge des centaines de paramètres système, couvrant des scénarios à haute fréquence tels que la luminosité de l'écran, la taille du pointeur de la souris, l'accessibilité, la configuration réseau et la personnalisation. Grâce à des méthodes telles que la génération de données synthétiques, l'annotation automatique, l'ingénierie des mots d'invite, l'injection de bruit et l'échantillonnage intelligent, Microsoft a étendu les données d'entraînement de moins de 50 paramètres d'origine à des centaines d'éléments, avec un échantillon de 3,6 millions.
Position écologique : Mu représente une tendance du secteur : faire passer les capacités d'IA du cloud vers l'appareil, convergeant des grands modèles à usage général vers de petits modèles spécifiques à des tâches. Il compare les routes On-Device Intelligence d'Apple et Tensor NPU de Google, mais a un angle d'entrée plus étroit (proxy des paramètres système) et une méthode de livraison plus profonde (intégrée dans la zone de recherche du système d'exploitation).
L'avantage de coût de Mu
La structure de coûts de Mu est fondamentalement différente du modèle API traditionnel ou du cloud LLM : elle n'a pas de page de tarification distincte et n'est pas facturée par jeton.
Côté C/Utilisateur final : Mu est entièrement gratuit pour les utilisateurs Windows utilisant Copilot+ PC. Il est préinstallé sur les appareils éligibles dans le cadre de Windows, sans frais d'abonnement ni paiement à l'utilisation. Le seul coût initial est le matériel, nécessitant un PC Copilot+ avec un NPU comme Qualcomm Snapdragon X, AMD Ryzen AI ou Intel Core Ultra.
Développeur/Écosystème : Mu ne dispose actuellement pas d'API publique ni de canal de téléchargement de poids de modèle. Les développeurs tiers ne peuvent pas appeler directement les capacités d’inférence de Mu, ni intégrer le modèle dans leurs propres applications. Si vous souhaitez utiliser la voie technique de Mu dans des scénarios similaires, vous devez vous référer aux idées architecturales divulguées par Microsoft dans le blog (encodeur-décodeur + adaptation NPU + quantification PTQ + réglage fin LoRA), la reproduire vous-même ou attendre que Microsoft ouvre le poids du modèle.
Déploiement en entreprise/informatique : la valeur d'entreprise de Mu se reflète dans la réduction des coûts de support informatique et l'amélioration de l'efficacité du libre-service des employés. Traditionnellement, la modification des paramètres du système nécessite que les utilisateurs parcourent manuellement les menus ou contactent le service informatique ; Mu a raccourci ce processus pour « entrer en langage naturel → automatiser l'exécution » et devrait réduire le temps passé sur une seule opération de réglage d'une moyenne de 30 à 60 secondes à 5 à 10 secondes. Pour les entreprises disposant de milliers de PC Copilot+, les gains de temps cumulés sont significatifs. Cependant, cet avantage dépend entièrement des mises à niveau matérielles (achat de Copilot+ PC), qui constituent un coût caché : les entreprises doivent terminer la mise à niveau de leurs équipements avant de pouvoir profiter des dividendes d'efficacité apportés par Mu.
Comparaison des coûts (déduction) :
| Dimension du coût | Solution Cloud LLM (telle que GPT-4o) | Solution côté client Mu |
|---|---|---|
| Coût d'inférence unique | ~0,01-0,03 $/heure (appel API) | 0 (matériel acheté) |
| Latence | 500-2000 ms (réseau + inférence) | <500 ms (local complet) |
| Confidentialité | Les données quittant le pays nécessitent un examen de conformité | Les données ne quittent pas l'appareil |
| Disponible hors ligne | Non | Oui |
| Seuil matériel | Aucun (tout appareil connecté à Internet) | Nécessite Copilot+ PC (NPU) |
Principales fonctions de Mu
Les capacités de Mu sont exposées aux utilisateurs finaux via l'agent de paramètres Windows. L’essentiel est de convertir les instructions en langage naturel en opérations système.
-
Recherche des paramètres de langage naturel : saisissez des expressions quotidiennes telles que "éclaircir l'écran", "agrandir le pointeur de la souris", "activer le mode nuit", "passer au thème sombre", etc. dans la zone de recherche des paramètres Windows. Une fois que Mu a compris l'intention, il passera directement à la page de paramètres correspondante ou effectuera une opération sans avoir à se souvenir du chemin de configuration. Ceci est différent des recherches par mots-clés traditionnelles : les recherches traditionnelles renvoient uniquement le nom de la page de paramètres, tandis que Mu comprend les variations sémantiques, telles que « rendre l'écran moins éblouissant » et peut correspondre au mode luminosité/nuit et à d'autres possibilités.
-
DES CENTAINES DE PARAMÈTRES COUVERTS : De l'affichage, du son, du réseau et de la personnalisation à l'accessibilité, à la confidentialité et à la sécurité, la version affinée de Mu couvre des centaines de paramètres système modifiables dans Windows. Microsoft utilise une technologie de génération de données synthétiques et d'échantillonnage de diversité pour garantir une réponse correcte aux paramètres basse fréquence.
-
Inférence end-side inférieure à la seconde : bénéficiant de l'architecture encodeur-décodeur et de l'accélération matérielle NPU, le temps de réponse de bout en bout de Mu est stable à moins de 500 ms et la vitesse de sortie mesurée sur Surface Laptop 7 peut atteindre plus de 200 jetons/s. Les utilisateurs voient les résultats presque immédiatement après avoir tapé : pas besoin d'attendre un aller-retour vers le cloud.
-
Couverture intelligente des requêtes floues : pour les requêtes trop courtes ou dont les intentions ne sont pas claires (telles que la saisie uniquement du mot "luminosité"), Mu rétrogradera automatiquement vers la recherche lexicale et sémantique traditionnelle et affichera une liste candidate de paramètres pertinents dans la zone de recherche au lieu de forcer des opérations imprécises. Ce mécanisme hybride « basé sur l'IA et basé sur la recherche » évite efficacement le risque de mauvais fonctionnement.
-
Prise en charge multilingue : les données de formation de Mu couvrent une variété de langues naturelles. Les utilisateurs peuvent saisir des instructions en anglais, chinois, japonais, allemand et dans d'autres langues, et le modèle peut comprendre et effectuer avec précision les opérations correspondantes. Il s'agit d'une fonctionnalité de base importante pour les utilisateurs multilingues et le déploiement mondial en entreprise.
Evolution du modèle et de la version de Mu
L'historique des versions de Mu est étroitement lié à son rythme de livraison sous Windows. Les nœuds traçables actuels sont les suivants.
Version principale
| Version | Dates | Descriptif |
|---|---|---|
| Première version expérimentale | ~ 1er trimestre 2025 (pas encore de date officielle précise) | Vérification du prototype basé sur la distillation en série Phi, utilisée pour évaluer la faisabilité de l'architecture codeur-décodeur dans les scénarios NPU |
| Version officielle (v1.0) | 2025-06-23 | Officiellement publié via le blog Windows et intégré à l'agent de paramètres PC Copilot+ de Windows 11 Insider Preview Build 26200.5651 (canal de développement) |
Étapes clés
- Mai 2025 : Microsoft a mentionné pour la première fois le concept de configuration d'agents dans l'aperçu "New Generation Windows Experience", sans révéler à l'époque les détails du modèle sous-jacent.
- 13 juin 2025 : Windows 11 Insider Preview Build 26200.5651 (Dev Channel) est publié, les utilisateurs de PC Copilot+ ont la possibilité de configurer des agents pour la première fois et Mu commence à être disponible en niveaux de gris pour les utilisateurs Insider.
- 23 juin 2025 : Le blog officiel de Microsoft présente officiellement les détails techniques du modèle de langage Mu, notamment la sélection de l'architecture, le processus de formation, la stratégie de quantification et les méthodes de réglage fin pour la configuration des agents.
Planification du suivi
Microsoft a déclaré dans un article de blog qu'il continuerait à recueillir des commentaires via le programme Windows Insider pour optimiser l'expérience de configuration de l'agent. D’un point de vue technique, les itérations ultérieures de Mu pourraient progresser dans les directions suivantes :
- Couvrir davantage d'éléments de configuration du système (étendus de centaines à des milliers)
- Prise en charge des opérations composées (telles que « atténuer l'écran et activer le mode nuit » plusieurs commandes à la fois)
- Précision de reconnaissance améliorée pour les requêtes ultra-courtes (1-2 mots)
- Étendu à d'autres scénarios d'interaction système au-delà des paramètres Windows
Actuellement, Mu n'a pas publié de poids de modèle ou d'API indépendants de Windows, et n'a pas non plus rendu public de cartes de modèles ou de référentiels Hugging Face.
Les avantages techniques de Mu
L'avantage technique de Mu ne réside pas dans l'échelle des paramètres, mais dans la conception de liens complets et l'optimisation technique qui « accomplissent des tâches spécifiques avec un coût de calcul minimal ».
Choix de l'architecture encodeur-décodeur : Mu utilise un encodeur-décodeur plutôt que l'architecture de décodeur pure traditionnelle actuelle. Lors de la configuration du mode d'utilisation de l'agent, la saisie de l'utilisateur consiste généralement en une requête unique et complète en langage naturel (telle que « régler la luminosité de l'écran à 50 %) » plutôt qu'en une conversation étape par étape. L'encodeur code l'entrée une fois et le décodeur génère la sortie, évitant ainsi le calcul redondant consistant à « retraiter le contexte complet à chaque fois qu'un jeton est généré » dans le modèle de décodeur. Selon des mesures réelles sur Qualcomm Hexagon NPU, ce choix entraîne une réduction de 47 % de la latence du premier jeton et une augmentation de 4,7 fois de la vitesse de décodage.
Optimisation matérielle du NPU : Mu ne déploie pas simplement le modèle sur le NPU, mais l'ajuste dès la phase de conception de l'architecture aux caractéristiques de calcul parallèle et aux limitations de mémoire du NPU. Les mesures spécifiques comprennent :
- Choisissez des dimensions de couche cachée et des largeurs de réseau à action directe qui s'alignent sur les dimensions de tenseur préférées du NPU pour garantir une efficacité maximale pour les opérations matricielles sur le matériel.
- L'encodeur et le décodeur adoptent une répartition de couches d'environ 2:1 (comme un encodeur à 32 couches + un décodeur à 12 couches) pour maximiser les capacités d'adaptation des tâches en partant du principe que le nombre total de paramètres est fixe.
- Utiliser le partage de poids (l'intégration d'entrée et l'intégration de sortie partagent le même ensemble de poids) pour réduire le nombre de paramètres et améliorer la cohérence du vocabulaire d'encodage et de décodage.
Trois mises à niveau du transformateur :
- Dual LayerNorm : effectuez une normalisation avant et après chaque sous-couche pour garantir une échelle de valeur d'activation stable, un processus de formation plus fluide et une convergence plus rapide.
- Rotated Position Embedding (RoPE) : code les informations de position relative via des opérations complexes de rotation de domaine, permettant au modèle d'avoir la capacité d'extrapoler des séquences au-delà de la longueur d'entraînement tout en évitant les limitations de longueur du codage de position absolue traditionnel.
- Group Query Attention (GQA) : partagez des paires clé-valeur entre les groupes de tête d'attention, réduisant ainsi la quantité totale de paramètres d'attention et l'utilisation de la mémoire, tout en conservant la diversité de l'attention multi-têtes. Ceci est particulièrement important compte tenu de la bande passante mémoire limitée des NPU.
Lien de formation de la distillation à la mise au point des instructions :
- Phase de pré-formation : utilisez des centaines de milliards de jetons éducatifs de haute qualité pour la pré-formation sur le GPU A100, en utilisant la planification du taux d'apprentissage à réchauffement stable et à décroissance et l'optimiseur Muon.
- Étape de distillation des connaissances : distillez les connaissances du modèle Microsoft Phi plus large, permettant à Mu avec 330 millions de paramètres de capturer les capacités de compréhension du langage du modèle plus large.
- Étape de réglage fin des tâches : utilisez la méthode LoRA (adaptation de bas rang) pour affiner spécifiquement la scène de l'agent. Les données de formation sont construites par génération synthétique, annotation automatique, réécriture diversifiée et injection de bruit, couvrant diverses variantes sémantiques de centaines de paramètres système.
Quantification PTQ et optimisation conjointe du matériel : la quantification post-entraînement (PTQ) convertit les poids et les activations du modèle à partir de nombres à virgule flottante en représentation entière de 8 bits et 16 bits, réduisant ainsi considérablement l'utilisation de la mémoire et les exigences informatiques. Microsoft entretient une collaboration approfondie avec ses trois partenaires de puces, AMD, Intel et Qualcomm, pour garantir que les opérations quantifiées sont entièrement adaptées et obtiennent les meilleures performances sur chaque NPU. Enfin, un débit d'inférence de plus de 200 jetons/s a été atteint sur Surface Laptop 7.
Comment utiliser Mu
Mu n'a pas d'entrée indépendante et toutes ses fonctions sont exposées via le champ de recherche Paramètres Windows.
Prérequis :
- Un PC Copilot+ avec NPU (Qualcomm Snapdragon X / AMD Ryzen AI / Intel Core Ultra)
- Rejoint le Dev Channel du programme Windows 11 Insider et installé la Build 26200.5651 ou une version plus récente
Étapes de fonctionnement :
- Cliquez sur le bouton « Démarrer » dans la barre des tâches ou appuyez sur Win + I pour ouvrir « Paramètres ».
- Saisissez une commande en langage naturel (telle que « diminuer l'écran », « augmenter la taille du texte », « activer Bluetooth ») dans la zone de recherche en haut de la fenêtre des paramètres.
- Mu analyse l'intention en temps réel côté client - si l'instruction est claire et implique des paramètres automatiquement exécutables, la page des paramètres passe automatiquement à l'élément correspondant et met en surbrillance la zone d'opération ; si l'instruction est vague ou implique plusieurs paramètres, la zone de recherche affiche une liste de candidats parmi laquelle l'utilisateur peut choisir.
Méthode d'accès des développeurs : Mu ne fournit actuellement pas d'API ou de SDK publics. Les développeurs qui souhaitent intégrer des fonctionnalités similaires dans leurs propres applications peuvent se référer à la solution technique divulguée sur le blog de Microsoft (architecture codeur-décodeur + réglage fin LoRA + quantification PTQ) et construire leur propre pipeline d'inférence basé sur la série Phi ou de petits modèles équivalents. Microsoft n'a pas annoncé s'il publierait Mu to Hugging Face ou Azure AI Foundry de la même manière que la série Phi.
Prix des produits de Mu
En tant que fonctionnalité d'IA intégrée au système d'exploitation Windows, Mu n'a pas de tarification indépendante.
- Coût de l'utilisateur final : gratuit. Les fonctionnalités sont préinstallées sur les PC Copilot+ éligibles et ne nécessitent aucun achat ou abonnement séparé.
- Coût d'entreprise : implicite. Les entreprises doivent terminer la mise à niveau matérielle des PC Copilot+ (généralement achetés par appareil, allant de plusieurs milliers à dix mille yuans par unité) avant que les employés puissent utiliser cette fonctionnalité. Les appareils PC non Copilot+ existants ne peuvent pas bénéficier des capacités Mu via une mise à jour logicielle.
- Coût développeur/tiers : ne peut actuellement pas être acheté ni accessible directement. Si vous souhaitez utiliser des fonctionnalités similaires dans vos propres produits, vous devez les développer vous-même ou attendre que Microsoft ouvre le poids du modèle.
En comparaison, la solution cloud LLM a un coût de paiement à l'utilisation clair dans le scénario d'appel API, mais l'avantage de Mu réside dans un coût d'inférence marginal nul et une garantie de confidentialité que les données ne quittent pas l'appareil. Pour les responsables informatiques, la décision d'activer ou non Mu est rarement une décision autonome : cela dépend si l'entreprise a déjà effectué la mise à niveau ou envisage de passer aux PC Copilot+.
Scénarios d'application Mu
Agent de paramètres Windows : il s'agit du seul scénario dans lequel Mu est actuellement officiellement implémenté. Les utilisateurs peuvent ajuster rapidement les paramètres du système grâce au langage naturel au quotidien, ce qui est particulièrement adapté aux sous-scénarios suivants :
- Les utilisateurs ayant une mauvaise vision ou des problèmes de mobilité peuvent ajuster les fonctionnalités d'accessibilité (loupe, contraste élevé, narrateur) via des commandes vocales/textuelles.
- Les nouveaux utilisateurs peu familiers avec les menus Paramètres Windows peuvent rapidement rechercher et modifier les paramètres cibles en langage naturel.
- Les utilisateurs multi-moniteurs spécifient rapidement les changements de luminosité/résolution pour un certain écran.
- Le personnel d'assistance informatique peut localiser rapidement les éléments de configuration grâce à des instructions précises lors de l'assistance à distance.
Interaction en temps réel côté appareil : la conception architecturale de Mu le rend naturellement adapté aux tâches d'inférence côté appareil qui nécessitent une faible latence et un débit élevé. Outre la mise en place de l’agent, elle peut théoriquement être étendue à :
- Amélioration de la recherche Windows : intégrez la recherche de fichiers, le lancement d'applications et le contrôle du système dans une entrée unifiée en langage naturel.
- Suggestions d'opérations rapides : découvrez les modèles d'utilisation de l'utilisateur et recommandez de manière proactive des modifications de paramètres (telles que "Il est détecté que vous projetez souvent dans la salle de conférence. Voulez-vous passer en mode étendu ?").
- Aide à l'accessibilité : combinée à la saisie vocale, elle offre des capacités complètes de configuration du système de commande vocale pour les utilisateurs handicapés moteurs.
Référence du prototype Edge AI : pour les fabricants de matériel et les développeurs d'IA, le rapport technique public de Mu peut être utilisé comme modèle de référence pour la conception de modèles de bout en bout - l'encodeur-décodeur reste un choix efficace pour traiter les tâches de type « mappage entrée-sortie » sur des appareils à contraintes informatiques, et la combinaison de LoRA + PTQ peut achever l'adaptation de nouvelles tâches en une semaine.
Ne convient pas aux scénarios :
- Mu n'est pas adapté à l'interaction conversationnelle, à la génération de textes longs, à l'écriture créative ou aux tâches de raisonnement complexes - son architecture et ses données de formation sont conçues pour une « entrée unique → sortie précise ».
- Ne convient pas aux plates-formes non Windows : Actuellement, Mu est entièrement lié à l'écosystème Windows et ne peut pas fonctionner sur Linux, macOS ou les appareils mobiles.
- Ne convient pas aux scénarios nécessitant un comportement de modèle personnalisé : les utilisateurs ne peuvent pas modifier les paramètres d'inférence de Mu (température, top_p, etc.), ni passer à d'autres versions affinées.
Groupes applicables de Mu
-
Propriétaires de PC Copilot+ : Si vous êtes un Windows 11 Insider et possédez un PC Copilot+, Mu est une fonctionnalité système prête à l'emploi et sans coût. Il convient aux utilisateurs qui ajustent souvent les paramètres du système mais ne se souviennent pas des chemins de menu, ainsi qu'aux utilisateurs multitâches qui souhaitent améliorer l'efficacité grâce à des opérations vocales/textes rapides.
-
Administrateurs informatiques et décideurs en matière d'achat d'équipement : Mu est un point de valeur supplémentaire pour l'automatisation informatique d'entreprise. Si une équipe évalue l'achat d'un PC Copilot+, la « réduction des tickets informatiques grâce à la configuration en libre-service » peut être prise en compte dans le calcul du retour sur investissement. Toutefois, il convient de noter que cet avantage repose sur le principe que les employés sont prêts à modifier leurs habitudes de fonctionnement, passant de « appeler le service informatique » à « se chercher eux-mêmes ».
-
Développeurs et chercheurs en IA côté appareil : les informations techniques publiques de Mu (sélection de l'architecture, stratégie d'adaptation du NPU, processus de quantification et de distillation) sont une référence importante pour l'ingénierie des modèles côté extrémité. Cependant, Mu lui-même ne dispose actuellement pas de poids de modèle ouvert ni d'API, et les actifs directement réutilisables sont limités. Il est recommandé de vérifier si Microsoft ouvrira des modèles dotés de fonctionnalités similaires via la série Phi ou Azure AI Foundry.
-
Ne s'applique pas aux personnes :
- Les développeurs qui ont besoin de fonctionnalités de modèle multiplateforme (Mu est lié à Windows/NPU).
- Utilisateurs recherchant des capacités générales de conversation ou de génération de contenu (devraient choisir de petits modèles généraux tels que Phi, Gemma ou Llama).
- Les équipes recherchant des services API prêts à l'emploi (Mu n'a pas d'API publique et n'est disponible que via l'interface des paramètres Windows).
- Utilisateurs qui doivent utiliser l'IA sur l'appareil sur des PC non Copilot+ (Mu nécessite la prise en charge matérielle NPU).
Résumé et Outlook
Mu est une étape spécifique dans la stratégie de Microsoft consistant à « faire descendre l'IA au niveau du système ». Il utilise une combinaison de 330 millions de paramètres, d'une architecture d'encodeur-décodeur et d'une technologie de déchargement complet NPU pour obtenir une interaction de réglage du langage naturel en moins d'une seconde sur des appareils soumis à des contraintes informatiques. Comparé aux grands modèles à usage général, Mu ne recherche pas de larges capacités de dialogue, mais « est adéquat et extrêmement rapide pour des tâches restreintes » – cette philosophie de conception « moins c'est plus » représente une voie pragmatique pour l'IA côté appareil.
Limites actuelles :
- Portée étroite des fonctionnalités : couvre uniquement les paramètres Windows et ne peut pas gérer les interactions système plus générales telles que la gestion des fichiers, le lancement d'applications, la planification, etc.
- Liaison matérielle : doit s'appuyer sur le NPU du PC Copilot+, et les utilisateurs de PC existants ne peuvent pas obtenir une expérience similaire via les mises à jour logicielles.
- Fermeture écologique : les poids des modèles et les API ne sont pas ouverts et les tiers ne peuvent pas les réutiliser ou les développer.
- Toujours au stade Insider : les fonctionnalités n'ont pas encore été transférées vers le canal de disponibilité générale (GA) de Windows 11 et la disponibilité en production n'a pas encore été confirmée.
Points d'observation clés :
- Si Microsoft étendra Mu à d'autres scénarios d'interaction système au-delà des paramètres (tels que la recherche de fichiers, le panneau de configuration) dans les versions ultérieures de Windows.
- Si Microsoft ouvrira les poids des modèles de Mu via la série Phi ou Hugging Face afin que les développeurs puissent reproduire ou affiner leurs propres modèles côté appareil.
- Les améliorations des performances des partenaires de puces (AMD, Intel, Qualcomm) sur les NPU de nouvelle génération permettront-elles à la vitesse de réponse de Mu de progresser davantage.
- Les actions correspondantes d'Apple et de Google dans l'IA côté appareil (Apple Intelligence, Google Tensor) et l'orientation concurrentielle différenciée de la route Mu.
Évaluation des risques d'approvisionnement/d'adoption : pour les utilisateurs individuels, tant que le matériel remplit les conditions, ils peuvent en faire l'expérience à un coût nul et le risque est extrêmement faible. Pour les entreprises, le coût de déploiement se reflète principalement dans les mises à niveau matérielles du PC Copilot+. Il est recommandé de le promouvoir progressivement lorsque le cycle de mise à jour de l'appareil arrive naturellement, plutôt que de mettre à niveau les fonctions individuelles à l'avance. Il est recommandé que cette fonctionnalité soit poussée vers la version officielle de Windows 11 avant d'être entièrement promue pour éviter toute instabilité dans la version Insider. Pour les développeurs, il n'est pas recommandé d'investir directement dans le développement de produits sur la base du rapport technique actuel de Mu - avant que Microsoft n'approuve sa stratégie ouverte, la série Phi constitue un choix de modèle côté appareil plus mature et plus accessible.
Outils associés :
LangChaîne
Informations de version
- Version officielle de Mu :Officiellement publié via le blog Windows et intégré à l'agent Copilot+ PC Settings dans Windows 11 Insider Preview Build 26200.5651 (Dev Channel).
- Première version de développement :Il n’y a pas encore de date officielle précise. Une première version expérimentale basée sur la distillation en série Phi et l'adaptation NPU, utilisée pour vérifier la faisabilité de l'architecture codeur-décodeur dans des scénarios finaux.
Avis des utilisateurs