computing• 3 min de lecture7 octobre 2026

Transférer l'expertise en calcul IA de CUDA vers Apple Silicon

Des chercheurs ont créé un système qui adapte automatiquement du code IA haute performance issu de l'écosystème CUDA de NVIDIA pour l'exécuter efficacement sur des puces Apple Silicon. Cette méthode a égalé les performances d'un niveau expert sur les tâches d'attention et a accéléré les tâches de pré-remplissage de Mamba.

En bref: Des chercheurs ont créé un système qui adapte automatiquement du code IA haute performance issu de l'écosystème CUDA de NVIDIA pour l'exécuter efficacement sur des puces Apple Silicon. Cette méthode a égalé les performances d'un niveau expert sur les tâches d'attention et a accéléré les tâches de pré-remplissage de Mamba.

Écrire du code de bas niveau pour faire fonctionner l'intelligence artificielle efficacement sur des puces graphiques est notoirement difficile. Aujourd'hui, un nouvel outil d'intelligence artificielle utilise les connaissances informatiques passées pour combler le fossé entre différentes puces informatiques sans nécessiter des années de travail manuel.

Ce qui s'est passé, en mots simples

Des chercheurs d'IBM Research et de UC Berkeley Sky Lab ont mis à jour un outil d'optimisation par intelligence artificielle appelé K-Search pour le rendre compatible avec le framework d'apprentissage automatique d'Apple, appelé MLX. Les systèmes plus anciens comme CUDA de NVIDIA bénéficiant de décennies d'expérience en matière de code optimisé à la main, l'équipe a conçu une couche de traduction structurée. Cette couche cartographie les règles matérielles et les limites de mémoire, permettant à un modèle d'IA de prendre du code existant et de le réécrire en noyaux GPU haute performance pour les puces Apple Silicon. Lors des tests, cette nouvelle méthode a atteint des performances proches du niveau expert sur les noyaux d'attention et a multiplié par 20 la vitesse de pré-remplissage du noyau du modèle d'espace d'états Mamba par rapport à une implémentation communautaire.

Points clés

  • Les noyaux GPU sont essentiels pour l'IA Les noyaux GPU sont des programmes de bas niveau qui s'exécutent au sein des processeurs graphiques pour gérer de lourdes charges de travail d'IA, mais en écrire d'efficaces demande des années d'expertise.
  • Adapter K-Search pour Apple Silicon Les chercheurs ont étendu K-Search, un framework d'optimisation évolutionniste utilisant un grand modèle de langage, en y ajoutant un backend qui compile et exécute du code sur Apple Silicon.
  • Combler le fossé grâce à une couche de traduction Une couche de traduction structurée fournit à l'IA des tables de correspondance de concepts et des règles architecturales, l'aidant à transformer du vieux code NVIDIA en code Apple Metal valide et de haute qualité.
  • De solides gains de vitesse sur du matériel réel Le noyau d'attention nouvellement généré a atteint 0,97 fois la vitesse du noyau natif d'Apple, et le noyau Mamba SSM a multiplié la vitesse de pré-remplissage par 20 par rapport au paquet communautaire mlx-lm.

Termes expliqués

  • Noyau GPU — Un programme spécialisé de bas niveau qui indique à une unité de traitement graphique comment effectuer une opération mathématique spécifique pour l'intelligence artificielle. Exemple: Comme une recette qui indique précisément à une brigade de cuisine comment couper des légumes simultanément plutôt qu'un par un.
  • Architecture à mémoire unifiée — Une conception de système où le processeur et la puce graphique partagent la même plage de mémoire, éliminant ainsi le besoin de copier des données d'un endroit à un autre. Exemple: Comme deux chefs cuisiniers partageant un seul grand plan de travail au lieu de faire sans cesse des aller-retours dans la pièce vers des stations de préparation séparées.
  • Balayage parallèle — Un algorithme qui décompose un problème mathématique étape par étape en plusieurs morceaux afin que plusieurs voies de calcul puissent les résoudre en même temps. Exemple: Comme toute une rangée de personnes additionnant simultanément des parties distinctes d'une longue liste au lieu d'attendre qu'une seule personne le fasse de manière séquentielle.

Pourquoi c'est important

Alors que différentes entreprises construisent des puces informatiques spécialisées pour l'intelligence artificielle, réécrire des logiciels pour chaque puce individuelle constitue un goulet d'étranglement majeur. Les outils automatisés qui transfèrent les anciennes connaissances de performance vers du nouveau matériel peuvent aider les développeurs à exécuter des modèles d'IA locaux plus rapidement et plus efficacement sur des appareils grand public tels que les MacBooks.

Ce que l'on ne sait pas encore

La recherche n'a testé cette approche que sur quelques noyaux spécifiques, tels que l'attention et Mamba SSM, et on ignore encore dans quelle mesure la méthode pourra être généralisée à d'autres cibles matérielles et à des écosystèmes logiciels plus vastes.


D'après un article de Berkeley AI Research Blog. Ceci est une explication indépendante, rédigée avec nos propres mots et l'aide d'une IA ; Berkeley AI Research Blog ne l'a ni relue ni approuvée. Consultez l'original pour tous les détails.

Transférer l'expertise en calcul IA de CUDA vers Apple Silicon | Curious Tech Portal | Curious Tech Portal