computing• 3 min de leitura7 de outubro de 2026

Transferindo Especialização em Computação de IA de CUDA para Apple Silicon

Pesquisadores criaram um sistema que adapta automaticamente códigos de IA de alto desempenho do ecossistema CUDA da NVIDIA para rodar eficientemente em chips Apple Silicon. Esse método alcançou desempenho de nível especializado em tarefas de atenção e acelerou tarefas de pré-preenchimento do Mamba.

Resumo rápido: Pesquisadores criaram um sistema que adapta automaticamente códigos de IA de alto desempenho do ecossistema CUDA da NVIDIA para rodar eficientemente em chips Apple Silicon. Esse método alcançou desempenho de nível especializado em tarefas de atenção e acelerou tarefas de pré-preenchimento do Mamba.

Escrever código de baixo nível para fazer chips gráficos executarem inteligência artificial de forma eficiente é notoriamente difícil. Agora, uma nova ferramenta de inteligência artificial usa conhecimento de computação passado para preencher a lacuna entre diferentes chips de computador sem exigir anos de trabalho manual.

O que aconteceu, em palavras simples

Pesquisadores da IBM Research e do UC Berkeley Sky Lab atualizaram uma ferramenta de otimização de inteligência artificial chamada K-Search para funcionar com o framework de aprendizado de máquina da Apple, chamado MLX. Como sistemas mais antigos como o CUDA da NVIDIA possuem décadas de experiência em códigos ajustados manualmente, a equipe construiu uma camada de tradução estruturada. Essa camada mapeia regras de hardware e limites de memória, permitindo que um modelo de IA pegue o código existente e o reescreva em kernels de GPU de alto desempenho para chips Apple Silicon. Quando testado, o novo método alcançou desempenho quase especializado em kernels de atenção e proporcionou uma aceleração de pré-preenchimento de até 20 vezes no kernel do modelo de espaço de estados Mamba em comparação com uma implementação da comunidade.

Pontos principais

  • Kernels de GPU são cruciais para IA Kernels de GPU são programas de baixo nível que rodam dentro de processadores gráficos para lidar com pesadas cargas de trabalho de IA, mas escrever versões eficientes exige anos de especialização.
  • Adaptando o K-Search para Apple Silicon Pesquisadores estenderam o K-Search, um framework de otimização evolutiva que usa um grande modelo de linguagem, adicionando um backend que compila e executa código no Apple Silicon.
  • Preenchendo a lacuna com uma camada de tradução Uma camada de tradução estruturada fornece à IA tabelas de mapeamento de conceitos e regras arquiteturais, ajudando-a a transformar código antigo da NVIDIA em código Apple Metal válido e de alta qualidade.
  • Fortes ganhos de velocidade em hardware real O kernel de atenção recém-gerado atingiu 0,97x a velocidade do kernel nativo da Apple, e o kernel Mamba SSM alcançou uma aceleração de pré-preenchimento de até 20x em relação ao pacote comunitário mlx-lm.

Termos explicados

  • Kernel de GPU — Um programa especializado de baixo nível que diz a uma unidade de processamento gráfico como realizar uma operação matemática específica para inteligência artificial. Exemplo: Como uma receita que diz à equipe de uma cozinha exatamente como picar vegetais simultaneamente em vez de um por um.
  • Arquitetura de memória unificada — Um design de sistema onde o processador e o chip gráfico compartilham o mesmo pool de memória, eliminando a necessidade de copiar dados de um lado para o outro. Exemplo: Como dois chefs compartilhando uma única e grande bancada de cozinha em vez de caminhar constantemente com dados pela sala para estações de preparo separadas.
  • Varredura paralela — Um algoritmo que divide um problema matemático passo a passo em pedaços para que várias vias de computação possam resolvê-los ao mesmo tempo. Exemplo: Como uma fileira inteira de pessoas somando partes separadas de uma longa lista simultaneamente, em vez de esperar uma pessoa fazer isso sequencialmente.

Por que isso importa

À medida que diferentes empresas constroem chips de computador especializados para inteligência artificial, reescrever software para cada chip individual é um grande gargalo. Ferramentas automatizadas que transferem conhecimento de desempenho antigo para novo hardware podem ajudar desenvolvedores a rodar modelos de IA locais mais rápido e com mais eficiência em dispositivos de consumo, como MacBooks.

O que ainda não sabemos

A pesquisa testou essa abordagem apenas em alguns kernels específicos, como atenção e Mamba SSM, e ainda não se sabe quão bem o método se generalizará para outros alvos de hardware e ecossistemas de software mais amplos.


Com base em reportagem de Berkeley AI Research Blog. Este é um texto explicativo independente, escrito com palavras próprias e auxílio de IA; Berkeley AI Research Blog não o revisou nem o endossou. Leia o original para ver todos os detalhes.