Tecnología• 3 min de lectura7 de octubre de 2026

Transferencia de experiencia en computación de IA de CUDA a Apple Silicon

Los investigadores crearon un sistema que adapta automáticamente código de IA de alto rendimiento del ecosistema CUDA de NVIDIA para ejecutarse eficientemente en chips Apple Silicon. Este método igualó el rendimiento de nivel experto en tareas de atención y aceleró las tareas de prellenado de Mamba.

En resumen: Los investigadores crearon un sistema que adapta automáticamente código de IA de alto rendimiento del ecosistema CUDA de NVIDIA para ejecutarse eficientemente en chips Apple Silicon. Este método igualó el rendimiento de nivel experto en tareas de atención y aceleró las tareas de prellenado de Mamba.

Escribir código de bajo nivel para hacer que los chips gráficos ejecuten inteligencia artificial de manera eficiente es notoriamente difícil. Ahora, una nueva herramienta de inteligencia artificial utiliza conocimientos informáticos pasados para cerrar la brecha entre diferentes chips de computadora sin requerir años de trabajo manual.

Qué ocurrió, en palabras sencillas

Investigadores de IBM Research y UC Berkeley Sky Lab actualizaron una herramienta de optimización de inteligencia artificial llamada K-Search para que funcione con el marco de aprendizaje automático de Apple llamado MLX. Debido a que los sistemas más antiguos como CUDA de NVIDIA tienen décadas de experiencia en código ajustado a mano, el equipo construyó una capa de traducción estructurada. Esta capa mapea reglas de hardware y límites de memoria, permitiendo que un modelo de IA tome el código existente y lo reescriba en núcleos de GPU de alto rendimiento para chips Apple Silicon. Al ser probado, el nuevo método logró un rendimiento cercano al de un experto en núcleos de atención y proporcionó una aceleración de prellenado de hasta 20 veces en el núcleo del modelo de espacio de estados Mamba en comparación con una implementación de la comunidad.

Puntos clave

  • Los núcleos de GPU son cruciales para la IA Los núcleos de GPU son programas de bajo nivel que se ejecutan dentro de procesadores gráficos para manejar cargas de trabajo pesadas de IA, pero escribir versiones eficientes requiere años de experiencia.
  • Adaptación de K-Search para Apple Silicon Los investigadores ampliaron K-Search, un marco de optimización evolutiva que utiliza un gran modelo de lenguaje, añadiendo un backend que compila y ejecuta código en Apple Silicon.
  • Cerrando la brecha con una capa de traducción Una capa de traducción estructurada proporciona a la IA tablas de mapeo de conceptos y reglas arquitectónicas, ayudándola a convertir código antiguo de NVIDIA en código Apple Metal válido y de alta calidad.
  • Fuertes ganancias de velocidad en hardware real El núcleo de atención recién generado alcanzó 0.97 veces la velocidad del núcleo nativo de Apple, y el núcleo Mamba SSM logró una aceleración de prellenado de hasta 20 veces en comparación con el paquete comunitario mlx-lm.

Términos explicados

  • Núcleo de GPU — Un programa especializado de bajo nivel que le indica a una unidad de procesamiento gráfico cómo realizar una operación matemática específica para la inteligencia artificial. Ejemplo: Como una receta que le dice al personal de una cocina exactamente cómo picar verduras simultáneamente en lugar de una por una.
  • Arquitectura de memoria unificada — Un diseño de sistema donde el procesador y el chip gráfico comparten el mismo grupo de memoria, eliminando la necesidad de copiar datos de un lado a otro. Ejemplo: Como dos chefs compartiendo una sola encimera de cocina grande en lugar de caminar constantemente con datos por la habitación hacia estaciones de preparación separadas.
  • Escaneo paralelo — Un algoritmo que divide un problema matemático paso a paso en piezas para que múltiples carriles de computación puedan resolverlos al mismo tiempo. Ejemplo: Como toda una fila de personas sumando partes separadas de una lista larga simultáneamente en lugar de esperar a que una persona lo haga secuencialmente.

Por qué importa

A medida que diferentes empresas construyen chips de computadora especializados para inteligencia artificial, reescribir software para cada chip individual es un cuello de botella importante. Las herramientas automatizadas que transfieren el conocimiento de rendimiento antiguo al nuevo hardware pueden ayudar a los desarrolladores a ejecutar modelos de IA locales de manera más rápida y eficiente en dispositivos de consumo como MacBooks.

Lo que aún no sabemos

La investigación solo probó este enfoque en un par de núcleos específicos, como los de atención y Mamba SSM, y aún se desconoce qué tan bien se generalizará el método a otros objetivos de hardware y ecosistemas de software más amplios.


Basado en información de Berkeley AI Research Blog. Este es un texto explicativo independiente, escrito con palabras propias y ayuda de IA; Berkeley AI Research Blog no lo ha revisado ni respaldado. Lee el original para ver todos los detalles.