computing• 3 min de lectura7 de octubre de 2026

Cómo los modelos de IA Nemotron alcanzaron niveles de medalla de oro en matemáticas y programación

Los investigadores adaptaron los modelos base Nemotron en especialistas de alto nivel para competencias de matemáticas y programación. Al combinar el entrenamiento especializado con bucles de búsqueda y refinamiento, los sistemas alcanzaron puntuaciones de medalla de oro.

En resumen: Los investigadores adaptaron los modelos base Nemotron en especialistas de alto nivel para competencias de matemáticas y programación. Al combinar el entrenamiento especializado con bucles de búsqueda y refinamiento, los sistemas alcanzaron puntuaciones de medalla de oro.

Los sistemas de inteligencia artificial han alcanzado un nuevo hito al resolver pruebas matemáticas complejas y desafíos de programación informática al nivel de los mejores competidores humanos.

Qué ocurrió, en palabras sencillas

Equipos de Hugging Face y NVIDIA utilizaron modelos base Nemotron para crear sistemas especializados para la Olimpiada Internacional de Informática (IOI) y la Olimpiada Internacional de Matemáticas (IMO). Partiendo de modelos base Nemotron, los equipos utilizaron ajustes finos supervisados, aprendizaje por refuerzo y bucles de inferencia impulsados por retroalimentación para generar, evaluar y refinar respuestas. El sistema de programación se probó en una ejecución en vivo y no supervisada bajo restricciones humanas, mientras que las demostraciones del sistema matemático fueron calificadas por calificadores oficiales de la IMO. Ambos sistemas lograron puntuaciones que superaron los umbrales oficiales de medalla de oro.

Puntos clave

  • Receta de cuatro partes para la adaptación Los equipos comenzaron con un modelo base Nemotron, seleccionaron problemas específicos de un dominio con trazas de razonamiento, aplicaron métodos de entrenamiento como el ajuste fino supervisado y emparejaron al especialista con un bucle de inferencia para evaluar y mejorar las respuestas.
  • Resultados de la competencia de programación Para la programación, los investigadores entrenaron a dos especialistas llamados Nemotron-3-Nano-CC y Nemotron-3-Ultra-CC. Utilizando una estrategia iterativa llamada GenCorrect, los modelos mejoraron sus puntuaciones y cruzaron el umbral de oro en la IOI 2025.
  • Resultados de la competencia de matemáticas Para las matemáticas olímpicas, el equipo entrenó a especialistas utilizando conjuntos de datos que cubrían la generación, el refinamiento y la verificación de pruebas. El sistema final funcionó completamente en lenguaje natural sin herramientas externas y obtuvo 30 de 42 puntos.
  • Recursos compartidos para la comunidad El proyecto lanzó conjuntos de datos de entrenamiento, puntos de control de modelos, repositorios de código y puntos de referencia, incluido Nemotron-IMO-Bench, para ayudar a otros a reproducir y desarrollar el trabajo.

Términos explicados

  • Modelo base — Un modelo de inteligencia artificial grande y de propósito general que se puede adaptar a muchas tareas específicas diferentes. Ejemplo: Piénsalo como un lienzo en blanco que se puede entrenar para pintar retratos o paisajes.
  • Ajuste fino supervisado — Un proceso de entrenamiento en el que un modelo de IA aprende revisando problemas de ejemplo y respuestas correctas proporcionadas por humanos. Ejemplo: Como un estudiante que estudia problemas de tarea resueltos para aprender a resolver otros similares.
  • Aprendizaje por refuerzo — Un método para entrenar una IA mediante prueba y error, recompensándola por los pasos correctos y penalizándola por los errores. Ejemplo: Como enseñarle un truco a un perro dándole golosinas cuando actúa correctamente.
  • Bucle de inferencia — Un proceso en el que la IA genera una respuesta, la verifica en busca de errores y utiliza esa retroalimentación para volver a intentarlo. Ejemplo: Como escribir un ensayo, corregirlo y reescribir secciones para mejorarlo antes de entregarlo.

Por qué importa

Estos experimentos muestran una receta reproducible para convertir modelos generales de IA en especialistas confiables en dominios específicos. La liberación de estos modelos y códigos permite a la comunidad en general estudiar y aprovechar estas técnicas de razonamiento avanzado.

Lo que aún no sabemos

El resultado de la IOI fue un punto de referencia no oficial y no supervisado, y no se incluyó en la clasificación oficial de la IOI. Los sistemas se basaron en competencias y conjuntos de datos específicos, y las notas de origen señalan que los métodos de adaptación y los resultados variaron según la escala del modelo.


Basado en información de Hugging Face Blog. Este es un texto explicativo independiente, escrito con palabras propias y ayuda de IA; Hugging Face Blog no lo ha revisado ni respaldado. Lee el original para ver todos los detalles.