Como os modelos de IA Nemotron alcançaram níveis de medalha de ouro em matemática e programação
Pesquisadores adaptaram modelos de base Nemotron em especialistas de alto nível para competições de matemática e programação. Ao combinar treinamento especializado com loops de busca e refinamento, os sistemas alcançaram pontuações de medalha de ouro.
Resumo rápido: Pesquisadores adaptaram modelos de base Nemotron em especialistas de alto nível para competições de matemática e programação. Ao combinar treinamento especializado com loops de busca e refinamento, os sistemas alcançaram pontuações de medalha de ouro.
Os sistemas de inteligência artificial alcançaram um novo marco ao resolver provas matemáticas complexas e desafios de programação de computadores no nível dos melhores competidores humanos.
O que aconteceu, em palavras simples
Equipes da Hugging Face e da NVIDIA usaram modelos de base Nemotron para criar sistemas especializados para a Olimpíada Internacional de Informática (IOI) e a Olimpíada Internacional de Matemática (IMO). Partindo de modelos base Nemotron, as equipes usaram ajuste fino supervisionado, aprendizado por reforço e loops de inferência orientados por feedback para gerar, avaliar e refinai respostas. O sistema de programação foi testado em uma execução ao vivo e não supervisionada sob restrições humanas, enquanto as demonstrações do sistema matemático foram avaliadas por avaliadores oficiais da IMO. Ambos os sistemas alcançaram pontuações superiores aos limites oficiais de medalha de ouro.
Pontos principais
- Receita de quatro partes para adaptação As equipes começaram com um modelo base Nemotron, curaram problemas específicos de domínio com rastreamentos de raciocínio, aplicaram métodos de treinamento como ajuste fino supervisionado e associaram o especialista a um loop de inferência para avaliar e melhorar as respostas.
- Resultados em competições de programação Para programação, os pesquisadores treinaram dois especialistas chamados Nemotron-3-Nano-CC e Nemotron-3-Ultra-CC. Usando uma estratégia iterativa chamada GenCorrect, os modelos melhoraram suas pontuações e ultrapassaram o limite de ouro na IOI 2025.
- Resultados em competições de matemática Para a matemática olímpica, a equipe treinou especialistas usando conjuntos de dados que cobrem a geração de provas, refinamento e verificação. O sistema final funcionou inteiramente em linguagem natural, sem ferramentas externas, e pontuou 30 de 42 pontos.
- Recursos compartilhados para a comunidade O projeto lançou conjuntos de dados de treinamento, pontos de verificação de modelos, repositórios de código e benchmarks, incluindo o Nemotron-IMO-Bench, para ajudar outros a reproduzir e expandir o trabalho.
Termos explicados
- Modelo de base — Um modelo de inteligência artificial grande e de propósito geral que pode ser adaptado para muitas tarefas específicas diferentes. Exemplo: Pense nisso como uma tela em branco que pode ser treinada para pintar retratos ou paisagens.
- Ajuste fino supervisionado — Um processo de treinamento onde um modelo de IA aprende revisando problemas de exemplo e respostas corretas fornecidas por humanos. Exemplo: Como um estudante estudando problemas de lição de casa resolvidos para aprender a resolver outros semelhantes.
- Aprendizado por reforço — Um método de treinar uma IA por meio de tentativa e erro, recompensando-a por etapas corretas e penalizando-a por erros. Exemplo: Como ensinar um truque a um cão dando-lhe petiscos quando ele se comporta corretamente.
- Loop de inferência — Um processo onde a IA gera uma resposta, verifica erros e usa esse feedback para tentar novamente. Exemplo: Como escrever uma redação, revisá-la e reescrever seções para torná-la melhor antes de entregá-la.
Por que isso importa
Esses experimentos mostram uma receita reproduzível para transformar modelos gerais de IA em especialistas confiáveis em domínios específicos. A liberação desses modelos e códigos permite que a comunidade em geral estude e construa sobre essas técnicas avançadas de raciocínio.
O que ainda não sabemos
O resultado da IOI foi um benchmark não oficial e não supervisionado, não sendo incluído no ranking oficial da IOI. Os sistemas confiaram em competições e conjuntos de dados específicos, e as notas de origem observam que os métodos de adaptação e os resultados variaram dependendo da escala do modelo.
Com base em reportagem de Hugging Face Blog. Este é um texto explicativo independente, escrito com palavras próprias e auxílio de IA; Hugging Face Blog não o revisou nem o endossou. Leia o original para ver todos os detalhes.