Nova família de modelos densos focados em raciocínio
A IBM anunciou o lançamento da família Granite 4.2, sua primeira linha de grandes modelos de linguagem (LLMs) densos e apenas decodificadores projetados nativamente para raciocínio. A família chega em três tamanhos (3B, 8B e 30B) e é distribuída sob a licença Apache 2.0, permitindo uso comercial irrestrito. Diferente das gerações anteriores que eram fortes assistentes de seguimento de instrução, a versão 4.2 adiciona capacidade explícita de raciocínio, permitindo que cada modelo produza uma cadeia de pensamento antes da resposta final.
Arquitetura e pré-treinamento em larga escala
Todos os três modelos compartilham a mesma arquitetura transformer decoder only e seguem um pipeline de treinamento idêntico em suas respectivas escalas. O pré-treinamento do zero consumiu aproximadamente 15 trilhões de tokens em uma estratégia de cinco fases. As duas primeiras fases focam no treinamento fundacional, enquanto as fases três e quatro realizam treinamento intermediário com dados de qualidade progressivamente maior. A fase final introduz treinamento de contexto longo, estendendo a janela de contexto para 512 mil tokens. Cada fase utiliza uma mistura de dados distinta e cronograma de taxa de aprendizado próprio, migrando gradualmente de dados amplos da web para fontes mais curadas.
Ajuste fino supervisionado com foco em qualidade
A etapa de ajuste fino supervisionado (SFT) transforma o modelo base em um assistente confiável para seguir instruções, raciocinar e usar ferramentas. A mistura de dados combina 31,6% de dados agente e 68,4% de dados não agente, totalizando cerca de 7,2 milhões de amostras (aproximadamente 100 bilhões de tokens, dos quais 65 bilhões são treináveis). O corpus agente abrange engenharia de software (69%), chamadas de ferramentas (12,1%), uso de terminal (8%), matemática (3,5%), busca (0,8%) e ação (0,2%), gerados por scaffolds diversos como OpenHands, SWE agent, Terminus 2 e OpenResearcher.
O corpus não agente inclui seguimento de instrução (18,8%), programação (18,8%), matemática (14,6%), multilíngue (7%), ciência (5,4%), raciocínio (3%) e segurança (0,8%). Antes de entrar na mistura final, as amostras passam por rigoroso controle de qualidade: normalização para formato OpenAI Chat, avaliação por juízes LLM (GPT OSS 120B e Gemma 4) para remover alucinações e interações inválidas, aplicação de regras heurísticas específicas e desduplicação local e global baseada em hash SHA-256.
Pipeline de aprendizado por reforço em múltiplos estágios
O pós-treinamento emprega um pipeline de aprendizado por reforço (RL) em múltiplos estágios. O diferencial de capacidade mais nítido aparece aqui: os modelos 8B e 30B passam por um bloco adicional de RL agente, onde aprendem a operar como agentes autônomos em ambientes sandbox reais. Eles adquirem habilidades para chamar ferramentas, editar e executar código, dirigir terminais e realizar buscas na web. O modelo 3B, por sua vez, não passa por esta etapa agente específica.
Modos de pensamento e chamadas de função nativas
Todos os modelos Granite 4.2 possuem um interruptor entre modo pensamento e modo sem pensamento, além de um modo de baixo esforço que gasta um orçamento curto de raciocínio em questões fáceis. O suporte nativo a chamadas de ferramentas segue o formato de function calling da OpenAI, permitindo integração direta com endpoints compatíveis (como vLLM) e harnesses agente sem necessidade de camadas de adaptação. A família também conta com suporte nativo no SGLang, com receitas prontas para servir disponíveis no cookbook da biblioteca.
Os modelos são fortes tanto em raciocínio quanto em seguimento de instrução, com a divisão clara de capacidades agentes reservada aos tamanhos maiores através do treinamento por reforço em ambientes reais.
Com informações de: Hugging Face Blog