Ajuste fino de modelo 350M com GRPO melhora saídas estruturadas

O blog da Hugging Face publicou um guia que mostra como ajustar fino o modelo LFM2.5-350M usando a técnica Group Relative Policy Optimization (GRPO) para obter melhor desempenho em saídas estruturadas.

A geração de saídas que seguem exatamente um esquema JSON ou YAML é uma tarefa frequente em aplicações reais, mas poucos benchmarks medem essa capacidade isoladamente.

Para estabelecer uma linha de base, os autores serviram o modelo localmente com llama.cpp na versão BF16 GGUF e executaram o benchmark IFStruct em 2000 amostras, obtendo 22,6% de acerto, próximo aos 21,1% reportados originalmente.

O ajuste fino utilizou o dataset Nemotron-RL-instruction_following-structured_outputs, com cerca de 500 pares prompt esquema, e acrescentou um adaptador LoRA que treina aproximadamente seis milhões de parâmetros, ou 1,66% do total.

Foram definidas três funções de recompensa, cada uma numa escala de zero a um, que avaliam se a estrutura extraída está correta, e combinadas com pesos 1,0, 0,5 e 2,0.

O treinamento ocorreu por 100 passos, com oito gerações por grupo de