Uma Abordagem Inovadora para Otimização
Uma das formas mais baratas e diretas de acelerar um grande modelo de linguagem é também uma das mais drásticas: apagar blocos inteiros de transformador. Como o modelo literalmente encurta, essa remoção de blocos, também conhecida como poda de profundidade, garante ganhos de velocidade previsíveis na inferência, além de economia de memória. A técnica se combina perfeitamente com quantização, compressão de baixo rank e outras abordagens. A dificuldade, no entanto, está em decidir quais blocos cortar. Remover os errados colapsa o modelo, e o efeito de tirar um bloco depende de quais outros são removidos ao mesmo tempo, criando uma interação entre as decisões. Isso torna o problema combinatório, não de ranking, e problemas combinatórios com variáveis binárias interativas são exatamente o terreno em que a física de sistemas de spins se mostrou eficaz.
Reformulação como um Problema de Otimização Binária Constraindo
O mais recente artigo de pesquisa, intitulado “LLM Compression by Block Removal with Constrained Binary Optimization”, leva essa correspondência a sério. Os autores reformulam a seleção de blocos como um problema de otimização binária restrita (CBO) que se mapeia diretamente para um vidro de Ising, um sistema de spins desordenado com interações de todos para todos e um número fixo de spins “para cima”. A energia desse sistema de spins revela-se uma forte e barata proxy para o desempenho real do modelo podado em benchmarks, permitindo ranquear um enorme número de configurações candidatas sem testar nenhuma delas, e encaminhar os casos mais difíceis para os mesmos solucionadores clássicos e inspirados em quântica utilizados em outras partes da Multiverse. No regime de compressão profunda, os ganhos são expressivos: em 50% de compressão do Llama-3.3-70B-Instruct, o método conquista quase 23 pontos percentuais a mais no benchmark MMLU em relação à melhor técnica concorrente de remoção de blocos.
Limitações dos Métodos Atuais
A maioria dos métodos de remoção de blocos existentes pontua cada bloco de forma independente e, em seguida, remove os que parecem menos importantes, usando heurísticas de magnitude, sensibilidade ou “influência de bloco”. Em termos de física, esses são métodos de campo médio: tratam cada bloco como se sua contribuição fosse independente dos outros, da mesma forma que a teoria do campo médio substitui os vizinhos de um spin por um único campo médio. Um atalho relacionado é remover apenas uma sequência consecutiva de blocos, o que mantém o problema pequeno, mas descarta a maioria do espaço de busca.
A Interação entre os Blocos
O problema é que os blocos não são independentes, assim como os spins em um ímã real não são. Se remover o bloco 20 prejudica o modelo depende de você também ter removido o bloco 19 ou o bloco 24, uma interação, ou acoplamento, entre as duas decisões. À medida que os modelos se tornam mais profundos e heterogêneos, ignorar esses acoplamentos deixa qualidade na mesa, especialmente quando se deseja remover muitos blocos de uma vez. O que se realmente quer é buscar combinações de blocos enquanto se considera como eles interagem, mas o número de combinações cresce exponencialmente, tornando a força bruta inviável. É exatamente nesse regime, com espaços de configuração exponencialmente grandes e acoplamentos pareados, que as ferramentas da física estatística brilham.
Modelagem com Variáveis Binárias e a Matriz Hess
Os autores atribuem uma variável binária a cada bloco de transformador: 0 significa mantê-lo, 1 significa removê-lo, como um spin que pode apontar para baixo ou para cima. Em seguida, realizam uma expansão em série de Taylor de segunda ordem da perda do modelo em relação a essas variáveis, o que produz uma matriz Hess (aproximada). A diagonal dessa matriz é o quanto cada blocso importa por si só; as entradas fora da diagonal são exatamente os acoplamentos pareados entre blocos, a física de muitos corpos que os métodos de campo médio descartam.
Equivalência Física e Praticidade Computacional
Essa reformulação transforma “quais blocos devo remover?” em uma otimização limpa: encontrar o conjunto de M blocos cuja remoção minimize a energia xᵀH⁰x, sujeito a remover exatamente M dos N blocos. Matematicamente, é um problema de otimização binária restrita; fisicamente, é um vidro de Ising, um sistema de spins acoplados de todos para todos com magnetização conservada (o número fixo de blocos removidos joga o papel de spin total fixo). A propriedade-chave que os autores estabelecem é que essa energia é um forte proxy para a qualidade final: estados de ba energia do sistema de spins correspondem a modelos podados de alto desempenho. Minimizar a energia e maximizar a pontuação do benchmark se tornam a mesma busca. A pratica desse método reside no custo: a matriz Hess, ou seja, o conjunto completo de acoplamentos, é calculada apenas uma vez, a partir de passos forward e backward em um pequeno conjunto de calibração. Depois disso, avaliar qualquer configuração candidata é um único cálculo barato de energia, sem necessidade de executar o modelo real, muito menos benchmarká-lo. Como os acoplamentos não dependem do alvo de compressão, a mesma matriz Hess pode ser reutilizada para resolver para muitos valores de M diferentes.
Escalabilidade e Resultados
Para a maioria dos modelos, o espaço de configuração é grande, mas ainda assim verificável. Como calcular uma energia é tão barato, eles forçam a força bruta em uma única GPU, verificando dezenas de bilhões de configurações de spins. Uns poucos milhões levam segundos; o caso mais difícil e aqui tratado, a remoção de 8 dos 80 blocos do Llama-3.3-70B (cerca de 29 bilhões de configurações), levou aproximadamente dois dias. Além disso, a abordagem se escala: na forma QUBO (a restrição absorvida em um termo de penalidade), a mesma tarefa pode ser entregue aos solucionadores clássicos, quânticos e inspirados em quântica altamente otimizados para essa classe de hamiltoniano. Os autores descobrem que um solucionador tabu de código aberto alcança confiavelmente os estados de menor energia em segundos, mesmo nos casos mais difíceis que podem ser verificados contra força bruta. Assim, o método se estende para modelos onde enumerar configurações é inviável, usando solucionadores que estão firmemente no domínio da Multiverse.
Com informações de: Hugging Face Blog