NeoMME revoluciona recuperação de documentos visuais com arquitetura unificada
A equipe da Hugging Face apresenta NeoMME, uma família de modelos de codificação multimodal e multilíngue com 260 milhões e 800 milhões de parâmetros. Diferentemente de modelos visuais generativos tradicionais, NeoMME não depende de uma visão pré-treinada separada ou de um modelo de linguagem causa. Um único transformer bidirecional processa tokens de texto e patches de imagem em um fluxo único, sendo treinado do zero com uma máscara de difusão discreta.
O desempenho é otimizado para recuperação de documentos visuais, seguindo a metodologia page-image de ColPali. NeoMME-Retriever gera embeddings densos e de interação tardia em uma única passagem. Ambos os tamanhos dos modelos estão na fronteira de Pareto de ViDoRe v3 para nDCG@10 e eficiência de tamanho. Em uma GPU NVIDIA L40S com entrada de 2048×2048, o modelo de 260M codifica cerca de 51 páginas por segundo, duas vezes mais rápido que ColModernVBERT. Técnicas como pooling hierárquico e quantização assimétrica reduzem o armazenamento de embeddings de interação tardia de 1,5 MB para 6 kB por página, mantendo mais de 95% do nDCG@10 de referência.
O pré-treinamento de NeoMME combina texto multilíngue, código, matemática, imagens naturais e documentos. Cada modelo processa aproximadamente 524 bilhões de tokens de entrada compactados, incluindo 290 bilhões de tokens apenas de texto. Devido ao orçamento limitado de tokens comparado ao ModernBERT (2 trilhões de tokens), a equipe adotou o otimizador NorMuon para melhorar a eficiência dos dados.
Metodologia e contexto técnico
NeoMME é pronunciado ‘nee-oh-me’ (IPA /ˈniː.oʊ.mi/). Sua arquitetura permite que imagens e texto compartilhem o mesmo caminho computacional, facilitando pré-treinamento, ajuste fino, paralelismo e implantação. A premissa básica é evitar o overhead de modelos de linguagem causa ou visão separados, otimizando a eficiência computacional.
Para treinamento, o pré-processo aplica taxas de corrosão variando entre 0,3 e 1,0 em exemplos multimodais. Patches de imagem permanecem visíveis enquanto o modelo reconstrói tokens de texto mascarados. Taxas baixas permitem prever palavras a partir do contexto textual, enquanto taxas altas forçam a associação com conteúdo visual.
Resultados e aplicações
Em benchmarks ViDoRe v1 e v2, NeoMME-Retriever-260M supera ColModernVBERT e ColSmol-500M. Em ViDoRe v3, o modelo de 260M atinge 0,523 de nDCG@10, próximo ao ColQwen2.5 com 14× menos parâmetros. O modelo de 800M atinge 0,556, apenas 0,009 abaixo de Vultron Retriever Flash (0,8B) e também na fronteira de Pareto.
A vantagem competitiva inclui compatibilidade com bibliotecas open-source como NextPlaid e o armazenamento de interação tardia otimizado para grandes bases de dados. Omar Khattab, pioneiro da interação tardia em ColBERT, e Amélie Chatelain, especialista em recuperação de informações, contribuem para a teoria por trás dessa abordagem.
Com informações de: Hugging Face Blog