Lançamento do Qwen 3.8 27B gera expectativa

Um dos lançamentos mais aguardados da semana foi o Qwen 3.8 27B, um modelo de linguagem com capacidade de visão, licenciado sob Apache 2.0 e desenvolvido pelo laboratório de pesquisa Qwen, da Alibaba. Com 27 bilhões de parâmetros, o modelo chama a atenção por ser um tamanho excelente para execução em laptops com especificações razoáveis, especialmente quando se compara ao seu antecessor, o Qwen 3.6 27B, que já era considerado impressionante.

Benchmarks oficiais mostram salto de desempenho

De acordo com os dados divulgados pelo próprio Qwen, o novo modelo apresenta um desempenho significativamente superior tanto em relação ao Qwen 3.6 27B quanto ao modelo de pesos fechados Qwen 3.7-Plus, que era um dos mais fortes da empresa até maio deste ano. Será interessante ver o que os testes independentes terão a dizer sobre esses resultados.

Testes em hardware local revelam problema de configuração padrão

O autor do relato testou o modelo em duas máquinas diferentes: um MacBook Pro com chip M5 Max e 128GB de RAM, e um NVIDIA DGX Spark. Em ambos, utilizou o LM Studio com a build quantizada Q4_K_M de 17GB. Uma descoberta importante foi que a documentação do Qwen descreve o modelo como configurado por padrão para um esforço de raciocínio “extra alto”, uma opção que o LM Studio preservou em sua versão GGUF.

Configuração padrão causa lentidão extrema

Essa configuração padrão revelou-se problemática, especialmente em hardware de consumo. O autor inicialmente encontrou problemas com o limite de contexto padrão do LM Studio de 8.192 tokens, que o modelo consumia inteiramente para refletir sobre até as perguntas mais simples. Ao carregar o modelo com o comprimento de contexto máximo de 262.144 tokens, o problema foi resolvido. Em um teste para gerar um SVG de um pelicano andando de bicicleta, a primeira tentativa levou 21 minutos, utilizando 22.276 tokens de raciocínio para produzir apenas 3.223 tokens de saída.

Raciônio desligado traz ganho de velocidade

Em contraste, ao rodar o mesmo prompt com o raciocínio desligado, o modelo produziu 3.715 tokens em apenas 137 segundos, pouco mais de dois minutos. Para fins de comparação, o autor também utilizou o OpenRouter para executar o mesmo prompt no muito maior Qwen 3.8 2.4T-A95B, lançado na semana anterior, gerando um SVG animado.

Excesso de detalhe em tarefas simples

Outro exemplo ilustrativo foi uma solicitação simples por um SVG de um círculo. Com o configuração de raciocínio extra alto, o modelo iniciou seu trace de raciocínio planejando uma obra de arte elaborada, incluindo círculos concêntricos, marcas de compasso, gradientes e animações, completamente diferente do que foi pedido. O resultado foi um círculo animado absolutamente belo, mas que não correspondia à solicitação original.

Teste com detecção de bounding boxes é um sucesso

Uma forma divertida de testar o modelo de visão é verificar sua capacidade de retornar caixas delimitadoras (bounding boxes) ao redor de objetos em uma foto. O autor colocou o Qwen 3.8 27B à prova desenhando boxes ao redor de pelicanos, e os resultados foram extremamente precisos. Para visualizar esses boxes, ele pediu ao modelo para criar uma ferramenta personalizada HTML que, offline, no laptop, aceitasse uma URL de imagem e um JSON com coordenadas, escala-as de 0-1000 e desenha os boxes rotulados sobre a imagem.

Ferramenta gerada demonstra capacidade do modelo

Embora o autor tenha esquecido de reduzir o esforço de raciocínio, resultando em uma interfacesuper-engineered, o modelo conseguiu produzir a interface completa a partir de um único prompt. A ferramenta incluiu até uma função de “carregar amostra” que gera uma cena demo com siluetas de pelicanos, um recurso que o autor não havia solicitado, mas que o modelo adicionou de forma criativa ao interpretar a palavra “pelicanos” no exemplo de JSON.

Com informações de: Hacker News (Y Combinator)