Nova Geração de Modelos GPT‑6

A OpenAI expandiu o ecossistema GPT‑6 com o lançamento do GPT‑6 Sol e do GPT‑6 Luna. Os dois novos modelos seguem os mesmos métodos de treinamento do GPT‑6 Astra, transferindo avanços em desempenho profissional, precisão factual, programação, uso de computador e alinhamento para soluções mais rápidas e acessíveis. Essa abordagem permite que mais usuários aproveitem a inteligência de última geração sem a necessidade de modelos de alto custo.

Ambos os modelos lideram a curva custo‑inteligência, combinando capacidades excepcionais com infraestrutura otimizada para entrega em escala. Melhorias em caching e inferência reduziram os custos operacionais, permitindo uma queda de 50% nos preços das APIs do Sol e da Luna em relação às tarifas promocionais do GPT‑5.6. Os cortes de preço são transferidos diretamente para clientes, tornando a IA avançada viável para um conjunto mais amplo de tarefas cotidianas.

No AutomationBench, o GPT‑6 Sol supera o Claude Opus 5 em tarefas de alto esforço, alcançando desempenho similar a apenas 9% do custo por tarefa. O GPT‑6 Luna registra ganhos de 5.4 pontos percentuais em relação ao seu antecessor, com reduções de 58% no custo por tarefa. O Sol também supera o Claude Fable 5.1 a um preço muito inferior, superando até mesmo o GPT‑6 Astra em cenários de baixo esforço.

Em avaliações como o Agents’ Last Exam, o GPT‑6 Sol atinge 56.4% de precisão no esforço máximo, superando o Claude Opus 5 com uma economia de 60% no custo por tarefa. No que diz respeito à precisão factual, o Sol comete aproximadamente metade dos erros do modelo anterior, aproximando-se da confiabilidade do Astra a uma fração do custo. O Luna também mostra ganhos significativos, igualando o desempenho do GPT‑5.6 Sol a um custo cerca de cem vezes menor.

No campo da programação, o GPT‑6 Sol avança consideravelmente sobre o GPT‑5.6 Sol em métricas como FrontierCode e DeepSWE v1.1. No DeepSWE, o Sol atinge 68.8% de precisão no esforço máximo, apenas 1.1 pontos percentuais abaixo do Claude Fable 5 (69.9%) a um custo aproximadamente 80% inferior. O Luna alcança 66.6% de precisão, comparável ao Claude Opus 5 e ao Fable 5 em esforço médio, com custos 93% e 96% mais baixos, respectivamente.

Em termos de uso de computador, o GPT‑6 Sol alcança resultados comparáveis ao Claude Opus 5 no OSWorld 2.0 offline a um custo cerca de 80% menor. O Luna (esforço máximo) supera o GPT‑5.6 Sol (esforço médio) a um custo equivalente a um décimo. Ambos os modelos herdam o estilo de comunicação aprimorado do Astra, apresentando menos jargão, frases menos estranhas e respostas mais concisas sem perda de conteúdo.

A OpenAI também otimizou o caching de prompts para toda a família GPT‑6, aumentando as taxas de acerto e oferecendo um desconto de 90% em leituras de tokens de entrada armazenados. Os desenvolvedores podem monitorar o uso do cache por meio do Prompt Caching Dashboard e utilizar ferramentas de diagnóstico para identificar oportunidades perdidas. A capacidade de ajustar o esforço de raciocínio e a disponibilidade de ferramentas preserva o contexto armazenado, dando maior flexibilidade na construção de aplicações.

Com informações de: Hacker News (Y Combinator)