Modelos de linguagem superaram a capacidade humana em conversas há anos, mas a automação prometida ainda não se materializou em escala. Essa questão motivou a criação da TypeSafe AI, empresa fundada por um ex-pesquisador da OpenAI que ajudou a desenvolver os métodos por trás do ChatGPT. Após dois anos de trabalho silencioso, a startup anuncia seu primeiro modelo da classe System One, projetado para tomar decisões estruturadas e rápidas que softwares podem usar diretamente.
O modelo, chamado Jev, foi lançado nesta terça-feira em acesso antecipado. Segundo a empresa, ele atinge níveis de inteligência semelhantes aos de grandes modelos de linguagem (LLMs) em tarefas de tomada de decisão, mas é duas ordens de grandeza mais rápido e eficiente. A diferença principal: Jev não gera texto livre e é otimizado para saídas estruturadas, eliminando o risco de alucinações.
A TypeSafe AI construiu uma arquitetura completamente nova, com um amostrador paralelo para máxima eficiência e um método de treinamento chamado Reinforcement Learning for Calibrated Decisions (RLCD). Em vez de gerar tokens de forma autorregressiva como os LLMs tradicionais, Jev calcula todas as probabilidades em paralelo. Segundo a empresa, a entrega de strings é poderosa, mas custosa. Ao abrir mão dela, o modelo ganha velocidade e precisão para integração com código.
Em testes comparativos, a empresa usou o GPT-5.6 Terra com raciocínio padrão como referência, por considerá-lo o mais comparável em inteligência. Em uma demonstração lado a lado, a única divergência entre Jev e o modelo da OpenAI foi sobre o nível de probabilidade de churn (cancelamento de cliente), uma questão considerada genuinamente ambígua pela equipe.
Para medir o desempenho dentro de código, a TypeSafe criou uma nova metodologia de avaliação. Em vez de otimizar para uma classificação de verdade absoluta, a empresa assume que existe um grafo de computação correto (um workflow representado em código) e usa as previsões dos modelos externos mais inteligentes como probabilidades de referência. A média do GPT-6 Astra e do Fable 5.1 foi usada como resposta de referência, o que, segundo a empresa, tende a favorecer os modelos da OpenAI e da Anthropic.
Jev dominou a fronteira de Pareto em quase duas ordens de grandeza nessas avaliações. As chamadas testadas são mais complexas que as demonstrações iniciais e representam os tipos de carga de trabalho de produção necessários para automação empresarial real. A partir desses testes, a empresa chegou aos números divulgados em sua página inicial: 193,6 vezes mais rápido e 444,6 vezes mais barato que os modelos concorrentes.
A TypeSafe AI reconhece que os workflows avaliados foram criados por membros de sua equipe de capacitação de modelos, o que pode introduzir algum viés, mas afirma que o conteúdo não foi deliberadamente escolhido para favorecer o Jev e não está na distribuição de treinamento. Os LLMs foram testados usando um wrapper System One, que os obriga a produzir decisões estruturadas compatíveis com a API da empresa, método considerado o mais preciso para extrair decisões de modelos de linguagem, embora mais lento e caro.
A relação entre alucinação e segurança de tipo é intrínseca, segundo a empresa. Para automação, a segurança de tipo é um requisito básico. Uma chamada de ferramenta alucinada pode ser inconveniente em um agente autônomo, mas é um problema fatal em sistemas com garantias de latência ou em fluxos profundos de processamento.
Com informações de: Hacker News (Y Combinator)