Desempenho mdio vs. confiabilidade

\n

Um agente ReAct baseado no GPT-4.1 foi avaliado no benchmark AppWorld. Ele alcan\u00e7ou uma precis\u00e3o mdia de 77,4% quando o teste foi executado cinco vezes (Mean@5). No entanto, o agente só teve sucesso em todas as cinco execu\u00e7\u00f5es para 53,0% das tarefas (Pass^5). A diferen\u00e7a de 24,4 pontos entre esses dois n\u00fameros \u00e9 chamada de gap de consist\u00eancia.

\n

Benchmarks tradicionais geralmente divulgam apenas a m\u00e9dia, o que pode ocultar essa variabilidade. O gap mostra que, mesmo quando um agente geralmente consegue resolver uma tarefa, ele pode falhar em uma nova execu\u00e7\u00e3o do mesmo pedido. Para aplica\u00e7\u00f5es cr\u00edticas, como a verifica\u00e7\u00e3o de transa\u00e7\u00f5es financeiras ou de contratos, essa inconsist\u00eancia pode ser um problema grave.

\n

Por que a consist\u00eancia \u00e9 um problema de forma de distribui\u00e7\u00e3o

\n

Cada deciso de um agente LLM surge de uma distribui\u00e7\u00e3o de probabilidade sobre os pr\u00f3ximos tokens. Quando a distribui\u00e7\u00e3o \u00e9 afunilada, a mesma escolha domina a maioria das execu\u00e7\u00f5es. Quando est\u00e1 dispersa, as escolhas s\u\u00e3o quase empatas, e pequenas flutua\u00e7\u00f5es na plataforma (precis\u00e3o de ponto flutuante da GPU, agrupamento de solicita\u00e7\u00f5es, entre outros) podem inverter o resultado.

\n

Mesmo com temperatura 0,0 e uma semente fixa, as probabilidades em um endpoint hospedado mudam ligeiramente entre as solicita\u00e7\u00f5es. Como um trajectory encadeia dezenas de passos de decis\u00e3o, uma pequena chance de invers\u00e3o por etapa pode se transformar em uma grande chance de que uma execu\u00e7\u00e3o siga um caminho diferente. \u00c9 essa variabilidade que cria o gap de consist\u00eancia.

\n

Diretrizes de consist\u00eancia na ALTK-Evolve

\n

Uma nova ferramenta chamada Consistency Analyzer detecta passos de alta incerteza em um trajectory gravado. O analisador executa um reamostramento controlado em cada etapa de decis\u00e3o, medindo a variabilidade da sa\u00edda do modelo. O resultado \u00e9 uma pontua\u00e7\u00e3o de consist\u00eancia que marca as decises de risco.

\n

Esses passos marcados se transformam em diretrizes de consist\u00eancia no formato padr\u00e3o da ALTK-Evolve, permitindo que o sistema armazene e recupere regras direcionadas. Um exemplo concreto para uma tarefa de notas do AppWorld \u00e9:

\n

    \n

  • Diretriz 1: Ao contar marcadores de caixa de sele\u00e7\u00e3o em conte\u00fado de nota, use uma express\u00e3o regular ancorada por linha em vez de uma contagem simples de substring, pois t\u00edtulos de nota repetem frequentemente o s\u00edmbolo do marcador em uma linha de legenda.
  • \n

  • Diretriz 2: Verifique sempre os resultados da busca por consultas de nota, buscando poss\u00edveis correspond\u00eancias m\u00faltiplas e confirmando a nota correta antes de prosseguir.
  • \n

\n

Essas diretrizes abordam erros comuns de contagem de strings e problemas de verifica\u00e7\u00e3o de busca que aparecem em toda a variedade de tarefas do AppWorld, aumentando diretamente a taxa Pass^K.

\n

Impacto

\n

A introdu\u00e7\u00e3o de diretrizes de consist\u00eancia melhora significativamente a confiabilidade de agentes baseados em LLMs. O pipeline n\u00e3o exige logs internos do modelo ou instrumenta\u00e7\u00e3o adicional alm da trajectory j\u00e1 existente, o que o torna pr\u00e1tico para implanta\u00e7\u00f5es do mundo real.

\n

A consist\u00eancia n\u00e3o \u00e9 apenas uma quest\u00e3o de amplitude de modelo, mas um eixo orthogonal que pode ser abordado com diretrizes direcionadas.

\n

Com informa\u00e7\u00f5es de: Hugging Face Blog