← Últimos artigos
💻 computer science

Uncertainty Quantification for LLM Function-Calling

Este trabalho apresenta a primeira avaliação de métodos de Quantificação de Incerteza (UQ) para a chamada de funções em LLMs, demonstrando que técnicas de múltiplas amostras não superam métodos simples neste cenário, a menos que sejam adaptadas para considerar a estrutura sintática e semântica específica das saídas de chamadas de função.

Autores originais: Zihuiwen Ye, Lukas Aichberger, Michael Kirchhof, Sinead Williamson, Luca Zappella, Yarin Gal, Arno Blaas, Adam Golinski

Publicado 2026-04-28
📖 3 min de leitura☕ Leitura rápida

Autores originais: Zihuiwen Ye, Lukas Aichberger, Michael Kirchhof, Sinead Williamson, Luca Zappella, Yarin Gal, Arno Blaas, Adam Golinski

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você contratou um assistente digital super inteligente para cuidar das suas finanças e da sua casa. Ele pode pagar contas, deletar arquivos ou fazer compras. O problema é: e se ele tiver certeza absoluta de que está fazendo a coisa certa, mas estiver cometendo um erro terrível?

Este artigo científico trata exatamente disso: como medir o "nível de dúvida" (chamado de Quantificação de Incerteza) de uma Inteligência Artificial (IA) antes de ela apertar o botão "confirmar" em uma ação importante.

Aqui está uma explicação simples do que os pesquisadores descobriram:


1. O Problema: O Assistente "Confiante demais"

Imagine um estagiário que, quando não sabe a resposta, não diz "não sei", mas sim inventa uma resposta com uma cara de quem sabe tudo. Na computação, chamamos isso de "alucinação". Se esse estagiário for uma IA que tem acesso ao seu cartão de crédito, um erro de "confiança" pode custar caro.

Os pesquisadores queriam saber: Como podemos criar um "termômetro de dúvida" para a IA? Se o termômetro marcar "muita dúvida", o sistema deve parar e perguntar: "Ei, humano, você pode conferir isso para mim?"

2. A Descoberta: "Menos é Mais"

Existem duas formas principais de medir essa dúvida:

  • O Método do "Várias Opções" (Multi-sample): É como perguntar a mesma coisa para 10 pessoas diferentes. Se as 10 responderem coisas diferentes, você sabe que o assunto é incerto.
  • O Método do "Olhar de Detetive" (Single-sample): É como olhar para uma única resposta e analisar cada palavra, vendo o quanto a IA "hesitou" ao escolher cada termo.

A surpresa: Os pesquisadores descobriram que, para tarefas de "chamar funções" (como comandos de computador), o método de perguntar para 10 pessoas era muito lento e não era muito melhor do que o método do "detetive". Ou seja, analisar a hesitação de uma única resposta já era suficiente e muito mais rápido!

3. A Solução Criativa: O Filtro de "Palavras que Importam"

Aqui está a parte mais genial do estudo. Eles perceberam que a IA gasta muita "energia de dúvida" em coisas inúteis.

A Analogia do GPS:
Imagine que você está seguindo um GPS. Se o GPS disser: "Em 500 metros, vire à esquerda na Rua das Flores".

  • A palavra "na" ou "a" não importa muito. Se o GPS hesitar um milésimo de segundo entre "na" ou "em", não muda nada.
  • Mas a palavra "esquerda" ou "Rua das Flores" é CRUCIAL. Se o GPS hesitar aqui, você pode bater o carro.

Os pesquisadores criaram um filtro chamado SMT (Semantically Meaningful Tokens). Eles ensinaram o sistema a ignorar a dúvida em palavras "bobas" (como parênteses, vírgulas ou espaços) e focar toda a atenção da "medição de dúvida" nas palavras que realmente mudam o comando (como o nome da função, o valor do dinheiro ou o nome da pessoa).

Resumo da Ópera

O estudo concluiu que:

  1. Não precisamos gastar muito tempo fazendo a IA repetir a mesma tarefa várias vezes para saber se ela está em dúvida.
  2. Podemos ser muito mais precisos se ensinarmos o "termômetro de dúvida" a ignorar o ruído (detalhes técnicos inúteis) e focar no sinal (as informações que realmente importam para a ação).

Resultado final: Com essa técnica, o "termômetro" fica muito mais afiado, ajudando a evitar que a IA cometa erros irreversíveis por pura excesso de confiança.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →