← Últimos artigos
🤖 machine learning

Online Conformal Prediction Beyond Feedback

Este artigo introduz o Online Conformal Prediction with Queries (OCPQ), um novo framework para quantificação de incerteza em fluxos de dados não-i.i.d. que opera sem feedback direto de previsões implantadas ao consultar rótulos estrategicamente, alcançando assim um regret sublinear e garantias de cobertura elevadas enquanto minimiza os custos de consulta.

Autores originais: Joar Skalse, Edoardo Pona, Osvaldo Simeone, Nicola Paoletti

Publicado 2026-08-10
📖 4 min de leitura☕ Leitura rápida

Autores originais: Joar Skalse, Edoardo Pona, Osvaldo Simeone, Nicola Paoletti

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô a navegar em um labirinto escuro e com neblina. Você quer que o robô seja confiante o suficiente para seguir em frente, mas cauteloso o suficiente para evitar bater nas paredes. No mundo da inteligência artificial, isso é chamado de "quantificação de incerteza". É a diferença entre um robô dizendo: "Tenho quase certeza de que aquilo é uma parede", e "Não tenho ideia, mas vou dar um palpite mesmo assim". Uma maneira popular de ensinar essa cautela é a "predição conformal", um método que não fornece apenas uma resposta única (como "é um gato"), mas oferece uma rede de segurança de respostas possíveis (como "é um gato, um cachorro ou uma raposa") que contém a verdade matematicamente garantida na maioria das vezes.

Normalmente, para melhorar nisso, o robô recebe feedback. Ele faz um palpite, e alguém (ou um sensor) lhe diz: "Sim, você acertou", ou "Não, você errou". O robô usa esse feedback para ajustar sua rede de segurança para a próxima rodada. Mas e se o robô estiver em uma situação onde ele nunca poderá receber feedback sobre seus palpites? Imagine um segurança que precisa decidir se uma pessoa é uma ameaça. Se o segurança palpitar "Ameaça", ele pode estar errado, mas ele não pode perguntar à pessoa: "Ei, você era realmente uma ameaça?", porque isso anularia o propósito da verificação de segurança. O segurança só consegue pedir a "resposta real" se decidir parar e chamar reforços, mas ele não pode fazer isso todas as vezes. Este é o complicado problema do "além do feedback": como aprender a ser seguro quando você não pode conferir seu trabalho?

Este artigo introduz um novo método inteligente chamado OCPQ (Predição Conformal Online com Consultas) para resolver exatamente esse enigma. Os pesquisadores tratam o problema como um jogo de alto risco onde o jogador tem duas escolhas a cada turno: ou faz uma previsão (e não recebe nenhum feedback) ou faz uma "consulta" para ver a resposta correta (mas não faz uma previsão para aquele turno). É como jogar um videogame onde você pode ou dar um tiro e torcer para acertar o alvo, ou pausar o jogo para olhar o mapa, mas não pode fazer as duas coisas ao mesmo tempo.

A equipe descobriu que, ao escolher aleatoriamente "pausar e olhar o mapa" (consultar) apenas uma fração minúscula das vezes — especificamente cerca de uma vez a cada T1/3T^{1/3} rodadas, onde TT é o número total de rodadas —, eles ainda conseguiam aprender o suficiente para serem incrivelmente precisos. Eles provaram matematicamente que, mesmo com essa pequena quantidade de espiadas, o método garante que a resposta verdadeira esteja incluída na rede de segurança do robô quase tão frequentemente quanto o usuário deseja (uma frequência definida pelo usuário β\beta). O "custo" dessa estratégia é que a rede de segurança pode ser ligeiramente maior do que se o robô tivesse feedback perfeito, mas a diferença diminui conforme o jogo avança.

Em seus experimentos, os pesquisadores testaram isso em dados do mundo real, incluindo imagens de dígitos manuscritos e comandos de texto para modelos de linguagem de grande escala (LLMs). Eles descobriram que, mesmo quando os dados mudavam inesperadamente (como um robô treinado em dias ensolarados tentando navegar na chuva) ou quando os dados eram deliberadamente traiçoeiros (ataques adversários), o OCPQ mantinha a rede de segurança confiável. Eles mostraram que, ao ajustar um único botão chamado β\beta, os usuários podiam decidir o quanto queriam priorizar ser seguro versus ser preciso. Os resultados sugerem que você não precisa verificar seu trabalho constantemente para ser seguro; às vezes, apenas verificar ocasionalmente é o suficiente para manter todo o sistema honesto, mesmo quando o mundo está tentando enganar você.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →