← Últimos artigos
🤖 AI

Policy Iteration with Human Feedback: Bringing Post-Training RL to In-context Learning

Este artigo apresenta a Iteração de Política com Feedback Humano (PIHF), um framework que utiliza um crítico de modelo de linguagem e supervisão de especialistas clínicos para refinar iterativamente políticas em linguagem natural para o diagnóstico de doenças raras, demonstrando ganhos significativos de desempenho através de diversos tamanhos de modelos sem alterar seus pesos subjacentes.

Autores originais: Minh-Ha Nguyen, Cathy Shyr

Publicado 2026-08-18
📖 1 min de leitura☕ Leitura rápida

Autores originais: Minh-Ha Nguyen, Cathy Shyr

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →