← Últimos artigos
🤖 machine learning

Escaping the Mode Lottery: Multi-Response Training Improves Language Model Generalization

Este artigo introduz o Treinamento de Múltiplas Respostas (MRT) como uma alternativa estatisticamente fundamentada ao ajuste fino padrão de resposta única, demonstrando que reter múltiplas conclusões válidas por comando melhora a generalização do modelo de linguagem ao capturar melhor as distribuições de saída condicionais e evitar a "loteria do modo" através de um compromisso de orçamento de variância principiado e estratégias ótimas de seleção de resposta.

Autores originais: Hasan Amin, Kian Ahrabian, Ming Yin, Rajiv Khanna

Publicado 2026-06-02
📖 1 min de leitura☕ Leitura rápida

Autores originais: Hasan Amin, Kian Ahrabian, Ming Yin, Rajiv Khanna

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um aluno a escrever uma história. No modo antigo de fazer as coisas (o que o artigo chama de Treinamento de Resposta Única), você dá ao aluno um comando como "Escreva uma história sobre um gato" e mostra a ele um único exemplo de uma boa história. Você diz: "Esta é a resposta".

O problema é que não existe apenas uma resposta certa. Você poderia escrever uma história engraçada, uma triste, um mistério ou uma aventura de ficção científica. Ao mostrar apenas uma versão, você está jogando uma "Loteria de Modos" (Mode Lottery). Você está essencialmente dizendo: "Tivemos sorte que esta história específica foi a que escolhemos para mostrar a você". Se o aluno vir apenas um tipo de história, ele pode pensar que essa é a *ún

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →