← Últimos artigos
💬 NLP

Liberating LLM Capabilities in Full-Duplex Speech Models

Este artigo apresenta o Listen-Write-Speak (LWS), um novo paradigma de três canais focado em texto que permite que modelos de fala full-duplex ouçam, escrevam texto estruturado visível e falem simultaneamente em tempo real usando um LLM autorregressivo compartilhado sem mudanças arquiteturais, desbloqueando assim capacidades nativas de texto, como geração de código e raciocínio estruturado, enquanto mantém a responsividade conversacional.

Autores originais: Luoyuan Zhang, Bokai Xu, Junbo Cui, Weiyue Sun, Yingjing Xu, Hanyu Liu, Yuan Yao

Publicado 2026-06-09
📖 4 min de leitura☕ Leitura rápida

Autores originais: Luoyuan Zhang, Bokai Xu, Junbo Cui, Weiyue Sun, Yingjing Xu, Hanyu Liu, Yuan Yao

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está em uma reunião com um colega brilhante que também é um mestre da digitação. Atualmente, a maioria dos assistentes de voz de IA são como colegas que só conseguem falar. Se você pedir para eles escreverem um programa de computador complexo ou desenharem um gráfico detalhado, eles têm que descrever isso em voz alta: "Ok, comece com uma função, depois defina uma variável..." Isso é lento, difícil de acompanhar e você tem que anotar se quiser guardar a informação.

O artigo apresenta uma nova maneira para a IA falar chamada Listen-Write-Speak (LWS) [Ouvir-Escrever-Falar]. Pense nesta nova IA como um colega que faz três coisas ao mesmo tempo, perfeitamente sincronizadas:

  1. Ouvir (Listen): Eles ouvem você falando em tempo real, mesmo enquanto estão falando de volta para você.
  2. Escrever (Write): Enquanto ouvem e pensam, eles estão simultaneamente digitando seus pensamentos, código ou notas estruturadas em uma tela bem na sua frente.
  3. Falar (Speak): Ao mesmo tempo, eles falam um resumo conversacional e natural do que estão digitando.

A Analogia da "Rodovia de Três Faixas"

Os autores descrevem isso como um paradigma de tri-canal. Imagine uma rodovia de três faixas onde o tráfego flui em uma direção (a linha do tempo da conversa):

  • Faixa 1 (Ouvir): Esta faixa está sempre aberta. A IA nunca para de ouvir você, mesmo quando está falando. Isso permite uma interação "full-duplex", o que significa que você pode interromper a IA, e ela não ficará confusa nem parará de processar.
  • Faixa 2 (Escrita Visível): Esta é a faixa do "pensamento". Em vez de manter seus pensamentos escondidos dentro de uma caixa preta, a IA os digita em uma tela. Se você pedir um script em Python, o código aparece na tela instantaneamente. Se você pedir um resumo de reunião, uma tabela organizada aparece. Este é o "output de primeira classe", o que significa que é a principal forma da IA mostrar seu trabalho.
  • Faixa 3 (Falar): Esta faixa carrega a voz. A IA lê uma versão falada simplificada do que está digitando para que você possa ouvir a resposta enquanto lê os detalhes.

Como Funciona (O Truque de Mágica)

O artigo afirma que isso não requer a construção de um cérebro robótico novo e complicado. Em vez disso, eles usaram um Esquema de Tokens inteligente.

Pense na linguagem interna da IA como um conjunto de peças de LEGO. Normalmente, essas peças apenas constroem fala. Os pesquisadores inventaram "peças de instrução" especiais (como <unit>, <ls_cogn> e <speak>) que dizem à IA: "Agora, você está em um bloco de tempo de 1 segundo. Neste bloco, você deve ouvir este áudio, digitar este texto e dizer esta frase."

Ao organizar a conversa nesses pequenos blocos de tempo de 1 segundo (Unidades), a IA consegue equilibrar todas as três tarefas sem se confundir. É como um maestro dizendo a uma orquestra: "Para o próximo segundo, o violino toca, a flauta toca e o percussionista bate no tambor, tudo exatamente ao mesmo tempo."

O Que Eles Descobriram

Os pesquisadores testaram esta nova IA contra outros modelos de voz e descobriram que:

  • É uma melhor multitasker: Em testes que medem o quão bem a IA entende e raciocina enquanto fala, o LWS obteve pontuações mais altas do que modelos que apenas falam ou apenas pensam antes de falar.
  • É consistente: A IA não disse uma coisa e escreveu outra. Em 92,6% dos casos, o que ela falou coincidia perfeitamente com o que ela escreveu.
  • Lida bem com interrupções: Como ela continua ouvindo enquanto fala, se você a interromper, ela consegue lidar com a mudança de forma suave, sem travar ou esperar que você termine.

A Conclusão

O artigo argumenta que, ao permitir que a IA escreva o que pensa enquanto fala, obtemos o melhor dos dois mundos: a velocidade e a sensação natural de uma conversa de voz, combinadas com a precisão e a estrutura do texto escrito (como código ou tabelas de dados). Isso transforma a IA de uma "cabeça falante" em um "parceiro colaborativo" que mostra seu trabalho conforme avança.

Nota sobre Limitações: Os autores admitem que, como a IA tem que fazer tudo isso em tempo real (a cada segundo), ela pode não ser a melhor para tarefas de planejamento extremamente longas e complexas que exigem horas de pensamento profundo antes de falar. Além disso, atualmente, ela aceita apenas voz como entrada, não imagens ou arquivos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →