StocksTalk: A Voice-Enabled Conversational Agent for Structured Query Generation over Web Data
StocksTalk est un agent conversationnel vocal et transparent qui transforme les requêtes financières parlées en requêtes SQL validées et exécutables en combinant la reconnaissance vocale en continu, l'extraction de contraintes par recherche augmentée et une vérification interactive par l'humain dans la boucle afin de surpasser les approches de base des LLM en termes de précision et de stabilité.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Dans le monde de la finance, prendre une décision ressemble souvent à la recherche d'une aiguille dans une botte de foin, mais la botte de foin est composée de millions de chiffres, et l'aiguille est un motif spécifique de croissance ou de valeur. Pendant des décennies, des chercheurs ont tenté d'apprendre aux ordinateurs à comprendre le langage humain afin que n'importe qui puisse poser une question et obtenir une réponse précise à partir d'une base de données. Ce domaine, connu sous le nom de « text-to-SQL », vise à traduire la manière désordonnée et flexible dont les gens parlent en le langage rigide et exact qu'exigent les bases de données informatiques. Cependant, la plupart de ces systèmes ont été testés dans des conditions calmes et parfaites avec du texte écrit. Ils peinent face à la réalité de la parole humaine, qui est souvent remplie de bruits de fond, d'accents et de la tendance naturelle des gens à s'exprimer par pensées incomplètes. Dans l'arène à enjeux élevés de l'investissement, où un seul chiffre mal compris peut conduire à une erreur coûteuse, l'écart entre ce qu'une personne dit et ce qu'un ordinateur exécute est un gouffre dangereux.
Une équipe de chercheurs de l'IIIT-Delhi et de l'Institut de technologie de Singapour a construit un nouveau système appelé StocksTalk pour combler ce fossé. Ils ont créé un assistant piloté par la voix, conçu spécifiquement pour transformer des idées d'investissement exprimées oralement en requêtes de base de données valides et opérationnelles. Contraãt aux outils précédents qui pourraient deviner l'intention d'un utilisateur en espérant le meilleur, StocksTalk est conçu pour être transparent et prudent. Il traite le processus de recherche d'actions non pas comme un saut logique unique, mais comme une série d'étapes méticuleuses où l'ordinateur vérifie son propre travail et invite l'humain à faire de même. Le système écoute l'utilisateur parler, décompose la phrase en règles financières spécifiques, vérifie ces règles par rapport à une base de données de marché en temps réel, puis montre à l'utilisateur exactement ce qu'il prévoit de faire avant de lancer réellement la recherche.
Les chercheurs ont testé ce système avec un ensemble soigneusement préparé de 150 incitations vocales, couvrant trois types différents de stratégies d'investissement : la recherche d'entreprises à croissance rapide, la recherche d'actions versant des dividendes réguliers et la traque d'actifs sous-évalués. Ils ont enregistré ces incitations dans deux environnements très différents : l'un dans une pièce calme et l'autre dans une cafétéria bruyante pour simuler les distractions du monde réel. Les résultats ont montré que si un modèle d'intelligence artificielle standard, non assisté, pouvait générer une requête environ 81 pour cent du temps sans planter, il produisait souvent des réponses logiquement incohérentes ou financièrement absurdes. En ajoutant des couches de vérification et une méthode pour récupérer des définitions financières spécifiques au cours du processus, le système a amélioré sa capacité à générer des requêtes correctes pour atteindre près de 98 pour cent. Plus important encore, la capacité du système à rester sur la bonne voie lors d'une conversation interactive s'est considérablement améliorée, passant d'une précision d'environ 51 pour cent à près de 89 pour cent lorsque l'humain est autorisé à vérifier les étapes en cours de route.
Le succès central du système réside dans la manière dont il gère l'incertitude de la parole humaine. Lorsqu'un utilisateur dit quelque chose comme « trouve des actions technologiques de grande capitalisation avec des marges en amélioration », le système ne lance pas immédiatement une recherche. Au lieu de cela, il convertit d'abord la voix en texte, puis utilise un système de recherche pour déterminer exactement ce que signifie « marges en amélioration » dans le contexte de la base de données spécifique qu'il utilise. Il construit ensuite une requête provisoire et l'affiche à l'utilisateur sur un tableau de bord. Ce tableau de bord montre les règles extraites, les opérateurs mathématiques choisis et le code final qu'il a l'intention d'exécuter. L'utilisateur peut voir si l'ordinateur a mal compris un chiffre ou une catégorie et le corriger avant que la recherche ne commence. Cette approche de « l'humain dans la boucle » s'est avérée essentielle, particulièrement pour les demandes complexes impliquant plusieurs conditions, où le système seul aurait commis des erreurs dans près d'un cas sur trois.
L'étude a également souligné que le plus grand obstacle reste la qualité de la reconnaissance vocale elle-même. Lorsque l'audio a été enregistré dans un environnement bruyant, la capacité du système à identifier correctement les chiffres spécifiques et les termes financiers a chuté de manière significative, entraînant davantage d'erreurs dans la requête finale. Cela suggère que, bien que les couches de logique et de vérification soient robustes, l'étape initiale consistant à entendre clairement l'utilisateur est encore la partie la plus fragile de la chaîne. Les chercheurs ont constaté que leur méthode consistant à diviser le problème en étapes plus petites et vérifiables empêchait le système de transformer de petites erreurs en échecs majeurs. Par exemple, dans une conversation multi-tours où un utilisateur affine sa recherche, le système sans vérification humaine perdait souvent de vue les contraintes originales, alors que la version interactive maintenait le bon chemin près de 90 pour cent du temps.
À l'avenir, l'équipe envisage d'étendre cette approche pour inclure les actualités et les rapports de résultats en temps réel, permettant au système de répondre à des questions telles que « quelles entreprises ont dépassé leurs estimations de profit le trimestre dernier ? » en récupérant des données fraîches au fur et à mesure de leur arrivée. Ils prévoient également de permettre au système de comparer les nouvelles découvertes avec le portefeuille existant d'un utilisateur, permettant ainsi des conseils plus personnalisés. Ce travail démontre que, pour des tâches complexes et à enjeux élevés, la voie la plus fiable n'est pas de construire une machine qui tente d'être parfaite par elle-même, mais de construire une machine qui sait quand faire une pause, montrer son travail et demander de l'aide. En rendant le processus de raisonnement visible et éditable, StocksTalk transforme une boîte noire d'intelligence artificielle en un outil collaboratif, garantissant que la réponse finale n'est pas seulement une supposition, mais un fait vérifié prêt pour le monde réel.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.