← Nieuwste papers
💬 NLP

StocksTalk: A Voice-Enabled Conversational Agent for Structured Query Generation over Web Data

StocksTalk is een transparante, spraakgestuurde conversationele agent die gesproken financiële verzoeken transformeert in gevalideerde, uitvoerbare SQL-queries door streaming spraakherkenning, retrieval-augmented constraint-extractie en interactieve human-in-the-loop verificatie te combineren om baseline LLM-benaderingen in nauwkeurigheid en stabiliteit te overtreffen.

Oorspronkelijke auteurs: Akshat Parmar, Vikranth Udandarao, Abhay Shakya, Tanmay Hire, Avinash Anand, Rajiv Ratn Shah, Daniel Wang Zhengkui

Gepubliceerd 2026-08-20
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Akshat Parmar, Vikranth Udandarao, Abhay Shakya, Tanmay Hire, Avinash Anand, Rajiv Ratn Shah, Daniel Wang Zhengkui

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de wereld van de financiële sector voelt het nemen van een beslissing vaak als het zoeken naar een speld in een hooiberg, maar de hooiberg bestaat uit miljoenen getallen en de speld is een specifiek patroon van groei of waarde. Decennialang hebben onderzoekers geprobeerd computers te leren menselijke taal te begrijpen, zodat iedereen een vraag kan stellen en een precies antwoord uit een database kan krijgen. Dit vakgebied, bekend als text-to-SQL, heeft als doel de rommelige, flexibele manier waarop mensen spreken te vertalen naar de rigide, exacte taal die computerdatabases vereisen. De meeste van deze systemen zijn echter getest onder stille, perfecte omstandigheden met geschreven tekst. Ze worstelen wanneer ze geconfronteerd worden met de realiteit van menselijke spraak, die vaak vol zit met achtergrondruis, accenten en de natuurlijke neiging om in onvolledige gedachten te spreken. In de hooggespannen arena van beleggen, waar één verkeerd begrepen getal tot een kostbare fout kan leiden, is de kloof tussen wat een persoon zegt en wat een computer uitvoert een gevaarlijke afgrond.

Een team van onderzoekers van IIIT-Delhi en het Singapore Institute of Technology heeft een nieuw systeem gebouwd genaamd StocksTalk om deze kloof te overbruggen. Ze hebben een spraakgestuurde assistent ontwikkeld die specif으로 is ontworpen om gesproken beleggingsideeën om te zetten in geldige, werkende database-queries. In tegen tegenstelling tot eerdere tools die wellicht de intentie van een gebruiker raden en hopen op het beste, is StocksTalk gebouwd om transparant en voorzichtig te zijn. Het behandelt het proces van het vinden van aandelen niet als een enkele logische sprong, maar als een reeks zorgvuldige stappen waarbij de computer zijn eigen werk controleert en de mens uitnodigt om dat ook te doen. Het systeem luistert naar een gebruiker die spreekt, breekt de zin af in specifieke financiële regels, controleert die regels tegen een realtime marktdatabase en laat vervolgens de gebruiker precies zien wat het van plan is te doen voordat het de zoekopdracht daadwerkelijk uitvoert.

De onderzoekers testten dit systeem met een zorgvuldig voorbereide set van 150 gesproken prompts, die drie verschillende soorten beleggingsstrategieën beslaan: het zoeken naar snelgroeiende bedrijven, het vinden van aandelen die regelmatige dividenden uitkeren, en het speuren naar ondergewaardeerde activa. Ze namen deze prompts op in twee zeer verschillende omgevingen: één in een stille kamer en één in een lawaaierige cafetaria om real-world afleidingen te simuleren. De resultaten toonden aan dat hoewel een standaard, niet-ondersteund AI-model ongeveer 81 procent van de tijd een query kon genereren zonder vast te lopen, het vaak antwoorden produceerde die logisch inconsistent of financieel onzinnig waren. Door lagen van verificatie toe te voegen en een methode te gebruiken om tijdens het proces specifieële financiële definities op te halen, verbeterde het systeem zijn vermogen om correcte queries te generen naar bijna 98 procent. Belangrijker nog was dat het vermogen van het systeem om op koers te blijven tijdens een heen-en-weer gesprek dramatisch verbeterde, van ongeveer 51 procent nauwkeurigheid naar bijna 89 procent wanneer de mens de mogelijkheid kreeg om de stappen te verifiëren.

De kern van het succes van het systeem ligt in de manier waarop het omgaat met de onzekerheid van menselijke spraak. Wanneer een gebruiker iets zegt als "vind grote technologie-aandelen met verbeterende marges", voert het systeem niet onmiddellijk een zoekopdracht uit. In plaats daarvan zet het de stem eerst om in tekst, en gebruikt het vervolgens een retrieval-systeem om precies op te zoeken wat "verbeterende marges" betekent in de context van de specifieke database die het gebruikt. Vervolgens construeert het een concept-query en toont deze aan de gebruiker op een dashboard. Dit dashboard toont de geëxtraheerde regels, de gekozen wiskundige operatoren en de uiteindelijke code die het van plan is uit te voeren. De gebruiker kan zien of de computer een getal of een categorie verkeerd heeft begrepen en dit corrigeren voordat de zoekopdracht begint. Deze "human-in-the-loop"-benadering bleek essentieel, vooral voor complexe verzoeken met meerdere voorwaarden, waarbij het systeem alleen in bijna één op de drie pogingen fouten zou maken.

De studie benadrukte ook dat de grootste hindernis de kwaliteit van de spraakherkenning zelf blijft. Wanneer de audio werd opgenomen in een lawaaierige omgeving, nam het vermogen van het systeem om specifieke getallen en financiële termen correct te identificeren aanzienlijk af, wat leidde tot meer fouten in de uiteindelijke query. Dit suggereert dat hoewel de logica- en verificatielagen robuust zijn, de eerste stap van het duidelijk horen van de gebruiker nog steeds het meest kwetsbare deel van de keten is. De onderzoekers vonden dat hun methode om het probleem op te splitsen in kleinere, verifieerbare fasen voorkwam dat het systeem kleine fouten omzette in grote mislukkingen. Bijvoorbeeld, in een gesprek met meerdere beurten waarin een gebruiker zijn zoekopdracht verfijnt, verloor het systeem zonder menselijke verificatie vaak het spoor van de oorspronkelijke beperkingen, terwijl de interactieve versie de juiste weg bijna 90 procent van de tijd behield.

Vooruitblikkend ziet het team de mogelijkheden om deze aanpak uit te breiden naar realtime nieuws en kwartaalcijfers, waardoor het systeem vragen kan beantwoorden zoals "welke bedrijven hebben hun winstverwachtingen van het afgelopen kwartaal overtroffen?" door verse data op te halen zodra deze binnenkomt. Ze zijn ook van plan om het systeem te laten vergelijken met de bestaande portefeuille van een gebruiker, wat meer gepersonaliseerd advies mogelijk maakt. Het werk laat zien dat voor complexe, hooggespannen taken de meest betrouwbare weg vooruit niet is om een machine te bouwen die probeert op zichzelf perfect te zijn, maar om een machine te bouwen die weet wanneer hij moet pauzeren, zijn werk moet tonen en om hulp moet vragen. Door het redeneerproces zichtbaar en bewerkbaar te maken, verandert StocksTalk een 'black box' van kunstmatige intelligentie in een collaboratieve tool, waardoor wordt gewaarborgd dat het uiteindelijke antwoord niet slechts een gok is, maar een geverifieerd feit dat klaar is voor de echte wereld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →