Opti-Q: A Constraint-Based Optimization Framework for Multi-LLM Question Planning
Dit artikel presenteert OPTI-Q, een op databases geïnspireerd, kostengebaseerd optimalisatiekader dat een statistische catalogus (PERFDB) gebruikt om optimale multi-LLM uitvoeringsplannen te genereren en te selecteren, waarbij de antwoordkwaliteit aanzienlijk wordt verbeterd terwijl voldaan wordt aan door de gebruiker gedefinieerde beperkingen met betrekking tot kosten, latentie en energie.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Technische Samenvatting: Opti-Q: Een Constraint-gebaseerd Optimalisatieframework voor Multi-LLM Vraagplanning
1. Probleemstelling
De inzet van Large Language Models (LLMs) voor Question Answering (QA) staat voor aanzienlijke uitdagingen met betrekking tot nondeterminisme, heterogene resourceprofielen (financiële kosten, latentie, energie) en variërende prestaties over verschillende typen vragen. Hoewel recent werk suggereert dat gecoördineerde multi-LLM samenwerking beter kan presteren dan een enkel "beste" model, leiden naïeve executiestrategieën (bijv. altijd alle modellen bevragen of vaste cascades gebruiken) vaak tot inefficiënt resourcegebruik, hogere kosten en suboptimale antwoordkwaliteit.
Huidige orchestratieframeworks (bijv. LangChain, DSPy) vertrouwen vaak op door ontwikkelaars gescripte workflows of dynamische, kortzichtige beslissingen tijdens de uitvoering zonder rekening te houden met downstream gevolgen. Er is een gebrek aan systemen die multi-LLM orchestratie behandelen als een kosten-gebaseerd, multi-objectief query-planningsprobleem waarbij het optimale executieplan (sequentieel, parallel of hybride) wordt geselecteerd vóór de uitvoering op basis van door de gebruiker opgegeven restricties (budget, latentie, energie) en gewenste antwoordkwaliteit (QoA).
2. Methodologie: Het OPTI-Q Framework
OPTI-Q is een database-geïnspireerde, kosten-gebaseerde optimizer die een "plan-vóór-executie" paradigma implementeert voor multi-LLM QA. Het modelleert het probleem als een Multi-Objective Optimization (MOO) taak waarbij het doel is om Pareto-optimale plannen te vinden die QoA balanceren tegen financiële kosten, latentie en energie.
A. Modellering en Formalisering
- Vraagmodel: Een vraag wordt gedefinieerd door een prompt, onderwerp en gebruikersrestricties () en een gewichtsvector voor de prioritering van doelstellingen.
- Planmodel: Plannen worden gerepresenteerd als Directed Acyclic Graphs (DAGs) waarbij knopen LLM-invocaties (fysieke operatoren) zijn en randen de datastroom representeren.
- Sequentiële Operatoren: Passen tussenliggende antwoorden als context door naar opeenvolgende modellen.
- Parallelle Operatoren: Voeren meerdere modellen gelijktijdig uit.
- Blending Operatoren: Mergen outputs van parallelle takken met behulp van een specifieke "blender" model.
- Optimalisatiedoel: Maximaliseer onderhevig aan gebruikersrestricties.
B. Kerncomponenten
PERFDB (Statistiekencatalogus):
- Een prestatiedatabase die offline en incrementeel wordt gevuld vanuit benchmarks en executietraces.
- Slaat statistieken op (QoA, kosten, latentie, energie) voor individuele LLM's en samengestelde subplannen, gekoppeld aan de executiecontext (onderwerp, operatortype, model).
- Maakt pre-executie schatting van planmetrieken mogelijk zonder het plan uit te voeren. Het gaat omgaan met stochasticiteit door variantieschattingen en betrouwbaarheidsintervallen op te slaan.
Kosten-Baten Schatting:
- Token Schatting: Voorspelt input/output token-aantallen op basis van model-specifieke tokenizers en historische outputlengtes om kosten te schatten.
- QoA Schatting: Gebruikt een onderwerp-geconditioneerde lookup in PERFDB. Voor samengestelde plannen worden multiplicatieve relatieve effectfactoren (voor sequentiële stappen) en gemiddelde relatieve veranderingsfactoren (voor blending) toegepast, afgeleid van historische traces, om de kwaliteit van het volledige plan te schatten.
- Resource Schatting: Berekent financiële kosten (vast + variabel per token), energie (proportioneel aan tokens) en latentie (lineair met tokenvolume, parallelle takken nemen de maximale tijd).
Plan Generatie en Zoektocht:
- Encoding: Plannen worden compact gecodeerd als een connectiviteitskaart (adjacency matrix) en een model toewijzingsvector.
- Zoekruimte: De ruimte van mogelijke plannen is combinatorisch en NP-hard te optimaliseren via exhaustieve zoektocht.
- Optimalisatie Engines: OPTI-Q ondersteunt een "pluggable" engine met drie strategieën:
- Dynamic Programming (DP): Exacte solver voor kleine instanties; gebruikt pruning om de state-space explosie te beheersen.
- Hill Climbing (HC): Lichtgewicht greedy heuristiek voor snelle, lokale zoektocht.
- NSGA-II: Een multi-objectief evolutionair algoritme dat als standaard wordt gebruikt voor grote planruimtes om de Pareto-front te benaderen.
- Selectie: De optimizer genereert een set niet-gedomineerde haalbare plannen. Het uiteindelijke plan wordt geselecteerd op basis van gebruikersgewichten toegepast op genormaliseerde doelstellingen.
C. Implementatie
- Systeem: Modulair framework dat een optimizer integreert met een executie-engine.
- Modellen: Getest met vijf open-source modellen (Gemma-3:27B, LLaMA3-ChatQA, Qwen2.5, Phi-4, Mistral) die lokaal draaien via Ollama.
- Blending: Gebruikt Gemma-3:27B als de aangewezen blender, wat de gespecialiseerde componenten zoals GenFuser overtreft in validatie.
- Prompting: Maakt gebruik van Zero-Shot prompting met specifieke context en blending prompts om modelgedrag te sturen.
3. Belangrijkste Bijdragen
- Kosten/Baten Formulering: Een formalisering van multi-LLM QA planning als een geconstraineerd multi-objectief optimalisatieprobleem, dat expliciet QoA, kosten, latentie en energie balanceert.
- Statistieken-gestuurde Optimizer: Een systeem dat sequentiële/parallelle/hybride workflows enumereert en pruneert, en de kwaliteit en resourcekosten vóór uitvoering schat met behulp van een historische statistiekencatalogus (PERFDB).
- Geïntegreerd Systeem: Een werkend prototype dat vragen dynamisch routeert over open-source LLM's, waarbij optimale executiegrafen in real-time worden geselecteerd.
4. Experimentele Resultaten
Het framework werd geëvalueerd op MMLU-Pro (multiple-choice) en SimpleQA (open-ended) benchmarks tegen vier state-of-the-art baselines (ThriftLLM, LLM-Ensemble, FrugalGPT, LLM-Blender).
- Prestatiewinst: Onder door de gebruiker opgegeven budgetten verbeterde OPTI-Q de gemiddelde QoA met ≈58% op SimpleQA en ≈41% op MMLU-Pro vergeleken met de sterkste budget-bewuste baselines bij gelijkwaardige kosten per vraag.
- Schaalbaarheid: NSGA-II bood de beste schaalbaarheid-kwaliteit trade-off, waarbij een bijna referentie-Pareto front kwaliteit werd behouden met planningstijden in de lage tientallen seconden (bijv. 21s voor operaties).
- Robuustheid tegen Datageschaarsheid: In "cold-start" scenario's (Level 0 PERFDB dekking) presteerde OPTI-Q nog steeds beter dan de baselines. Naarmate de historische data toenam (Levels 1–4), verbeterde de QoA significant (bijv. +66.7% op MMLU-Pro), en namen de fouten in de resource schatting scherp af.
- Budget Naleving: Het systeem handhaafde een hoge budget naleving (88–96%), waarbij overschrijdingen primair werden gedreven door kosten in plaats van latentie.
- Vergelijking met Commerciële API's: OPTI-Q behaalde een hogere QoA dan commerciële modellen (bijv. Claude Opus 4.6, GPT 5.4) op SimpleQA, terwijl het aanzienlijk minder kostte (respectievelijk 37.8× en 14.5× minder, rekening houdend met externe serverkosten). Op MMLU-Pro behaalde het competitieve kwaliteit (0.82 vs. 0.871 voor Gemini 3.5 Flash) tegen een fractie van de kosten.
5. Betekenis en Claims
Het artikel claimt dat database-stijl planning betere kwaliteit–resource trade-offs oplevert voor multi-LLM QA vergeleken met dynamische, kortzichtige orchestratie of vaste ensembles.
- Paradigmaverschuiving: Het demonstreert dat het behandelen van LLM orchestratie als een declaratieve query planning taak, in plaats van een procedurele scripting taak, zorgt voor een dynamische, vraag-specifieke adaptatie die de nut maximaliseert onder restricties.
- Praktische Leefbaarheid: De resultaten suggereren dat gestructureerde, statistieken-gestuurde planning een praktisch fundament biedt voor adaptieve LLM orchestratie, waardoor systemen prestaties en efficiëntie kunnen balanceren zonder te vertroueren op dure, hoog-capacitaire commerciële API's.
- Toekomstig Potentieel: De auteurs stellen dat deze "plan-vóór-executie" abstractie kan worden uitgebreid van QA naar rijkere Retrieval-Augmented Generation (RAG) en agentic workflows, mits nieuwe operatoren met vergelijkbare kosten-baten profielen in de statistiekencatalogus kunnen worden gekarakteriseerd.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.