ECN-BENCH: Design, Systems Engineering, and a Forensic Audit of Multi-Agent Forecasting
Die ECN-BENCH-Arbeit präsentiert ein Systems Engineering Audit eines Multi-Agenten-Prognose-Testbeds, das aufzeigt, dass die LLM-basierte Wahlichkeitsextraktion hochgradig sensitiv gegenüber Konfigurationsentscheidungen und der Auswahl des Evaluators ist, wodurch die Zuverlässigkeit nahezu uniformer Prognosen untergraben und die statistische Signifikanz vergleichender Leistungsergebnisse eingeschränkt wird.