← Neueste Arbeiten
💰 quantitative finance

PHBench: A Benchmark for Predicting Startup Series A Funding from Product Hunt Launch Signals

Dieser Beitrag stellt PHBench vor, ein reproduzierbarer Benchmark, der 67.292 Product-Hunt-Launch-Signale mit Crunchbase-Finanzierungsdaten verknüpft, um nachzuweisen, dass strukturierte Launch-Daten Series-A-Ergebnisse statistisch vorhersagen, wobei ein Ensemble-Modell signifikante Leistungssteigerungen erzielt und gleichzeitig unerwartete Grenzen bei Zero-Shot-LLMs sowie die zeitliche Marktempfindlichkeit aufzeigt.

Ursprüngliche Autoren: Yagiz Ihlamur, Ben Griffin, Rick Chen

Veröffentlicht 2026-05-06
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Yagiz Ihlamur, Ben Griffin, Rick Chen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie sind ein Talent-Scout, der nach dem nächsten großen Ding in der Startup-Welt sucht. Sie haben eine massive Liste von 67.000 neuen Produkten, die gerade auf einer beliebten Website namens Product Hunt gestartet sind. Ihre Aufgabe ist es, zu erraten, welche wenigen dieser Produkte in den nächsten 18 Monaten eine massive Geldsumme (Series-A-Finanzierung) aufnehmen werden.

Das Problem? Nur etwa 1 von 128 dieser Produkte hat tatsächlich Erfolg. Es ist wie der Versuch, ein einziges goldenes Ticket in einer Fabrik voller Schokoladentafeln zu finden. Die meisten Menschen raten zufällig oder verlassen sich auf „Bauchgefühl", was nicht sehr zuverlässig ist.

Diese Arbeit stellt PHBench vor, eine neue „Wertungskarte" und eine Reihe von Werkzeugen, die entwickelt wurden, um dieses Ratespiel mit Mathematik und Daten statt mit Bauchgefühl zu lösen.

So haben sie es getan, einfach erklärt:

1. Die Karte erstellen (Der Datensatz)

Die Autoren sammelten eine massive Liste von 67.292 Produkten, die zwischen 2019 und 2025 auf Product Hunt vorgestellt wurden. Anschließend verglichen sie diese Liste mit einer riesigen Finanzdatenbank (Crunchbase), um zu sehen, welche dieser Unternehmen später tatsächlich Geld aufnahmen.

  • Das Ergebnis: Sie fanden 528 „Gewinner" (Unternehmen, die Series-A-Finanzierung aufnahmen).
  • Die Herausforderung: Da die Gewinner so selten sind (weniger als 1 %), ist dies ein sehr kniffliges Spiel. Wenn ein Modell einfach für alle „Nein" raten würde, läge es zwar in 99 % der Fälle richtig, wäre aber nutzlos.

2. Die Spielregeln (Der Benchmark)

Um sicherzustellen, dass die Modelle fair spielen, erstellten die Autoren einen strengen Satz von Regeln namens PHBench:

  • Der Trainingsplatz: Sie teilten die Daten so auf, dass die Modelle mit alten Daten üben können, aber an neuen, unbekannten Daten getestet werden (wie bei einer Abschlussprüfung).
  • Die Wertungskarte: Sie messen nicht nur, „wie oft Sie richtig lagen". Sie messen, wie gut Sie die Gewinner rangieren. Wenn Sie die Gewinnerunternehmen ganz oben auf Ihrer Liste platzieren, erhalten Sie eine hohe Punktzahl. Wenn Sie sie ganz unten begraben, erhalten Sie eine niedrige Punktzahl, selbst wenn Sie technisch „richtig" über die Verlierer lagen.
  • Die „F0.5"-Metrik: Dies ist ihre spezielle Bewertungsregel. Sie legt mehr Wert darauf, keine Zeit mit falschen Leads (False Positives) zu verschwenden, als einige Gewinner zu verpassen. Denken Sie an einen Sicherheitsbeamten: Es ist besser, ein paar verdächtige Personen passieren zu lassen, als 1.000 unschuldige Personen aufzuhalten.

3. Die Kandidaten: Mathematik vs. KI

Die Arbeit testete zwei Arten von „Ratern":

A. Die „Old-School"-Mathematikmodelle (Machine Learning)
Diese sind wie erfahrene Detektive, die auf spezifische Hinweise achten:

  • Wie viele Personen haben abgestimmt?
  • Wie viele Kommentare gab es?
  • An welchem Wochentag wurde gestartet?
  • Ist das Team groß?
  • Geht es beim Produkt um „B2B" (Business-to-Business) oder „KI"?

B. Die „Super-Smart"-KI (Large Language Models / LLMs)
Dies sind die neuesten, leistungsstärksten KI-Chatbots (wie Gemini). Die Forscher baten sie, dieselben Hinweise zu betrachten, ohne ihnen jedoch die Produktnamen oder Beschreibungen zu zeigen. Sie gaben der KI nur Zahlen (z. B. „500 Stimmen", „Rang #1"). Dies sollte zeigen, ob die KI die Antwort allein durch das Verständnis der Zahlen „wissen" konnte, ohne die Geschichte zu lesen.

4. Die Ergebnisse: Wer gewann?

Der Gewinner: Der Math-Detektiv (Ensemble-Modell)
Der beste Performer war ein „Team" aus drei Mathematikmodellen, die zusammenarbeiteten.

  • Die Strategie: Sie kombinierten verschiedene Modelle, um Fehler auszugleichen.
  • Die Punktzahl: Sie fanden die Gewinner etwa 4,7-mal besser als zufälliges Raten.
  • Kern-Erkenntnis: Die wichtigsten Hinweise waren nicht nur „wie viele Stimmen", sondern die Kombination aus einem großen Team plus hoher Engagement. Es ist wie bei einer Sportmannschaft: Ein großes Team mit einem Star-Spieler gewinnt eher als nur ein großes Team oder nur ein einzelner Star-Spieler.

Der Verlierer: Die Super-Smart-KI (LLMs)
Überraschenderweise schnitten die fortschrittlichsten KI-Modelle schlechter ab als die einfachen Mathematikmodelle und sogar schlechter als eine einfache statistische Basislinie.

  • Das Problem: Wenn man den Text (Namen, Beschreibungen) entfernt und der KI nur Zahlen gibt, gerät sie in Verwirrung. Sie verhält sich eher wie ein „Auswähler" als wie ein „Ranger". Sie mag zwar den einen offensichtlichen Gewinner ganz oben auf der Liste erkennen, versagt aber darin, den Rest der Liste korrekt zu sortieren.
  • Die Ironie: Die „klügste" KI (Gemini 3.1 Pro) schnitt tatsächlich am schlechtesten ab. Die Autoren vermuten, dass dies daran liegt, dass die KI bei der Eingabe nur von Zahlen überkorrigiert wurde, um zu vorsichtig zu sein.

5. Was uns dies über den Markt verrät

Die Daten sagten nicht nur Gewinner voraus; sie zeigten uns, wie sich der Markt bewegt:

  • Der Boom und Bust: Das Modell konnte den Finanzierungs-Boom von 2020–2021 und den Crash von 2022–2023 allein durch die Betrachtung der Launch-Signale „sehen". Dies beweist, dass die Daten real und nicht nur zufälliges Rauschen sind.
  • Das „Team"-Signal: Der größte Prädiktor für Erfolg war nicht die Produktidee selbst, sondern die Fähigkeit des Teams, eine Menge zu mobilisieren. Wenn ein großes Team ein Produkt startet und viele Stimmen erhält, ist es viel wahrscheinlicher, dass sie finanziert werden.
  • Die Nische zählt: Produkte in spezifischen Kategorien wie „APIs", „Zahlungen" und „Fintech" waren viel wahrscheinlicher finanziert als andere, unabhängig davon, wie viele Stimmen sie erhielten.

Zusammenfassung

PHBench ist ein neuer, offener Spielplatz, auf dem jeder seine Ideen zur Vorhersage von Startup-Erfolg testen kann. Die Arbeit beweist, dass:

  1. Launch-Signale zählen: Was in den ersten 24 Stunden auf Product Hunt passiert, vorhersagt zukünftige Finanzierungen.
  2. Mathematik schlägt „Black-Box"-KI (vorläufig): Wenn man nur Zahlen und keinen Text hat, sind traditionelle Mathematikmodelle viel besser darin, Muster zu finden, als die neuesten KI-Chatbots.
  3. Team + Hype = Erfolg: Das beste Signal ist ein großes Team, das viel Aufmerksamkeit erhält.

Die Autoren haben ihren gesamten Code, ihre Daten und ihre Regeln öffentlich gemacht, damit andere Forscher versuchen können, ihre Punktzahl zu schlagen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →