← Nieuwste papers
💰 quantitative finance

PHBench: A Benchmark for Predicting Startup Series A Funding from Product Hunt Launch Signals

Dit artikel introduceert PHBench, een reproduceerbare benchmark die 67.292 Product Hunt-lanceringssignalen koppelt aan Crunchbase-financieringsrecords om aan te tonen dat gestructureerde lanceringsdata statistisch Series A-uitkomsten voorspelt, waarbij aanzienlijke prestatiewinst wordt behaald met een ensemble-model, terwijl onverwachte beperkingen in zero-shot LLM's en temporele marktsensitiviteit worden blootgelegd.

Oorspronkelijke auteurs: Yagiz Ihlamur, Ben Griffin, Rick Chen

Gepubliceerd 2026-05-06
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yagiz Ihlamur, Ben Griffin, Rick Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een talentzoeker bent op zoek naar de volgende grote doorbraak in de startupwereld. Je hebt een enorme lijst van 67.000 nieuwe producten die zojuist zijn gelanceerd op een populaire website genaamd Product Hunt. Jouw taak is om te raden welke enkele van deze producten binnen de komende 18 maanden een enorm bedrag aan geld zullen ophalen (Series A-financiering).

Het probleem? Slechts ongeveer 1 op de 128 van deze producten slaagt er echt in. Het is alsof je probeert één gouden ticket te vinden in een fabriek vol chocoladerepen. De meeste mensen raden willekeurig, of vertrouwen op een "buikgevoel", wat niet erg betrouwbaar is.

Dit artikel introduceert PHBench, een nieuwe "scorekaart" en een set tools die zijn ontworpen om dit raadsel op te lossen met wiskunde en data in plaats van buikgevoel.

Hier is hoe ze het deden, eenvoudig uitgelegd:

1. De kaart bouwen (De dataset)

De auteurs verzamelden een enorme lijst van 67.292 producten die tussen 2019 en 2025 op Product Hunt werden uitgelicht. Vervolgens kruisten ze deze lijst met een gigantische financiële database (Crunchbase) om te zien welke van die bedrijven later daadwerkelijk geld ophaalden.

  • Het resultaat: Ze vonden 528 "winnaars" (bedrijven die Series A-financiering ophaalden).
  • De uitdaging: Omdat de winnaars zo zeldzaam zijn (minder dan 1%), is het een zeer lastig spel om te spelen. Als een model voor iedereen "Nee" zou raden, zou het 99% van de tijd gelijk hebben, maar zou het nutteloos zijn.

2. De spelregels (De benchmark)

Om ervoor te zorgen dat de modellen eerlijk spelen, creëerden de auteurs een strenge set regels genaamd PHBench:

  • De trainingsgrond: Ze splitsten de data zodat modellen kunnen oefenen met oude data, maar worden getest op nieuwe, onbekende data (zoals een eindexamen).
  • De scorekaart: Ze meten niet alleen "hoe vaak je gelijk had". Ze meten hoe goed je de winnaars rangschikt. Als je de winnende bedrijven helemaal bovenaan je lijst zet, krijg je een hoge score. Als je ze onderaan begraaft, krijg je een lage score, zelfs als je technisch "goed" was over de verliezers.
  • De "F0.5"-metriek: Dit is hun speciale scoringsregel. Het geeft meer gewicht aan het niet verspillen van tijd aan valse aanwijzingen (false positives) dan aan het missen van een paar winnaars. Denk hierbij aan een beveiligingsagent: het is beter om een paar verdachte mensen door te laten dan 1.000 onschuldige mensen te stoppen.

3. De kandidaten: Wiskunde versus AI

Het artikel testte twee soorten "raders":

A. De "oude school" wiskundige modellen (Machine Learning)
Deze zijn als ervaren detectives die kijken naar specifieke aanwijzingen:

  • Hoeveel mensen hebben gestemd?
  • Hoeveel reacties waren er?
  • Op welke dag van de week lanceerden ze?
  • Is het team groot?
  • Gaat het product over "B2B" (business-to-business) of "AI"?

B. De "super slimme" AI (Grote Taalmodellen / LLM's)
Dit zijn de nieuwste, krachtigste AI-chatbots (zoals Gemini). De onderzoekers vroegen hen om naar dezelfde aanwijzingen te kijken, maar zonder hen de productnamen of beschrijvingen te laten lezen. Ze gaven de AI alleen cijfers (bijvoorbeeld "500 stemmen", "Rang #1"). Dit was om te zien of de AI het antwoord kon "weten" alleen door de cijfers te begrijpen, zonder het verhaal te lezen.

4. De resultaten: Wie won?

De winnaar: De wiskundige detective (Ensemble-model)
De beste presteerder was een "team" van drie wiskundige modellen die samenwerkten.

  • De strategie: Ze combineerden verschillende modellen om de fouten te gladstrijken.
  • De score: Ze vonden de winnaars ongeveer 4,7 keer beter dan willekeurig raden.
  • Kerninzicht: De belangrijkste aanwijzingen waren niet alleen "hoeveel stemmen", maar de combinatie van een groot team plus hoge betrokkenheid. Het is als een sportteam: een groot team met een sterrenspeler heeft meer kans om te winnen dan alleen een groot team of alleen een sterrenspeler.

De verliezer: De super slimme AI (LLM's)
Verrassend presteerden de meest geavanceerde AI-modellen slechter dan de eenvoudige wiskundige modellen en zelfs slechter dan een basis statistisch uitgangspunt.

  • Het probleem: Als je de tekst (namen, beschrijvingen) verwijdert en de AI alleen cijfers geeft, raakt het in de war. Het gedraagt zich als een "kiezer" in plaats van een "rangschikker". Het kan misschien de één voor de hand liggende winnaar helemaal bovenaan de lijst spotten, maar faalt erin de rest van de lijst correct te sorteren.
  • De ironie: De "slimste" AI (Gemini 3.1 Pro) presteerde eigenlijk het slechtst. De auteurs suggereren dat dit misschien komt doordat de AI te voorzichtig werd gecorrigeerd toen het alleen cijfers kreeg.

5. Wat dit ons vertelt over de markt

De data voorspelde niet alleen winnaars; het liet ons zien hoe de markt beweegt:

  • De boom en de bust: Het model kon de financieringsboom van 2020–2021 en de crash van 2022–2023 "zien" alleen door te kijken naar lanceringssignalen. Dit bewijst dat de data echt is en niet zomaar willekeurige ruis.
  • Het "team"-signaal: De grootste voorspeller van succes was niet het productidee zelf, maar het vermogen van het team om een menigte te mobiliseren. Als een groot team een product lanceert en veel stemmen krijgt, is de kans veel groter dat ze gefinancierd worden.
  • De niche doet er toe: Producten in specifieke categorieën zoals "API's", "Betalingen" en "Fintech" hadden veel meer kans om gefinancierd te worden dan andere, ongeacht hoeveel stemmen ze kregen.

Samenvatting

PHBench is een nieuwe, open speelplaats waar iedereen zijn ideeën kan testen voor het voorspellen van startupsucces. Het artikel bewijst dat:

  1. Lanceringssignalen tellen: Wat er in de eerste 24 uur op Product Hunt gebeurt, voorspelt toekomstige financiering.
  2. Wiskunde wint van "Black Box" AI (voorlopig): Als je alleen cijfers hebt en geen tekst, zijn traditionele wiskundige modellen veel beter in het vinden van patronen dan de nieuwste AI-chatbots.
  3. Team + Hype = Succes: Het beste signaal is een groot team dat veel aandacht krijgt.

De auteurs hebben al hun code, data en regels openbaar gemaakt zodat andere onderzoekers kunnen proberen hun score te verslaan.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →