← 最新论文
💰 quantitative finance

PHBench: A Benchmark for Predicting Startup Series A Funding from Product Hunt Launch Signals

本文介绍了 PHBench,这是一个可复现的基准测试,它将 67,292 个 Product Hunt 发布信号与 Crunchbase 融资记录相链接,以证明结构化发布数据能够统计预测 A 轮融资结果,集成模型在实现显著性能提升的同时,也揭示了零样本大语言模型在时间市场敏感性方面的意外局限。

原作者: Yagiz Ihlamur, Ben Griffin, Rick Chen

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Yagiz Ihlamur, Ben Griffin, Rick Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位人才发掘者,正在寻找初创世界中的下一个大热门。你手头有一份庞大的名单,列出了在知名网站Product Hunt上刚刚发布的 67,000 款新产品。你的任务是预测其中哪几款将在未来 18 个月内筹集到巨额资金(A 轮融资)。

问题在于?这些产品中只有大约1/128最终能成功。这就像在一整家巧克力工厂里寻找一张唯一的金色奖券。大多数人要么随机猜测,要么依赖“直觉”,而后者并不可靠。

这篇论文介绍了PHBench,这是一套新的“记分卡”和工具集,旨在利用数学和数据而非直觉来解决这个猜测游戏。

以下是他们如何做到的简单解释:

1. 绘制地图(数据集)

作者收集了 2019 年至 2025 年间在 Product Hunt 上featured 的 67,292 款产品的庞大列表。随后,他们将这份名单与庞大的金融数据库(Crunchbase)进行交叉比对,以查看哪些公司后来确实筹集到了资金。

  • 结果: 他们找到了 528 个“赢家”(即获得 A 轮融资的公司)。
  • 挑战: 由于赢家如此罕见(少于 1%),这是一个非常棘手的游戏。如果一个模型对所有人都猜“否”,它 99% 的时间都是对的,但这毫无用处。

2. 游戏规则(基准)

为了确保模型公平竞争,作者制定了一套严格的规则,称为PHBench

  • 训练场: 他们将数据拆分,让模型在旧数据上练习,但在新数据(如期末考试)上进行测试。
  • 记分卡: 他们不仅仅衡量“你猜对多少次”,而是衡量你给赢家排名的准确度。如果你将获胜公司排在名单的最顶端,你会得到高分;如果你将它们埋在最底部,即使你在技术上对“输家”的判断是正确的,你的得分也会很低。
  • "F0.5"指标: 这是他们特殊的评分规则。它更看重不浪费时间在虚假线索(假阳性)上,而不是错过少数几个赢家。这就像一名保安:让几个可疑的人通过,总比阻止 1,000 个无辜的人要好。

3. 竞争者:数学 vs. 人工智能

论文测试了两类“猜测者”:

A. “老派”数学模型(机器学习)
这些就像经验丰富的侦探,会查看具体的线索:

  • 有多少人投票?
  • 有多少条评论?
  • 他们在星期几发布?
  • 团队规模大吗?
  • 产品是关于"B2B"(企业对企业)还是"AI"?

B. “超级智能”AI(大型语言模型 / LLMs)
这些是最新、最强大的 AI 聊天机器人(如 Gemini)。研究人员让它们查看相同的线索,但让它们阅读产品名称或描述。他们只给 AI 提供数字(例如"500 票”、“排名第 1")。这是为了测试 AI 是否能在不阅读故事的情况下,仅通过理解数字来“知道”答案。

4. 结果:谁赢了?

赢家:数学侦探(集成模型)
表现最好的是三个数学模型协同工作的“团队”。

  • 策略: 它们结合了不同的模型以平滑误差。
  • 得分: 它们发现赢家的能力比随机猜测高出约4.7 倍
  • 关键洞察: 最重要的线索不仅仅是“有多少票”,而是大团队加上高参与度组合。这就像一支运动队:拥有一名明星球员的大团队,比仅仅是一支大团队或仅仅是一名明星球员更有可能获胜。

输家:超级智能 AI(LLMs)
令人惊讶的是,最先进的 AI 模型表现不如简单的数学模型,甚至比基本的统计基准还要差。

  • 问题: 当你剥离文本(名称、描述)只给 AI 数字时,它会感到困惑。它表现得像一个“挑选者”而不是“排名者”。它可能会在名单的最顶端认出那一个显而易见的赢家,但无法正确排序名单的其余部分。
  • 讽刺的是: “最聪明”的 AI(Gemini 3.1 Pro)实际上表现最差。作者认为,这可能是因为当只给数字时,AI 被过度修正得过于谨慎。

5. 这告诉我们要关于市场的什么

数据不仅预测了赢家,还向我们展示了市场是如何运作的:

  • 繁荣与萧条: 该模型仅通过观察发布信号,就能“看到”2020–2021 年的融资繁荣和 2022–2023 年的崩盘。这证明了数据是真实的,而不仅仅是随机噪声。
  • “团队”信号: 成功的最大预测因素不是产品创意本身,而是团队动员人群的能力。如果一个大团队发布产品并获得大量投票,他们获得融资的可能性要大得多。
  • 利基市场很重要: 在"API"、“支付”和“金融科技”等特定类别中的产品,无论获得多少投票,都比其他类别更有可能获得融资。

总结

PHBench是一个新的、开放的游乐场,任何人都可以在其中测试预测初创企业成功的方法。论文证明了:

  1. 发布信号很重要: Product Hunt 上最初 24 小时内发生的事情确实能预测未来的融资。
  2. 数学胜过“黑盒”AI(就目前而言): 当你只有数字而没有文本时,传统的数学模型比最新的 AI 聊天机器人更擅长发现模式。
  3. 团队 + 热度 = 成功: 最好的信号是一个大团队获得了大量关注。

作者已公开了所有代码、数据和规则,以便其他研究人员尝试超越他们的得分。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →