Design Arena 融资 790 万美元推动 AI 审美评估
TechCrunch AI··作者 Russell Brandom
关键信息
Design Arena 会让用户在网站、图片和其他视觉格式之间进行 A/B 对比,然后把结果从好到坏排序。公司表示,登录使用还能让它追踪不同地区以及随时间变化的审美差异,并将其定位为对自动化基准的补充,因为后者可能被“刷分”或操纵。
资讯摘要
Grace Li 说,这家公司最初出现在她 2025 年毕业前的几周,当时她和几位大学朋友正尝试把一个 AI 游戏引擎做出来。模型虽然能生成可运行的游戏,但作品并不好玩,这让团队开始思考:像“好玩”这样主观的东西到底该怎么衡量。后来他们得出的结论是,人工判断不可替代,于是开始研究如何大规模收集真实而可靠的反馈。这个想法最终演变成了 Design Arena,如今已经被全球 530 万人使用。
Li 表示,AI 行业很快证明自己非常需要可扩展的用户反馈,尤其是训练媒体生成模型的公司。她说,在意识到这一需求后大约一周,他们就与一家前沿实验室签下了第一笔大单,此后业务迅速扩张到 6000 万美元的年度经常性收入。周一,母公司 Intelligence 宣布完成 790 万美元种子轮融资,由 Index Ventures 领投,Conviction、A*、Valkyrie 等参与。对普通用户来说,这个产品有点像模型路由器;但对企业来说,真正的价值在于它能持续提供人类排名数据,即便公司也承认,众包反馈并不一定天然就是可持续的长期商业模式。

资讯正文
Design Arena 创始团队融资 790 万美元,为 AI 模型注入品味
联合创始人 Grace Li 表示,她的公司于 2025 年毕业前几周成立,当时她和几位大学朋友正努力让他们的 AI 游戏引擎运转起来。这些模型能够制作出功能正常的游戏,但没有一款游戏真正有趣——这就引出了一个有意思的问题:如何判断一款游戏是否有趣?
他们认为,人类判断无可替代,于是很快开始集思广益,寻找大规模获取真实人类反馈的方法。最终的成果就是 Design Arena——如今,这款 AI 工具已被全球 530 万人使用。事实证明,有大量 AI 公司正在寻找可规模化的用户反馈,其中许多公司也愿意为此付费。
“对于很多模型来说,这是它们想要在设计领域取得改进时缺失的瓶颈,”Li 说。“大约一周后,我们与一家前沿实验室完成了首笔重大交易,之后的事情就顺理成章了。”
周一,Design Arena 背后的公司 Intelligence 宣布完成 790 万美元种子轮融资。本轮融资由 Index Ventures 领投,Conviction(Sarah Guo 和 Mike Vernal)、A*、Valkyrie 及其他投资者参与。
对于非企业用户来说,使用 Design Arena 很像使用一个功能复杂的模型路由器。界面中有一个类似 ChatGPT 的提示词输入窗口,并分别提供网站、图像以及十几种其他视觉格式的下拉菜单。输入请求、格式和风格后,系统会展示一系列“A 对 B”的选择,直到你将这批输出从最好到最差排出名次。
这是一项实用的服务,但该平台真正的价值来自企业端:参与其中的模型可以把它当作媒体生成模型源源不断、即时获得反馈的渠道。用户通常并不在意自己正在评选的是哪一个模型——正如 Li 所说,他们只想得到最好的输出——因此,他们的排名能够为用户真正想要的内容提供关键输入。
Li 表示,对于前沿实验室而言,这是一项值得付费的服务。她还透露,该网站目前创造的年度经常性收入(ARR)为 6000 万美元,进一步巩固了其作为 AI 行业人类主导评估数据重要来源的地位。
至关重要的是,用户必须登录才能获取输出结果,因此 Intelligence 还可以追踪不同大洲以及不同时间段内用户品味的变化。(Li 指出,亚洲的网页仪表盘往往采用更加繁复的设计风格。)这些指标是自动化基准测试的重要补充。自动化基准测试能够以更大规模运行,但往往容易被“刷分”或以其他方式操纵;上周 Hugging Face 遭遇的安全漏洞就以一种极为明显的方式证明了这一点。
不过,这并不意味着众包式人类反馈必然会成为一个赢家市场。Yupp 在上线不到一年后,于今年早些时候关门停业;此前,该公司曾从 a16z crypto 的 Chris Dixon 融资 3300 万美元。Yupp 同样吸引了一些前沿模型成为客户,并表示用户数量已超过 130 万,但最终仍未能建立可持续的长期业务。
尽管如此,其他基于人工评估的初创公司似乎发展得相当不错。采用类似方法评估基于文本的回答的 LM Arena 于今年1月完成了1.5亿美元的 A 轮融资,而就在正式推出付费产品四个月后。
来源与参考
收录于 2026-08-04