从“不好玩”的游戏引擎到年入6000万美元:Intelligence如何用人类反馈破解AI设计瓶颈

科技区角 2026-08-04 04:00

【科技24时区】当Grace Li在2025年毕业前夕与几位大学好友试图让他们的AI游戏引擎跑通时,他们遭遇了一个既具体又抽象的困境:模型生成的游戏功能完备,却毫无乐趣可言。这引出了一个直击灵魂的问题——如何量化“好玩”?团队最终认定,人类的直觉判断无可替代,于是开始构思一种能大规模获取真实人类反馈的机制。这一初衷催生了DesignArena,如今这款AI工具已在全球拥有530万用户。

有趣的是,市场痛点远比他们预想的广泛。大量AI公司苦于缺乏可扩展的用户反馈渠道,并愿意为此买单。“这是许多模型在设计领域实现迭代的关键瓶颈,”Li回忆道,“大约一周后,我们就与一家前沿实验室达成了首笔重大交易,此后便一发不可收拾。”周一,DesignArena背后的母公司Intelligence宣布完成790万美元种子轮融资,由Index Ventures领投,Conviction(Sarah Guo和Mike Vernal)、A*、Valkyrie等机构跟投。

对于非企业用户而言,使用DesignArena的体验类似于操作一个高级模型路由器。界面提供类似ChatGPT的提示词输入框,并设有针对网站、图像及其他十余种视觉格式的下拉菜单。用户提交请求及风格偏好后,系统会呈现一系列“A vs. B”的二选一选项,直至用户对少量输出结果完成从优到劣的排序。这项服务看似简单,但其核心价值在于企业端:参与其中的媒体生成模型可将此平台视为源源不断的即时反馈源。由于普通用户通常不在意背后是哪个模型在运作,只追求最佳输出效果,这种基于偏好的排序能为“用户真正想要什么”提供至关重要的数据输入。

对前沿实验室来说,这是一项值得付费的服务。Li透露,该平台目前年化经常性收入(ARR)已达6000万美元,稳固了其作为AI行业人类主导评估数据关键来源的地位。更微妙的是,用户需登录才能获取输出结果,这使得Intelligence能够追踪不同大洲及时间维度上的审美变迁。例如,Li指出亚洲地区的网页仪表盘往往倾向于极繁主义设计风格。这些细颗粒度的人类反馈数据,恰好弥补了自动化基准测试的不足——后者虽规模庞大,却极易被操纵或“刷分”,上周Hugging Face遭受的安全 breach 便是明证。

当然,众包人类反馈并非稳赢的赛道。今年早些时候,曾获得a16z加密基金Chris Dixon支持的Yupp在启动不到一年后黯然关闭。尽管该公司也曾拿下部分前沿模型客户,并宣称拥有超过130万用户,却始终未能构建起可持续的长期商业模式。然而,其他基于人类评估的初创公司似乎正迎来春天。采用类似文本响应评估方法的LM Arena,在其付费产品正式推出仅四个月后,便于今年1月完成了1.5亿美元的A轮融资。这表明,在AI从“能用”向“好用”跨越的过程中,真实的人类品味正在成为新的硬通货。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI
more
DeepMind曾雪藏LMChat,OpenAI编程工具面临追赶压力
实测数据出炉:M5版MacBook Air全方位碾压Surface Laptop 8,Arm生态差距仍存
DeepSeek V4 Flash重塑全球AI调用格局,国产模型包揽前五
AI短剧登陆卫视黄金档,虚拟偶像“方桃子”广告报价碾压真人顶流
估值14个月翻三倍至20亿美元,Horizon3获2.5亿美元E轮融资,AI渗透测试成安全新刚需
AI“换脸”生意经:肖像权租赁背后的法律暗礁与数据隐忧
AI代劳亲子沟通?奥特曼的“晨间播客”构想遭群嘲,科技巨头陷入伦理泥潭
苹果设限应对AI漏洞报告洪流,安全攻防进入“机器速度”时代
OpenAI Astra以2000美元算力破解十项数学难题,科研范式面临重构
AI狂潮下的“缺芯”隐忧:MacBook Air供货告急,苹果被迫调整策略
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号