【科技24时区】今年夏天,视频生成初创公司 Synthesia 的企业事务主管 Alexandru Voica 发来一个链接,让我颇感意外。那并非普通的公关素材,而是一个经过训练的交互式虚拟化身——也就是他的数字分身,专门用于回答关于公司业务及运作机制的常规媒体提问。就在前一天,我还在一场小组讨论中面对公关人士的质询:是否介意使用 AI 生成的文本进行推介?相比之下,Alexandru 的这一举动显得更为激进,仿佛是将 AI 在公关领域的应用推向了“终极形态”。
九月,Synthesia 邀请我参观其位于纽约的新办公室。这家源自英国的公司,如今已与 D-ID、HeyGen 和 Colossyan 等同行并列为炙手可热的数字人初创企业。今年早些时候,其估值飙升至 40 亿美元,去年更宣布年经常性收入(ARR)突破 1 亿美元大关。Synthesia 的核心业务是帮助企业利用 AI 数字人制作交互式培训视频,近期推出的“Roleplay Sessions”产品更是允许员工通过与能实时反馈并评分的 AI 数字人互动,来演练销售话术等场景。
在新办公室的开幕仪式上,当对方询问我是否愿意拥有自己的 AI 数字分身时,我几乎没有犹豫便答应了。毕竟,谁不想拥有一个数字孪生体呢?那天我的着装得体,发型也打理得一丝不苟。在此之前,我对数字人持一种疏离的冷漠态度,尽管我深知它们终将渗透进日常的网络生活——Instagram 上已不乏用户创建自身形象以辅助社交内容创作的案例。这种技术演进令人着迷,或许正因如此,我现在毫无心理负担地向你展示我的数字分身。
值得注意的是,这是 Synthesia 首次为记者(乃至除 Voica 以外的任何人)制作数字分身。该模型基于我撰写的一篇关于“为何风投支持的初创公司比非风投支持的初创公司更容易出现欺诈行为”的报道进行训练,且仅能回答与该报道相关的问题。点击下方播放器中的“在新窗口中启动”,你便可开始交互。你可以尝试提问:“为什么我决定写这篇报道?”“研究论文的主要内容是什么?”“研究人员发现了什么?”
为了制作这个分身,我进入 Synthesia 办公室内嵌的一个迷你摄影棚,拍摄了大量照片并录制了两分钟的语音样本。在签署同意书后,“数字版 Dom”由此诞生。团队为我制作了个人分身(仅朗读指定脚本),包括戴眼镜和不戴眼镜两个版本;同时制作了两个交互式分身(具备听辨与回应能力),同样分为戴镜与不戴镜版本。
我们选定上述文章作为交互式分身的训练数据,随后由一支团队构建出这一模型。其技术栈融合了语音转文字、视频、语言处理及文字转语音模型。其中,视频和语音模型来自 Synthesia 自研,但客户也可选择 Cartesia、ElevenLabs、Google 或 OpenAI 等其他实验室的方案。企业既可选择自行托管分身,也可付费由 Synthesia 托管。整个流程大致如下:语音转文字模型将口语转化为文本,代理语言模型理解文本并执行相应动作,文字转语音模型将回复转化为音频,最后由 Synthesia 构建的视频模型驱动数字人在说话时产生口型与表情动画。
总体而言,Synthesia 构建了三大类产品线:一是经典数字人的视频创作与分发平台,用户输入脚本,数字人复述;二是名为“Sessions”的代理平台,支持用户在调查或角色扮演中与数字人互动;三是 API 平台,允许开发者结合 Synthesia 的视频语音模型与其他技术服务,构建交互式数字人或衍生产品。
制作过程耗时数日。我先体验了个人分身,输入一段关于“纽约秋季降临”的通用脚本,测试 AI 声音的效果。结果相当逼真,令我欣慰的是,它并未捕捉到我录音时嗓音的沙哑。我将此展示给几位非科技圈的朋友,他们的反应介于“有趣”与“毛骨悚然”之间。
随后我展示了交互式分身。该模型具有确定性,即只回答训练范围内的问题。当我问及加入 TechCrunch 前的经历或我在纽约的具体居住区域时,它始终将话题引回那篇关于风投欺诈的报道。朋友们认为其声音不像我,相似度也不及个人分身,但那种“似像非像”的感觉反而加剧了诡异感。母亲却称之为“惊人”,这对她而言已是极高赞誉。父母试图询问只有他们知道的私密问题,模型均未作答,而是机械地重定向至报道主题。“我不记得生了两个你,”母亲在测试后开玩笑道。
这段经历引发了我对新闻业未来的深思。公众能否接受由数字人播报的新闻?一位投资者当即表示否定。当下,社交媒体及其他新闻分享平台中充斥的“AI 垃圾内容”确实引发了强烈反弹。然而,其他受访者的态度则较为模糊。数字人会增强甚至取代记者吗?CEO 们会更倾向于与记者的 AI 分身而非真人对话吗?
我热爱这份职业,因为它关乎人际连接、故事叙述与新知探索。但新闻业的核心基石是信任,这似乎永远无法外包给 AI。跳出新闻业范畴,自我克隆的概念无疑极具吸引力——假期归来无需补班,因为你的数字分身随时在线答疑。我们将拭目以待美国企业界对数字人的接纳程度。
此刻,拥有自己数字分身的我心情复杂。新鲜感褪去后,我仔细审视着停止说话后的分身,它在等待——等待什么?我也不确定。也许我在等它眨眼,等它说出新词,等它微笑,或者仅仅是让它表现出“知晓”的状态。
由于我的数字分身是确定性的,它永远不会做出这些举动。但我能想象,若是一个非确定性的、由自由发挥的聊天机器人驱动的分身,极易让人陷入某种“AI 精神病”般的错觉。我曾告诉一位投资者,无论数字分身的未来如何,我预测我们这一代(Z 世代)很难真正适应它们。它们充满了科幻色彩:电影中的景象如今已成现实。不过,相较于实体人形机器人,数字分身带来的冲击感稍弱。至少,当情况变得怪异时,我可以随时下线。
在此之前,请观看我的个人分身,为你梳理本周本站的所有头条新闻!
当记者被“克隆”:Synthesia的数字分身实验与新闻业的信任危机
科技区角
2026-09-27 00:00
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。