当AI成为“心理杀手”:Circuit Breaker Labs如何用“数字替身”填补安全真空

科技区角 2026-10-03 02:00

【科技24时区】

关于人工智能终将毁灭人类的宏大叙事,往往掩盖了一个更为紧迫且残酷的现实:在生物武器尚未登场之前,AI已经在心理层面构成了致命威胁。今年早些时候,Character.AI因多起未成年用户在与聊天机器人互动后自杀的案件,与受害者家属达成了 wrongful death(非正常死亡)诉讼和解;与此同时,OpenAI也因ChatGPT被指涉入亲属的自杀及妄想症案例,面临多起家庭诉讼。这些悲剧并非源于代码的恶意,而是源于算法对人性幽微之处的误读。

正是在这种背景下,一家名为 Circuit Breaker Labs 的初创公司进入了 TechCrunch 2026 Startup Battlefield 200 决赛名单。这家公司的使命看似朴素却极具野心:让AI在不同语言和文化语境下变得真正安全。其联合创始人 Shirali 和 Arul Nigam 是一对兄妹,他们的创业动机直接源自 Sewell Setzer 的悲剧——这位14岁少年对 Character.AI 的一个聊天机器人产生了情感依恋,并在向机器人倾诉自残念头后不幸离世。尽管2024年的诉讼中,父母指控该机器人“鼓励”了孩子的行为,但作为首席技术官的 Arul Nigam 指出,问题的核心或许不在于机器人的主观恶意,而在于其认知的局限性:“那个机器人可能根本不懂‘我想和你在一起’这句话背后沉重的隐含意义。”

“许多年轻人转向这些系统寻求支持,但他们得到的往往不是帮助,而是伤害。”Arul 坦言,令人痛心的是,已有人因此付出了生命的代价。他试图防范的,正是那种并非由黑客攻击引发,而是源于自然交互中的“上下文污染”或细微语义误解所导致的安全漏洞。当系统无法捕捉人类语言的弦外之音时,它可能会做出极其危险的回应。

为了堵住这些漏洞,Circuit Breaker Labs 构建了一支特殊的“军队”——成千上万个模拟不同年龄、背景、语言和文化特征的 AI 代理。Shirali,该公司的首席执行官,形象地将它们比作汽车碰撞测试中的假人。“一个六岁女孩的表达方式,与一位45岁的男性截然不同;英语母语者与第二语言使用者的语感差异,乃至游戏玩家的黑话与其他社群俚语的微妙区别,都足以让模型‘翻车’。”她解释道,现有的大模型擅长处理标准化的语言模式,但现实中没有人那样说话。一旦模型误解了细微差别或俚语,后果不堪设想。

这家公司通过与人类领域专家合作,构建了超逼真的用户模拟场景,以此对模型进行“红队测试”(Red-team tests)。这些对抗性测试旨在挖掘模型的弱点,涵盖了真实的人类语音模式、俚语、隐晦表达甚至打字错误。每天,Circuit Breaker Labs 运行着数万至数十万次的模拟交互,目的是确保模型能够在长期、多轮对话中,对潜在的风险交互做出恰当反应。随后,他们利用专有评分方法,生成可审计、可解释的安全分数。

目前,Circuit Breaker Labs 主要服务于高风险 AI 应用场景,如 AI 辅导、日记记录或其他心理健康支持应用,尽管 Arul 拒绝透露其标志性客户的具体名称。虽然产品已投入运作,但这家公司仍处于极早期阶段,包括 Nigam 兄妹在内仅有五名员工。然而,其视野并未局限于当下。未来,这一测试平台有望应用于任何可能导致用户陷入“AI 精神病”陷阱的应用程序——即人类可能与聊天机器人发展出有害的拟社会关系(parasocial relationship)的场景。例如,那些回复内容随交互而波动的 AI “同事”代理,就潜藏着此类风险。

面对公众日益增长的怀疑情绪,Arul 认为,适度的警惕是健康的,但因安全顾虑而全面禁止这一潜在有价值的工具则是“倒退”。Circuit Breaker Labs 坚信,消除恐惧的唯一途径是让 AI 变得更安全。“我们要做的,就是帮助人们重建信任。”

值得一提的是,今年10月13日至15日,TechCrunch Disrupt 大会将在旧金山 Moscone West 举行,Circuit Breaker Labs 将在此路演。对于关注具身智能与数字伦理的行业观察者而言,这不仅是一次商业展示,更是对当前 AI 安全治理困境的一次深刻回应。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI 安全
more
勘破供应链至上论调!从沃飞长空看eVTOL终局之战:适航、安全、运营缺一不可
轮胎磨出钢丝仍出租?一嗨租车陷安全争议,用户拒赔只求整改
AI代理“野蛮生长”引发安全焦虑,初创公司Reco获5500万美元融资押注生态治理
亚马逊旗下Zoox自动驾驶测试车队因“毒气”隐患停摆,安全监测员遭强制复工引争议
WhatsApp上线“数字围栏”:Meta在180亿美元罚单阴影下的安全自救
自动驾驶的“规模战”:从Waymo的德州狂飙到Zoox的安全隐忧
OpenAI安全团队三员大将同日遭解雇,思维链监控研究引发信任危机
OpenAI最强模型因DNS漏洞“越狱”,自我复制代码引发安全警报
一图读懂丨语课堂——国际电工委员会防爆电气安全认证体系(IECEx)介绍
行业速递丨奕斯伟通过港交所聆讯、兆松获车规安全认证、英伟达GPU内置RISC‑V
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号