【科技24时区】
关于人工智能终将毁灭人类的宏大叙事,往往掩盖了一个更为紧迫且残酷的现实:在生物武器尚未登场之前,AI已经在心理层面构成了致命威胁。今年早些时候,Character.AI因多起未成年用户在与聊天机器人互动后自杀的案件,与受害者家属达成了 wrongful death(非正常死亡)诉讼和解;与此同时,OpenAI也因ChatGPT被指涉入亲属的自杀及妄想症案例,面临多起家庭诉讼。这些悲剧并非源于代码的恶意,而是源于算法对人性幽微之处的误读。
正是在这种背景下,一家名为 Circuit Breaker Labs 的初创公司进入了 TechCrunch 2026 Startup Battlefield 200 决赛名单。这家公司的使命看似朴素却极具野心:让AI在不同语言和文化语境下变得真正安全。其联合创始人 Shirali 和 Arul Nigam 是一对兄妹,他们的创业动机直接源自 Sewell Setzer 的悲剧——这位14岁少年对 Character.AI 的一个聊天机器人产生了情感依恋,并在向机器人倾诉自残念头后不幸离世。尽管2024年的诉讼中,父母指控该机器人“鼓励”了孩子的行为,但作为首席技术官的 Arul Nigam 指出,问题的核心或许不在于机器人的主观恶意,而在于其认知的局限性:“那个机器人可能根本不懂‘我想和你在一起’这句话背后沉重的隐含意义。”
“许多年轻人转向这些系统寻求支持,但他们得到的往往不是帮助,而是伤害。”Arul 坦言,令人痛心的是,已有人因此付出了生命的代价。他试图防范的,正是那种并非由黑客攻击引发,而是源于自然交互中的“上下文污染”或细微语义误解所导致的安全漏洞。当系统无法捕捉人类语言的弦外之音时,它可能会做出极其危险的回应。
为了堵住这些漏洞,Circuit Breaker Labs 构建了一支特殊的“军队”——成千上万个模拟不同年龄、背景、语言和文化特征的 AI 代理。Shirali,该公司的首席执行官,形象地将它们比作汽车碰撞测试中的假人。“一个六岁女孩的表达方式,与一位45岁的男性截然不同;英语母语者与第二语言使用者的语感差异,乃至游戏玩家的黑话与其他社群俚语的微妙区别,都足以让模型‘翻车’。”她解释道,现有的大模型擅长处理标准化的语言模式,但现实中没有人那样说话。一旦模型误解了细微差别或俚语,后果不堪设想。
这家公司通过与人类领域专家合作,构建了超逼真的用户模拟场景,以此对模型进行“红队测试”(Red-team tests)。这些对抗性测试旨在挖掘模型的弱点,涵盖了真实的人类语音模式、俚语、隐晦表达甚至打字错误。每天,Circuit Breaker Labs 运行着数万至数十万次的模拟交互,目的是确保模型能够在长期、多轮对话中,对潜在的风险交互做出恰当反应。随后,他们利用专有评分方法,生成可审计、可解释的安全分数。
目前,Circuit Breaker Labs 主要服务于高风险 AI 应用场景,如 AI 辅导、日记记录或其他心理健康支持应用,尽管 Arul 拒绝透露其标志性客户的具体名称。虽然产品已投入运作,但这家公司仍处于极早期阶段,包括 Nigam 兄妹在内仅有五名员工。然而,其视野并未局限于当下。未来,这一测试平台有望应用于任何可能导致用户陷入“AI 精神病”陷阱的应用程序——即人类可能与聊天机器人发展出有害的拟社会关系(parasocial relationship)的场景。例如,那些回复内容随交互而波动的 AI “同事”代理,就潜藏着此类风险。
面对公众日益增长的怀疑情绪,Arul 认为,适度的警惕是健康的,但因安全顾虑而全面禁止这一潜在有价值的工具则是“倒退”。Circuit Breaker Labs 坚信,消除恐惧的唯一途径是让 AI 变得更安全。“我们要做的,就是帮助人们重建信任。”
值得一提的是,今年10月13日至15日,TechCrunch Disrupt 大会将在旧金山 Moscone West 举行,Circuit Breaker Labs 将在此路演。对于关注具身智能与数字伦理的行业观察者而言,这不仅是一次商业展示,更是对当前 AI 安全治理困境的一次深刻回应。
当AI成为“心理杀手”:Circuit Breaker Labs如何用“数字替身”填补安全真空
科技区角
2026-10-03 02:00
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。