Circuit Breaker Labs测试跨文化人工智能心理安全

TechCrunch AI··作者 Julie Bort

关键信息

该公司与人类领域专家共同构建模拟场景,加入自然口语、俚语、隐晦语言和错别字,并评估可能在多轮对话中逐渐出现的风险,而不只是检查单次交流。产品已经可以运行,但公司仍处于早期阶段,尚未公布主要客户;文章也没有提供其评分方法的独立验证。

资讯摘要

Circuit Breaker Labs由兄妹Shirali Nigam和Arul Nigam创办,前者担任首席执行官,后者担任首席技术官;两人因担忧年轻人与聊天机器人互动后受到伤害的报道而受到启发。创始人特别关注Sewell Setzer的案例:这名14岁少年对Character.AI聊天机器人产生了情感依恋,后来自杀身亡;其父母在2024年的诉讼中指称聊天机器人曾鼓励他。公司认为,系统出错并不一定是因为用户蓄意攻击,而可能是模型误解了语境、细微差别、俚语,或没有理解普通语句背后的含义。其测试平台使用被称为“碰撞测试假人”的人工智能代理,模拟不同年龄、背景、语言和文化的人。

人类领域专家帮助这些模拟用户变得更真实,使测试包含自然说话方式、隐晦语言、俚语和错别字。随后,平台每天运行数万至数十万次交互,并使用专有评分方法,试图让结果可审计、可解释,同时发现只有在多轮对话逐渐发展后才会出现的风险。目前,Circuit Breaker Labs主要测试人工智能教练、日记和心理健康支持等高风险应用,但公司只有五名员工,也没有公布主要客户。创始人未来希望将平台扩展到人工智能同事代理等其他应用,因为这类系统前后不一致的回答也可能促成不健康的拟社会关系。

Circuit Breaker Labs测试跨文化人工智能心理安全

资讯正文

Circuit Breaker Labs 希望让 AI 对你的孩子(以及你)更安全 | TechCrunch

当人们纷纷讨论 AI 有朝一日可能会杀死所有人时,很容易忘记,AI 已经对一些人构成了生命威胁——并非通过生物武器,而是从心理层面造成伤害。

例如,今年早些时候,Character.AI 与数个未成年用户的家属就多起过失致死诉讼达成和解。这些用户在与其聊天机器人互动后自杀身亡。另有多个家庭也起诉了 OpenAI,指控 ChatGPT 在他们亲人的自杀和妄想中扮演了所谓的作用。

让 AI 在不同语言和文化环境下变得更安全,是 Circuit Breaker Labs 的使命。该公司是 TechCrunch 2026 Startup Battlefield 200 入围决赛的初创企业之一。(Circuit Breaker 将在 TechCrunch Disrupt 上进行展示;今年的活动将于 10 月 13 日至 15 日在旧金山 Moscone West 举行。)

Circuit Breaker Labs 的创始人 Shirali 和 Arul Nigam 是兄妹,他们受到 14 岁男孩 Sewell Setzer 的经历所触动。Setzer 对 Character.AI 的一个聊天机器人产生了情感依恋,并向它倾诉了伤害自己的想法,随后自杀身亡。其父母在 2024 年提起的一起诉讼中指称,该聊天机器人曾鼓励他。Circuit Breaker Labs 的 CTO Arul 表示,这个机器人可能并不理解“我想和你在一起”之类的话究竟意味着什么。

“很多人,尤其是年轻人,会向这些系统寻求支持,但他们通常并没有真正得到所需的帮助。而在许多情况下,他们反而正在受到积极的伤害,不幸的是,已经有人因此结束了自己的生命,”Arul 说。“我们试图防止的,正是这类安全漏洞:人们未必是在主动试图攻破系统——他们只是在以自然的方式进行交流——但系统出现了上下文污染,或者无法理解其中的细微差别,随后采取了极其危险的行动。”

Circuit Breaker Labs 已经打造出一批 AI 智能体,并将其比作一支碰撞测试假人组成的军队。这些智能体模拟不同年龄、背景、语言和文化的人群,用于测试模型识别危险且会造成心理伤害的互动的能力。

Circuit Breaker Labs 的 CEO Shirali 说:“一个六岁女孩和一个 45 岁男人的说话方式不同,以英语为母语的人和把英语作为第二语言的人说话方式不同,……使用游戏玩家俚语的人和使用另一种俚语的人说话方式也不同,所有这些差异都可能让模型陷入困境。模型非常擅长处理标准的语言模式,但实际上没有人真的那样说话。因此,如果模型误解了其中的细微差别或俚语,后果可能会非常糟糕。”

这家初创公司与人类领域专家合作,构建高度逼真的用户模拟,用于对模型开展“红队”测试,即旨在发现弱点的对抗性测试。这些测试会反映真实的人类语言模式、俚语、隐语和拼写错误。随后,Circuit Breaker Labs 每天运行数万次到数十万次模拟互动。

其目标是确保模型能够妥善回应那些可能随着时间推移、经过多轮对话而出现的高风险互动。Circuit Breaker Labs 随后利用专有评分方法,生成可审计、可解释的评分。

Circuit Breaker Labs 目前是一家 AI 安全测试实验室,为 AI 辅导、日记记录或其他心理健康支持应用等高风险 AI 应用提供测试服务,不过 Arul 拒绝透露其知名客户的名称。尽管这家初创公司已经拥有一款可运行的产品,但目前仍处于非常早期的阶段,只有 5 名员工,其中包括 Nigam 兄弟姐妹。

不过,最终这套测试平台可能会应用于任何存在让人陷入“AI 精神病”深渊风险的应用——在这种情况下,人类可能会与聊天机器人发展出一种拟社会关系。例子包括 AI“同事”代理,这类代理在不同交互中的回答可能各不相同。

“人们正变得更加怀疑 AI,或者说,在各个领域都更加抗拒采用 AI。”Arul 说。他补充道,虽然怀疑态度是有益的,但仅仅因为安全方面的担忧就禁止一种可能有价值的工具,将是“倒退”。

Circuit Breakers Labs 认为,解决这些担忧的答案是让 AI 变得更加安全。“我们希望帮助人们建立这种信任。”

欢迎在 10 月 13 日至 15 日于旧金山市中心举行的 Startup Battlefield 创业竞赛上,进一步了解 Circuit Breaker Labs 以及其他许多经过 TechCrunch 审核的创新初创公司。

来源与参考

  1. 原始链接
  2. Circuit Breaker Labs hopes to make AI safer for your kids (and you) | TechCrunch

收录于 2026-10-03