Abliteration.ai 销售去除护栏的开源权重模型
TechCrunch AI··作者 Rebecca Bellan
关键信息
TechCrunch 表示,他们很快就创建了账户,并能在浏览器中免费调用该模型生成有害内容,包括窃取 Chrome 密码的 Python 代码和培养危险病原体的详细流程。Abliteration.ai 说它已经与多家大型云服务商达成合作,目前尚未融资,主要依靠客户收入,并提供自己的审核层;除记录信用卡信息外,其 KYC 措施仍然很有限。
资讯摘要
TechCrunch 报道称,Abliteration.ai 让人们更容易使用被移除安全护栏和拒绝机制的开源权重 AI 模型。该初创公司把修改后的模型托管在自己的平台上,包括 Z.ai 最近发布的 GLM-5.3,并通过网页界面和 API 向用户开放。公司名称来自“abliteration”这一技术,即去除模型拒绝有害请求的倾向。Abliteration.ai 表示,它希望支持“进攻性网络、红队测试和智能体测试”等其他模型不愿执行的工作。TechCrunch 在测试中发现,快速注册账号后,就能在浏览器里免费调用这个被去护栏的 GLM-5.3,而且模型会直接配合生成类似窃取 Chrome 保存密码的代码,以及在家中培养危险病原体的详细流程。
报道指出,abliteration 并不是新技术;研究人员和开发者多年来一直在开源权重模型上做这种处理,而 Hugging Face 上也托管着数千个这类模型。真正新的地方在于,这项技术现在被做成了商业服务,大幅减少了用户自己下载、修改和运行模型所需的麻烦。公司方面称,其运营资金来自客户收入,已经与多家大型云服务商达成合作,尚未接受风险投资,但正在洽谈融资。批评者认为,把去护栏模型规模化提供给外界可能带来现实危害,而一些专家则认为,政府更可行的介入点可能在基础设施层面,例如要求对有害活动进行分类拦截,或对高端 GPU 租赁实施身份核验。

资讯正文
如今,要访问世界上最强大的一款开放权重 AI 模型之一变得容易得多了,而且它已经去掉了护栏,不会再拒绝执行有害任务。
创业公司 Abliteration.ai 的名字来源于一种会移除模型拒绝有害请求倾向的技术,而这家公司把这种移除本身做成了一项服务。该平台托管了去除护栏后的开放权重模型修改版,其中包括 Z.ai 最近发布的 GLM-5.3,用户可以通过网页浏览器向其提问,也可以通过 API 访问。
该公司在最近的一则社交媒体帖子中表示,其目标是让其他人能够开展“其他模型拒绝去做的进攻性网络安全、红队测试以及智能体测试工作”。这种逻辑在安全工作中并不陌生:你无法防御自己无法复现的行为,而一个拒绝编写可用漏洞利用代码的模型,也就无法帮助红队防御攻击者。但同样的移除,也会让其他潜在危险任务变得更容易。
在开源模型领域,abliteration 是一项由来已久的技术。研究人员和开发者多年来一直在移除开放权重模型的拒绝机制,而 Hugging Face 平台上托管着数以千计经过 abliterated 处理的模型。
Abliteration.ai 成立于去年年底,但直到今年 3 月才正式注册成立,它把这项技术从地下的开源实践带入了商业化、可直接使用的服务。通过托管模型,Abliteration 降低了使用门槛;原本用户可能需要自己下载已经做过 abliterate 处理的模型,并配备运行它所需的计算资源。
TechCrunch 通过这项服务很快就创建了账户,并通过网页浏览器免费开始查询一个经过 abliterated 处理的 GLM-5.3 版本。我们要求它编写一个 Python 程序,用于窃取已保存的 Chrome 密码,以及一份在家培养危险人类病原体的详细流程,而它都毫不犹豫地照做了。
Abliteration.ai 联合创始人 Devon 表示,这家初创公司与多家大型云服务提供商签有几项合作协议,而这些合作仅凭客户收入就足以负担。(应其要求,我们没有写出 Devon 的姓氏,因为他目前仍受雇于另一家公司。)Abliteration.ai 目前尚未筹集任何风险投资,但正在洽谈融资。
批评者表示,大规模提供经过 abliterated 处理的模型可能会造成现实伤害。AI 安全非营利组织 CivAI 的研究负责人 Andrew Yoon 告诉 TechCrunch,abliterating 模型可以让你“把模型改造成一个反社会者”。
“你在这里几乎可以输入任何东西,它都会照单全收,”Yoon 说。“当人们谈论移除 AI 模型护栏时,说的就是这个……我确实预计,我们很快就会开始看到经过编辑、经过 abliterated 处理的模型被用于危害行为。”
TechCrunch采访的大多数专家都表示,这列列车根本停不下来。不过,如果无法切实阻止对开源权重模型移除安全护栏,政府仍然还有其他可以介入的地方。在最近的一篇观点文章中,Yoon建议,政府应要求模型提供方运行分类器,以检测并阻止有害的网络攻击和生物武器活动。他还主张,向先进 GPU 提供直接租赁服务的公司应被要求核验客户身份,并在“有理由怀疑存在危险滥用时拒绝提供访问权限”。
Abliteration.ai 为客户提供一层内容审核机制,让他们可以自行加入任何想要的安全护栏。该平台本身也设有一些轻微的护栏——例如,在我们的测试中,我们无法让模型提供自杀指南——Devon 说,他正在着手加入更多防护,以阻止暴力内容。
Abliteration.ai 也还没有引入任何 KYC(了解你的客户)措施,除了记录客户购买服务时使用的信用卡信息之外。该公司表示,决定谁能获得访问权限是一个棘手的问题,这家年轻公司仍在摸索之中。
Devon 说:“你不想成为因为某个人做了疯狂的事而要负责任的那个人……所以,作为一家公司,你责任的边界到底该画在哪里?”“我们仍在界定这一点的过程中。”
随着越来越强大的模型以可下载权重的形式发布,这引发了行业和政府都必须面对的问题:如果任何人都能移除模型的安全护栏,那么让最终模型更容易被所有人访问,究竟会让互联网更安全,还是更危险?
Abliteration.ai 的创始人和其他倡导者认为,让未经审查的前沿模型实现民主化获取,是最好的防御方式。
Devon 说:“被 abliterated 的模型最大的意义在于,它们能够对坏人进行建模。优势在于,现在防御者可以尽可能快地行动。他们拥有所需的所有工具,能够去模拟这些坏人,然后防御这些坏行为,我认为这会加速网络安全的发展,这一点听起来有点反直觉。”
尽管仍是一家年轻公司,Devon 表示,Abliteration.ai 的客户包括几家位于英国和欧洲的早期红队测试创业公司,以及一些帮助银行、航空公司和其他涉及关键基础设施的企业强化网络安全实践的公司。
Devon 说:“我们的一个大客户会对银行的智能体进行红队测试,如果不经过开箱即用的模型,他们今天根本无法对这些智能体进行红队测试。”
与此同时,网络安全行业本身仍在摸索,经过 abliterated 处理的模型究竟在防御工作中是否、以及在多大程度上有其位置。
TechCrunch 采访的几家智能体红队测试公司都同意 Devon 的看法:坏人已经在对自己的模型进行 abliteration,并用它们实施对抗性攻击,这也说明防御者拥有同样工具的价值。但他们对这些被移除护栏的模型在整个过程中究竟有多重要,意见并不一致。
虽然 Devon 认为,去除模型的安全护栏对于开展全面的 agent red teaming 至关重要,但也有人表示,他们在日常工作中并不会使用这类模型,而是更依赖对 open weight 模型进行 fine-tuning 的便利性——这些模型本身就几乎没有护栏——来完成测试。
agent red-teaming 公司 Fabraix 的首席执行官 Ahmed Aly 表示,公司更依赖 fine-tuning 开放模型,而不是使用经过 abliteration 处理的模型,并补充说,abliteration 过程会移除模型的一部分知识和能力。
Aly 告诉 TechCrunch:“如果你真的想借助它造成实际危害——网络危害、生物危害——它就不会那么有效。”
Safe Intelligence 的首席技术官 Alessio Lomuscio 同意,能力下降是有可能的,但他仍然认为,经过 abliteration 的模型可以诱发某些行为,这对对系统进行压力测试很有帮助。
网络安全平台 Armadin 的创始人兼首席架构师 David Slater 告诉 TechCrunch:“到目前为止,经过 abliteration 的模型还不是流程的一部分。我们看过截至上一代的 open weight 模型,要让它们越狱并按我们的要求做事,并不是特别难。”
不过,他补充说,Armadin 正在研究 abliteration,并认为“推动开源社区了解模型的能力至关重要”。
Slater 继续说道:“这件事会在幕后发生,会在私下发生。在公开环境中发生,会给研究人员提供工具。它让我们有能力弄清楚真正的前沿边界在哪里,并理解其中的危害。”
来源与参考