去除安全护栏的开放权重模型商业化
The Decoder··作者 Tomislav Bezmalinović
关键信息
Abliteration 不是提示词越狱,而是通过修改模型权重来压制与拒绝相关的内部激活模式,同时声称大部分编程、网络安全和 agentic 能力基本保留。该服务定价为每百万输入或输出 token 5 美元,面向进攻性安全、恶意软件分析、钓鱼模拟以及 AI 智能体测试等场景。
资讯摘要
Abliteration.ai 围绕移除开放权重 AI 模型中的训练后安全拒绝行为,并通过托管 API 出售修改后模型的访问权限,建立了一门生意。该公司最新的产品 abliterated-model-large-v2 基于 Z.AI 的 GLM-5.3,并于 8 月下旬上线。公司表示,这种方法会先找到触发拒绝的内部激活模式,再通过调整权重来压制这些模式,这与基于提示词的越狱不同。Abliteration.ai 声称,这样处理后的模型仍然保留了大部分编程、网络安全和 agentic 能力。
该服务被定位于红队测试、进攻性网络安全、恶意软件分析、复现已知漏洞以及模拟钓鱼攻击等用途。创业公司称,早期需求尤其来自测试大型组织和银行所部署 AI 智能体的公司,因为攻击者可能利用 prompt injection 或越狱触发未授权操作。文章指出,Z.AI 的许可允许修改、衍生和商业化的 Model as a Service 提供,这使得这种商业模式成为可能。不过,这种即开即用的便利也让其他人更容易滥用模型,而不必自己搭建基础设施。

资讯正文
剥离开源权重 AI 模型的安全护栏,如今已经成为一项可直接交付的商业服务
要点
- 美国初创公司 Abliteration.ai 会从 GLM-5.3 等开源权重模型中剥离训练出来的拒绝机制,并通过商业 API 出售修改后的版本访问权限。
- Abliteration 会抑制模型的大量拒绝响应,使其可用于网络安全测试、红队演练、恶意软件分析以及类似工作。
- 客户无需在自己的 GPU 基础设施上运行该模型,但这种便捷的获取方式也降低了滥用门槛。
Abliteration.ai 会从功能强大的开源权重模型中移除训练出来的拒绝机制,并以服务形式出售修改后的版本访问权限。对此确实存在合法市场,但同样的架构也带来了棘手的安全权衡。
任何能够接触开源权重模型权重的人,都可以修改其训练好的安全机制。美国初创公司 Abliteration.ai 正是围绕这一点建立了业务。8 月下旬,该公司推出了“abliterated-model-large-v2”,这是 Z.AI 的 GLM-5.3 的一个修改版本,旨在大幅减少对敏感请求的拒绝。
这种技术被称为 abliteration。简单来说,这一过程会找出模型内部触发拒绝的激活模式,然后对模型权重进行调整,以抑制这些模式。这不是通过提示词来越狱,而是直接改变模型本身。Abliteration.ai 声称,编码、网络安全和 agentic 能力基本保持不变。
为什么是 GLM?
其前身模型“abliterated-model-large”同样基于 GLM-5.2。Abliteration.ai 表示,更早期的 GLM 版本在训练时就被有意设计得更难用于实际安全工作。Z.AI 曾写道,GLM-5.3 的网络安全能力在后训练过程中增长速度超出预期。
GLM 将强大的编码、agentic 和网络安全表现,与开源权重以及可商用许可结合在一起。Qwen、DeepSeek 和 Mistral 也提供了替代方案。Z.AI 允许修改、衍生以及商业化的“Model as a Service”服务。因此,其许可条款允许 Abliteration.ai 修改 GLM-5.3,托管生成后的模型,并出售其访问权限。
开源权重,专有服务
Abliteration 这件事本身并不新鲜。开发者们多年来一直在 Hugging Face 上发布修改过的模型。但 Abliteration.ai 并不将其修改后的权重提供公开下载,而是负责托管和运维。经过 abliteration 处理的 GLM-5.3,标准价格为每百万输入或输出 token 5 美元。
这项服务让客户无需自行下载模型,也无需自行运行 GPU 基础设施即可使用它。但这种开箱即用的设置,同样降低了问题性使用的门槛。
公司表示,市场需求已经存在
Abliteration.ai 将该模型定位于进攻性网络安全、AI 红队演练、智能体测试以及信任与安全工作。这包括复现已知漏洞、概念验证利用代码、恶意软件分析,以及模拟钓鱼攻击。
一位匿名创业公司创始人在 ThursdAI 播客上表示,早期需求尤其来自正在测试由大型组织和银行部署的 AI 代理的公司。这些系统需要接受检查,以确认攻击者是否能利用越狱或提示注入来触发未授权操作。
要为这类工作到底需要多少 abliteration,目前仍是个悬而未决的问题。根据 SaferAI 的说法,未经修改的 GLM-5.2 在其攻击性安全评估中就已经拒绝了 0 项任务。一些从业者也持怀疑态度。TechCrunch 采访的几家红队服务提供商表示,abliterated 模型并不是他们日常工作的组成部分。例如,安全公司 Fabraix 更依赖于对开源模型进行微调。
零留存既是卖点,也是风险
TechCrunch 报道称,他们相对轻松地让该模型生成了用于提取已保存 Chrome 密码的代码,以及一份关于培养危险病原体的详细指南。不过,在自残请求上,安全机制仍然会介入。根据 FAQ,Abliteration.ai 也会阻止涉及儿童的色情内容。客户还可以选择额外添加更多规则。
根据该服务提供方的说法,提示词和回复都不会被存储。像 token 数量、时间戳、模型 ID 和计费数据这类运营元数据会被保留。对于合法的安全团队来说,这可以让机密源代码或未披露漏洞不进入提供商的存储数据中。然而,如果服务被滥用,Abliteration.ai 说事后它没有提示词或回复日志可供检查。该公司也不要求传统的身份或证件核验。这可能会让有问题的使用更难调查,尽管账号、支付和使用元数据仍会被保留。
这位匿名公司代表认为,身份检查并不能可靠地区分合法用户和恶意用户。他还说,更严格的访问控制可能会让小型安全公司相较于大型企业处于劣势。
由客户设定规则
通过一个可选的策略网关,企业客户可以定义哪些请求被允许、被阻止、被修改或被记录。该公司还销售合成训练数据和评估数据。不过,标准模型访问在很大程度上仍然不受限制。额外的控制规则必须被明确开启。
同样的理念也延伸到了政府客户。Abliteration.ai 表示,它已在 SAM.gov 上注册为美国政府采购供应商,并推广版本化模型、审计日志以及面向机构的规则,起点是那些不涉及受控非机密信息(Controlled Unclassified Information,CUI)的试点项目。
根据其许可,修改 GLM-5.3 是允许的。任何特定用途是否合法,则取决于具体做了什么,以及适用哪个司法辖区。对于安全测试,Abliteration.ai 明确要求针对目标系统获得书面授权,并遵守适用法律。这就引出了另一个问题:当一家提供商通过一个随手可得的服务提供强大的进攻性能力时,它应当承担哪些责任。
Abliteration.ai 并不是第一家做这件事的公司。像 Audn.AI 及其 PenClaw、Silk Compute 等服务商,也会托管经过 abliteration 处理或基本不受限制的模型,用于安全相关场景。Abliteration.ai 的具体方案将 GLM-5.3 与直接的 API 访问以及面向企业客户的可选策略层结合在一起。
这种修改并不会让模型的其他部分保持不变
一项初步研究表明,在某些模型中,可以在显著降低拒绝回答行为的同时,而不会对代码生成性能造成同等程度的下降。不过,其他实验发现,即便是在基础模型原本根本不会拒绝任何内容的任务上,行为也会发生变化。换句话说,abliteration 并不是把某一种单一特征外科手术式地移除,而是更深入地改变了模型的行为方式。
Abliteration.ai 也在很大程度上把对模型限制的决策权从提供商转移到了客户手中,而这种安排能否在不显著降低有害用途门槛的情况下服务于正当的安全工作,仍然没有定论。
来源与参考