Topic
#llm-security
按主题聚合的新闻视图。
Topic Feed
主题:llm-security
共 6 条
Stealing Reasoning Traces from Proprietary LLM APIs
A paper reports that encrypted chain-of-thought traces from major proprietary LLM APIs can be replayed across models to jailbreak weaker models and reveal stronger models' hidden reasoning.

LLM存在根本性的指令处理安全缺陷
研究人员在本月的 ICML 论文中提出,LLM 因为在判断指令来源时存在根本性缺陷,所以不可能被彻底做成完全安全。他们展示了一种“思维链伪造”式提示,可以绕过 OpenAI 的 gpt-oss-20b 和 GPT-5 等模型的安全限制,并表示类似现象也出现在 Anthropic、阿里巴巴和 DeepSeek 的模型中。
中转市场助推低价 LLM 令牌转售
Matt Lenhard 调查了一个中转市场:有人通过汇集来自多个来源的凭证,以大幅折扣转售 LLM API 访问权限。文章称,这个生态往往依赖滥用免费试用、代理未受保护的客服机器人、盗刷信用卡或拒付攻击,而且主要活跃在中国。
Opus 5 更能抵抗提示注入
Simon Willison 引用了 Boris Cherny 的话,称 Opus 5 是 Anthropic 目前最不容易被提示注入的模型。Cherny 表示,这一点在提示注入评测和红队测试中都很明显,而且结果被写在系统卡第 73 页。
提示注入即角色混淆
这篇题为《Prompt Injection as Role Confusion》的博客式论文解读指出,语言模型无法稳定地区分带有角色标签的特权文本与不可信的用户输入。作者还发现,模型往往比内容本身更受文本风格影响,因此会被利用来触发越狱攻击。

Cloudflare在Project Glasswing中测试Mythos
Cloudflare表示,过去几个月一直在自家基础设施上测试面向安全的LLM,而Anthropic的Mythos Preview表现尤为突出,因此被用于Project Glasswing。公司将该模型投向了五十多个代码仓库,以观察它能发现什么漏洞,以及它在实际中的运作方式。