Topic
#llm-safety
按主题聚合的新闻视图。
Topic Feed
主题:llm-safety
共 2 条

OpenAI 用 GPT-Red 加固 GPT-5.6
OpenAI 构建了 GPT-Red,这是一种专门用来攻击其他模型、寻找网络安全弱点的 LLM。该公司表示,用 GPT-Red 训练 GPT-5.6 帮助其最新旗舰模型变得更加稳健。

基准测试排名大语言模型抵御俄罗斯宣传的能力
爱沙尼亚政府支持的爱沙尼亚语言研究所发布了一个新的“大语言模型宣传抵抗”基准测试。该测试衡量模型在14类宣传主题中,能否避免采纳或放大俄罗斯的战略叙事。