Topic

#llm-safety

按主题聚合的新闻视图。

主题:llm-safety

共 2 条

  1. OpenAI 用 GPT-Red 加固 GPT-5.6

    MIT Technology Review AI·

    OpenAI 用 GPT-Red 加固 GPT-5.6

    OpenAI 构建了 GPT-Red,这是一种专门用来攻击其他模型、寻找网络安全弱点的 LLM。该公司表示,用 GPT-Red 训练 GPT-5.6 帮助其最新旗舰模型变得更加稳健。

  2. 基准测试排名大语言模型抵御俄罗斯宣传的能力

    Ars Technica AI·

    基准测试排名大语言模型抵御俄罗斯宣传的能力

    爱沙尼亚政府支持的爱沙尼亚语言研究所发布了一个新的“大语言模型宣传抵抗”基准测试。该测试衡量模型在14类宣传主题中,能否避免采纳或放大俄罗斯的战略叙事。