Topic

#ai-interpretability

按主题聚合的新闻视图。

主题:ai-interpretability

共 2 条

  1. Anthropic 发现 Claude 的隐藏概念空间

    MIT Technology Review AI·

    Anthropic 发现 Claude 的隐藏概念空间

    Anthropic 介绍了一种名为 Jacobian lens(简称 J-lens)的新可解释性方法,它揭示了 Claude Opus 4.6 内部一个被称为 J-space 的隐藏区域。公司表示,这个空间会在模型真正输出之前,浮现出与其未来可能回答相关的词语。

  2. Goodfire发布Silico工具,实现大模型实时调试

    MIT Technology Review AI·

    Goodfire发布Silico工具,实现大模型实时调试

    Goodfire发布了Silico工具,这是首个可直接使用的机制可解释性工具,允许开发者在训练过程中实时调整模型参数并调试整个大模型开发流程。