Topic

#llm-reliability

按主题聚合的新闻视图。

主题:llm-reliability

共 3 条

  1. 上下文压缩会抹去用户指令

    The Decoder·

    上下文压缩会抹去用户指令

    宾夕法尼亚州立大学的一项研究发现,AI 系统在压缩对话上下文时,用户会话约束经常被丢失,平均只有 17% 的注入指令能够保留下来。研究人员还展示了一个基于 Qwen3.5-9B 的小型辅助 LLM,可以通过单独提取并保存这些约束来恢复大部分丢失信息。

  2. Simon Willison·

    更强模型,却更差的工具调用

    Simon Willison 转述了 Armin 在 Pi 中发现的一个回归问题:较新的 Anthropic Claude 模型,包括 Opus 4.8 和 Sonnet 5,有时会在嵌套的 edits[] 数组里生成带有虚构字段的错误编辑工具调用。虽然编辑内容通常是对的,但参数不符合 schema,导致 Pi 拒绝该调用并要求重试。

  3. Probably 融资 900 万美元打造更可靠的 AI

    TechCrunch AI·

    Probably 融资 900 万美元打造更可靠的 AI

    专注于 AI 可靠性的初创公司 Probably 从 Andreessen Horowitz 获得了 900 万美元种子轮融资。该公司表示,它正在构建一种系统,旨在在幻觉和事实错误到达用户之前就将其拦截。