Topic

#llm-reliability

按主题聚合的新闻视图。

主题:llm-reliability

共 2 条

  1. Simon Willison·

    更强模型,却更差的工具调用

    Simon Willison 转述了 Armin 在 Pi 中发现的一个回归问题:较新的 Anthropic Claude 模型,包括 Opus 4.8 和 Sonnet 5,有时会在嵌套的 edits[] 数组里生成带有虚构字段的错误编辑工具调用。虽然编辑内容通常是对的,但参数不符合 schema,导致 Pi 拒绝该调用并要求重试。

  2. Probably 融资 900 万美元打造更可靠的 AI

    TechCrunch AI·

    Probably 融资 900 万美元打造更可靠的 AI

    专注于 AI 可靠性的初创公司 Probably 从 Andreessen Horowitz 获得了 900 万美元种子轮融资。该公司表示,它正在构建一种系统,旨在在幻觉和事实错误到达用户之前就将其拦截。