Topic
#llm-reliability
按主题聚合的新闻视图。
Topic Feed
主题:llm-reliability
共 2 条
更强模型,却更差的工具调用
Simon Willison 转述了 Armin 在 Pi 中发现的一个回归问题:较新的 Anthropic Claude 模型,包括 Opus 4.8 和 Sonnet 5,有时会在嵌套的 edits[] 数组里生成带有虚构字段的错误编辑工具调用。虽然编辑内容通常是对的,但参数不符合 schema,导致 Pi 拒绝该调用并要求重试。

Probably 融资 900 万美元打造更可靠的 AI
专注于 AI 可靠性的初创公司 Probably 从 Andreessen Horowitz 获得了 900 万美元种子轮融资。该公司表示,它正在构建一种系统,旨在在幻觉和事实错误到达用户之前就将其拦截。