Simon Willison 测试了 Claude Fable 5.1 在 pelican 动画基准测试上的表现,发现低和中等推理模式下没有出现可见的推理痕迹,结果令人费解。Anthropic 的 Fable 5.1 在新发布的 Terminal-Bench-Science 0.1 基准上以 52.6% 的成绩表现出色,超越了 Opus 5 和 GPT-5.6 Sol。
背景
Claude Fable 5.1 是 Anthropic 最新发布的 AI 模型,在编程和科学研究基准测试中表现强劲。Simon Willison 维护着一个轻松但日益流行的
- 来源
- Simon Willison
- 发布时间
- 2026年9月2日 07:57
- 评分
- 5.0 / 10