Simon Willison回顾2026年LLM进展,重点介绍2025年11月发布的Claude Opus 4.5和GPT-5.1,指出它们是增量升级,但使编码代理达到日常可用水平。他还通过SVG鹈鹕骑自行车基准测试评估模型,并提及一个名为Warelay的GitHub仓库的早期动态。
背景
大语言模型领域持续快速演进,主要厂商不断发布更聚焦编码、推理与可靠性的升级版模型。年度回顾分析常用于追踪哪些能力从实验阶段跨入生产可用阶段。
- 来源
- Simon Willison
- 发布时间
- 2026年9月28日 07:54
- 评分
- 6.0 / 10