Simon Willison 对比了 Claude Fable 5 和搭载 GPT-5.6 Sol Ultra 的 Codex 在一键生成游戏任务上的表现,发现后者生成了更复杂的浣熊抢劫游戏。生成的版本存在眼球过大的视觉 bug,需通过迭代提示修复,凸显了当前自主代码审查的局限性。
背景
Simon Willison 经常通过让 AI 编码代理根据提示生成游戏来对其进行基准测试。GPT-5.6 Sol Ultra 是一种积极利用子代理处理复杂任务的模式。
- 来源
- Simon Willison
- 发布时间
- 2026年8月8日 03:18
- 评分
- 5.0 / 10