Cactus Compute发布Needle 3,这是一款8–29MB的自动化模型,在工具调用和结构化JSON任务上与DeepSeek V4 Flash性能相当。该模型采用Monarch Hadamard MLP架构和智能层级跳级技术,在树莓派5上推理速度可达每秒4k tokens,并支持八种语言及针对特定领域的快速微调。
背景
对于无需依赖云端API、可在设备端运行的轻量级AI自动化模型需求日益增长。Needle 3通过精细的架构压缩和智能子网络选择,展示了小型模型在特定任务上可接近大型商用模型的性能,为边缘AI部署提供了新路径。
- 来源
- Hacker News (RSS)
- 发布时间
- 2026年9月18日 08:11
- 评分
- 9.0 / 10