该GitHub项目演示了在M4芯片Mac上利用Apple CoreML框架离线运行Llama(OS Jev)大语言模型,推理速度达到每秒45个token。该项目展示了利用Apple神经网络引擎进行高效本地设备推理的LLM部署方案。
背景
Apple的CoreML框架使开发者能够在iOS和macOS设备上利用神经网络引擎本地运行机器学习模型。随着隐私和延迟问题的关注增加,在消费级硬件上离线运行大型语言模型已成为一个热门研究方向。
- 来源
- Hacker News (RSS)
- 发布时间
- 2026年9月20日 23:58
- 评分
- 6.0 / 10