E-Ink 新闻日报

← 返回列表

在消费级硬件(RTX 4090)上运行Qwen 3.8 Flash Next (125B),速度达100T/s

Strata是一个开源推理引擎,允许用户在消费级NVIDIA或AMD显卡(12GB+显存)上运行1250亿参数的Qwen3.8-Flash-Next大模型,提供Windows/Linux一键安装。它兼容OpenAI/Anthropic API并支持图像输入,在RTX 4090上可达100 tokens/s的推理速度。

背景

本地LLM推理的可访问性需求快速增长,量化技术如GGML使得大模型能在消费级硬件上运行。该项目遵循使十亿参数模型脱离数据中心环境、走向大众的趋势。

来源
hackernews
发布时间
2026年10月4日 20:51
评分
7.0 / 10