Skip to content
←返回开源项目

OPEN SOURCE DEEP DIVE

大语言模型InferenceOptimizationMoE

Strata:在消费级 PC 上运行 1250 亿参数 MoE 模型的本地推理引擎

Strata 是一个基于 llama.cpp/ggml 构建的开源本地推理引擎,通过 MoE 专家分层缓存(GPU→RAM→SSD)和猜测-验证投机解码,让 12GB 显存的消费级显卡也能运行 Qwen3.8-Flash-Next 1250 亿参数模型,生成速度达 53-94 tokens/秒。

Niko1221/Strata7.8kC++MIT2 min read

项目概述

Strata 是一个开源的本地推理引擎,能在普通游戏 PC 上运行 1250 亿参数的 Qwen3.8-Flash-Next 大模型。它基于 llama.cpp / ggml 构建,支持 NVIDIA(RTX 20-50 系列)和 AMD(RX 6000-9000 系列)显卡,最低 12 GB 显存即可启动。所有推理在本地完成,数据不离开你的电脑。

解决什么问题

1250 亿参数的 MoE 模型通常需要服务器级硬件(数百 GB 显存)才能运行。Strata 的核心创新在于将推理工作分摊到整台 PC 上——GPU、RAM、CPU 和 SSD 协同工作,让消费级硬件也能跑起百亿参数模型。

核心架构

Strata 的技术设计围绕两个关键理念:

MoE 专家分层缓存

Qwen3.8-Flash-Next 是一个拥有 24,576 个专家的 MoE 模型,但每个 token 只需激活其中 10 个。Strata 利用这一特性做分层缓存:

  • GPU 显存:缓存最常被请求的数千个专家(热点专家)
  • 系统 RAM:持有全部 24,576 个专家
  • CPU:并行处理 GPU 缓存未命中的专家计算
  • SSD:存储大型查找表,按需加载

这就像厨房的布局:常用食材放在台面上(GPU),其余放在储藏室里(RAM/SSD),按需取用。

猜测-验证(Guess-and-Check)加速

一个小型辅助模型先猜测接下来的几个 token,大模型一次性验证所有猜测。如果猜对了,就直接采纳,相当于一次前向传播生成多个 token——整体速度提升 1.6-1.8 倍。

长文本分块读取

长文本(如 32K token 的文档或代码)以最大 8,192 token 的大块读取,达到每秒超过 1,000 token 的输入处理速度。

性能基准

在两台普通游戏 PC 上的实测数据:

配置量化级别生成速度输入处理速度
RTX 5070 (12GB) + 64GB RAMQ2_094 tok/s2,650 tok/s
IQ2_XS79 tok/s2,090 tok/s
IQ3_XXS62 tok/s1,750 tok/s
IQ3_S53 tok/s1,620 tok/s
RX 9070 XT (16GB) + 47GB RAMQ2_060 tok/s1,160 tok/s
IQ2_XS52 tok/s1,110 tok/s

60 tokens/秒已快过人类阅读速度。更大显存的显卡(如 RTX 3090 24GB)预计可达 100-140 tokens/秒。

模型变体与量化级别

Strata 提供多种模型变体以适配不同 RAM 容量:

系统 RAM推荐模型说明
32 GBCoder移除一半专家的代码特化版,达到完整模型 91% 的 SWE-bench Verified 得分
48 GBIQ2_XS 或 Q2_0更大的级别放不进去
64 GBIQ2_XS(推荐)/ IQ3_XXS / IQ3_S所有级别都能跑,IQ3_S 质量最好但最慢
96 GB+IQ3_S 或 Unsloth 4-bit有空间跑最大级别

另有 Swift 1.5 微调版(思考更短、回答更快)和 Unsloth UD-Q4_K_XL 实验版(最接近完整模型,但大部分从 SSD 读取,速度 7-8.5 tok/s)。

安装与使用

安装过程一键化:Windows 双击 START-HERE.bat,Linux 运行 ./setup.sh。安装器自动检测显卡、选择合适的引擎和模型、下载约 70 GB 模型文件(支持断点续传),完成后自动打开浏览器 http://127.0.0.1:8080。

也支持通过 AI 编程助手(Claude Code、Cursor、Codex、GitHub Copilot)自动安装,或通过 MCP server 由 AI 工具管理启停。

对外接口:

  • OpenAI 兼容 API:http://127.0.0.1:8080/v1
  • Anthropic 兼容 API:http://127.0.0.1:8080/v1/messages(Claude Code:ANTHROPIC_BASE_URL=http://127.0.0.1:8080)
  • 支持图片输入、思考级别调节(off/low/medium/high)、多 GPU 分摊、手机/远程访问

技术定位

Strata 属于 LLM 推理优化领域,核心贡献是将 MoE 模型的专家缓存分层化到消费级硬件的整个存储层级中(GPU → RAM → SSD),配合猜测-验证投机解码实现接近服务器级的推理速度。它不是一个新的模型,而是一个让现有大模型在普通 PC 上可用的推理引擎——降低了本地部署百亿参数模型的硬件门槛。

许可协议

Strata 以 MIT 许可证开源。底层模型 Qwen3.8-Flash-Next 由 Qwen 团队开发,量化版本由 ISTA-DASLab、UkisAI 和 Unsloth 提供,引擎基于 llama.cpp / ggml 构建。各组件和模型可能有自己的许可证。

相关开源项目