OPEN SOURCE DEEP DIVE
Strata:在消费级 PC 上运行 1250 亿参数 MoE 模型的本地推理引擎
Strata 是一个基于 llama.cpp/ggml 构建的开源本地推理引擎,通过 MoE 专家分层缓存(GPU→RAM→SSD)和猜测-验证投机解码,让 12GB 显存的消费级显卡也能运行 Qwen3.8-Flash-Next 1250 亿参数模型,生成速度达 53-94 tokens/秒。
项目概述
Strata 是一个开源的本地推理引擎,能在普通游戏 PC 上运行 1250 亿参数的 Qwen3.8-Flash-Next 大模型。它基于 llama.cpp / ggml 构建,支持 NVIDIA(RTX 20-50 系列)和 AMD(RX 6000-9000 系列)显卡,最低 12 GB 显存即可启动。所有推理在本地完成,数据不离开你的电脑。
解决什么问题
1250 亿参数的 MoE 模型通常需要服务器级硬件(数百 GB 显存)才能运行。Strata 的核心创新在于将推理工作分摊到整台 PC 上——GPU、RAM、CPU 和 SSD 协同工作,让消费级硬件也能跑起百亿参数模型。
核心架构
Strata 的技术设计围绕两个关键理念:
MoE 专家分层缓存
Qwen3.8-Flash-Next 是一个拥有 24,576 个专家的 MoE 模型,但每个 token 只需激活其中 10 个。Strata 利用这一特性做分层缓存:
- GPU 显存:缓存最常被请求的数千个专家(热点专家)
- 系统 RAM:持有全部 24,576 个专家
- CPU:并行处理 GPU 缓存未命中的专家计算
- SSD:存储大型查找表,按需加载
这就像厨房的布局:常用食材放在台面上(GPU),其余放在储藏室里(RAM/SSD),按需取用。
猜测-验证(Guess-and-Check)加速
一个小型辅助模型先猜测接下来的几个 token,大模型一次性验证所有猜测。如果猜对了,就直接采纳,相当于一次前向传播生成多个 token——整体速度提升 1.6-1.8 倍。
长文本分块读取
长文本(如 32K token 的文档或代码)以最大 8,192 token 的大块读取,达到每秒超过 1,000 token 的输入处理速度。
性能基准
在两台普通游戏 PC 上的实测数据:
| 配置 | 量化级别 | 生成速度 | 输入处理速度 |
|---|---|---|---|
| RTX 5070 (12GB) + 64GB RAM | Q2_0 | 94 tok/s | 2,650 tok/s |
| IQ2_XS | 79 tok/s | 2,090 tok/s | |
| IQ3_XXS | 62 tok/s | 1,750 tok/s | |
| IQ3_S | 53 tok/s | 1,620 tok/s | |
| RX 9070 XT (16GB) + 47GB RAM | Q2_0 | 60 tok/s | 1,160 tok/s |
| IQ2_XS | 52 tok/s | 1,110 tok/s |
60 tokens/秒已快过人类阅读速度。更大显存的显卡(如 RTX 3090 24GB)预计可达 100-140 tokens/秒。
模型变体与量化级别
Strata 提供多种模型变体以适配不同 RAM 容量:
| 系统 RAM | 推荐模型 | 说明 |
|---|---|---|
| 32 GB | Coder | 移除一半专家的代码特化版,达到完整模型 91% 的 SWE-bench Verified 得分 |
| 48 GB | IQ2_XS 或 Q2_0 | 更大的级别放不进去 |
| 64 GB | IQ2_XS(推荐)/ IQ3_XXS / IQ3_S | 所有级别都能跑,IQ3_S 质量最好但最慢 |
| 96 GB+ | IQ3_S 或 Unsloth 4-bit | 有空间跑最大级别 |
另有 Swift 1.5 微调版(思考更短、回答更快)和 Unsloth UD-Q4_K_XL 实验版(最接近完整模型,但大部分从 SSD 读取,速度 7-8.5 tok/s)。
安装与使用
安装过程一键化:Windows 双击 START-HERE.bat,Linux 运行 ./setup.sh。安装器自动检测显卡、选择合适的引擎和模型、下载约 70 GB 模型文件(支持断点续传),完成后自动打开浏览器 http://127.0.0.1:8080。
也支持通过 AI 编程助手(Claude Code、Cursor、Codex、GitHub Copilot)自动安装,或通过 MCP server 由 AI 工具管理启停。
对外接口:
- OpenAI 兼容 API:
http://127.0.0.1:8080/v1 - Anthropic 兼容 API:
http://127.0.0.1:8080/v1/messages(Claude Code:ANTHROPIC_BASE_URL=http://127.0.0.1:8080) - 支持图片输入、思考级别调节(off/low/medium/high)、多 GPU 分摊、手机/远程访问
技术定位
Strata 属于 LLM 推理优化领域,核心贡献是将 MoE 模型的专家缓存分层化到消费级硬件的整个存储层级中(GPU → RAM → SSD),配合猜测-验证投机解码实现接近服务器级的推理速度。它不是一个新的模型,而是一个让现有大模型在普通 PC 上可用的推理引擎——降低了本地部署百亿参数模型的硬件门槛。
许可协议
Strata 以 MIT 许可证开源。底层模型 Qwen3.8-Flash-Next 由 Qwen 团队开发,量化版本由 ISTA-DASLab、UkisAI 和 Unsloth 提供,引擎基于 llama.cpp / ggml 构建。各组件和模型可能有自己的许可证。