此刻 — 人在看
快讯

专题GitHub 热门 AI 开源项目

要闻·应用与智能体·2026-10-05 20:15

开源 Strata 让 1250 亿参数模型跑在 12GB 显存的游戏电脑上

9 月 24 日,开发者 Niko1221 在 GitHub 发布了开源推理引擎 Strata(MIT 协议),只干一件事:让 1250 亿参数的 Qwen3.8-Flash-Next 跑在普通游戏电脑上——12GB 显存、32GB 内存就够。项目上线 12 天拿下超 1.2 万 star、1000+ fork,Hackaday 等媒体跟进报道。

GitHub 下载 →

事件经过

Strata 不是模型,是推理引擎。作者 Niko1221 只针对一个模型:阿里 Qwen 团队的 Qwen3.8-Flash-Next——1250 亿总参数的 MoE(混合专家)架构,包含 24576 个“专家”小网络,但每生成一个词只需要其中约 10 个,实际参与计算的只有约 60 亿参数。1250 亿参数必须随时可用,但同一时间参与计算的只有一小部分。

传统方案是整层 offload——把 transformer 层在显存和内存之间来回搬,PCIe 成了瓶颈。Strata 按专家热度分级:最常用的几千个专家缓存在显存里,全部 24576 个专家钉在内存中,CPU 同时算那些没进显存的部分,SSD 上放一张约 29GB 的 n-gram 查找表做提示词预处理。再加上 MTP(多 token 预测)投机解码——小层先猜几个词,大模型一次验完,官方称提速 1.6–1.8 倍。安装方式:Windows 双击 bat、Linux 跑 setup.sh,对外暴露 OpenAI / Anthropic 兼容 API,能直接接 Cursor、Claude Code,还有 MCP server。

关键事实

  1. 门槛:12GB 以上显存(NVIDIA RTX 20/30/40/50 系、AMD RX 7900/7800/7700/9070 等)+ 32GB 以上内存 + 约 80GB 硬盘空间。Windows 10/11 或 Linux,一键安装;浏览器打开 localhost:8080 即用,也支持 MCP server。
  2. 速度:项目自测(RTX 5070 12GB):Q2_0 量化 94 tokens/s、IQ3_S 53 tokens/s,读提示词 1600–2650 tokens/s。社区独立验证:3 块 RTX 3090 上 120+ tokens/s(同配置 llama.cpp 约 20);RTX 2070 老卡也有方法严谨的 A/B 对比验证。
  3. 宣传数字与实测:“比 llama.cpp 快 6 倍”经社区实测同条件约 2 倍;运行门槛主要在内存而不是显存——64GB DDR5 目前约 913 美元,比一块 RTX 5070 还贵。
  4. 中文用户注意:1-bit 的 Coder 量化版中文输出系统性错误(issue #438:中文 0/10 正确,英文 10/10),README 自己也承认 Coder 版中文与 CJK 偏弱。要中文体验先选 Q2_0 / IQ2_XS 这些保留全部专家的版本。

背景

本地推理领域:llama.cpp 是通用引擎,vLLM 面向服务器端,Ollama 主打易用。Strata 只为一个模型做深度优化,利用 MoE 稀疏激活特性。Qwen 官方跑分里,Qwen3.8-Flash-Next 的 agentic coding 对标 Qwen3-27B,推理接近 Claude Opus 4.6(GPQA Diamond 91.7)。10 月 4 日项目发布 v0.1.39:输出一字不改,解码更快、支持更长上下文与多并发。12 天内发布 40 个版本、845 次提交。

为什么重要

1250 亿参数模型可在 12GB 显存、32GB 内存的游戏电脑上运行;社区实测速度约为 llama.cpp 的 2 倍,宣传为 6 倍。
有用 这篇对你有帮助,就点一下

信源GitHub(Niko1221/Strata,2026-09-24 发布)、Hackaday(2026-10-04)、Startup Fortune、linuxcompatible.org、AlphaSignal。本文为公开信息整理,不构成任何投资建议。

  1. 评论加载中…
问问小喵