ESC
开源 1 分钟阅读

在 RTX 4090 消费级硬件上以每秒 100 tokens 运行 Qwen 3.8 Flash Next (125B)

开源项目 Strata 让消费级硬件也能流畅运行大模型:RTX 4090 运行 Qwen 3.8 Flash Next (125B) 可达每秒约 100 tokens,RTX 3090 预计 100-140 tokens/s。项目要求 12GB 以上显存、32GB 内存,支持 NVIDIA/AMD 显卡与多 GPU 协同,并提供 AI 编程助手自动安装、MCP 服务器等社区实验功能。

来源:Hacker News

NVIDIA:Q2_0 使用 0.1.36 版引擎,其余各行使用 0.1.26(4K 回答,32K 提示)。完整表格见 DETAILS.md。显存更大的显卡速度更快:RTX 3090(24 GB)应能达到每秒约 100-140 tokens。长对话与其他显卡的表现见:各模型速度、社区测试结果。

Buy Me A Coffee

Strata 是免费的。如果它在你的电脑上运行良好,请作者喝杯咖啡可以让这项工作继续下去。

显卡 NVIDIA GeForce RTX 20、30、40 或 50 系列,或 AMD Radeon RX 7900 XT / XTX、RX 7800 XT / 7700 XT、RX 9060 XT、RX 9070 / 9070 XT、Radeon AI PRO R9700 或 RX 6800 / 6900 系列。需要 12 GB 以上显存。

内存 32 GB 或以上。你的内存决定哪种模型适合你。64 GB 可运行所有规格。

硬盘 约 80 GB 可用空间。尽量使用 SSD:首次启动会快很多。

系统 Windows 10 / 11 或 Linux,以及来自 NVIDIA 或 AMD 的最新显卡驱动。

安装程序会搞定其余一切。两三张显卡可以共同分担模型(多 GPU)。

以下为实验性功能,由社区成员在自己的机器上编写并测试:

让你的 AI 帮你搭建

你使用 AI 编程助手(Claude Code、Cursor、Codex、GitHub Copilot 等)吗?把这段话粘贴给它:

Set up Strata on this PC for me: https://github.com/Niko1221/Strata - follow docs/AI_SETUP.md in that repository.

它会检查你的显卡、内存和硬盘,挑选合适的模型,然后安装并启动,并告诉你如何连接你的应用。AI 工具还可以通过 Strata 的 MCP 服务器来安装、启动和停止 Strata。

下载 Strata 并解压(或用 git clone 克隆)。 **Windows:**双击 START-HERE.bat。**Linux:**在 Strata 文件夹中运行 ./setup.sh。

NVIDIA 和 AMD 的步骤相同。安装程序会找到你的显卡并为其配置合适的引擎。它会问你几个问题:

每次直接按回车选择推荐答案即可。然后它会下载模型(约 70 GB)并启动。如果下载中断,再次运行即可:它会从断点继续。你的浏览器会打开 http://127.0.0.1:8080 上的 Strata 应用。

模型启动期间,你的电脑可能会变慢或无响应 1-3 分钟(首次启动时间最长)。Strata 会将 35-55 GB 数据加载进内存,并为显卡锁定其中一部分。这是正常现象。请耐心等待,不要关闭窗口。窗口会显示 Strata 正在做的事情。

下次再次运行 START-HERE.bat(或 ./setup.sh)即可。它会立即启动,不会重复下载。关闭其窗口即可停止模型。UPDATE.bat(./update.sh)可在不启动模型的情况下更新 Strata。关于更新、Docker、多张显卡、文件存放位置及所有选项:docs/INSTALL.md。

安装程序会根据你的内存推荐合适的规格。同一模型有多种规格,压缩程度不同。规格越小速度越快,规格越大略微更聪明。

各规格的大小、下载体积及适配情况:docs/MODELS.md。以后想添加其他模型,运行 SETUP.bat(Linux:./setup.sh --setup)。

The Strata app

编程智能体编写视频中的宝塔花园时,Strata 应用的 Monitor 界面(左)

更多内容:聊天记录存储位置、API 使用。