Strata 能在普通电脑上运行 Qwen3.8-Flash-Next。这是一个又大又聪明的 AI 模型,通常要用服务器才能跑。它能聊天、写代码、看图片,还能配合你的应用和编程智能体一起工作。所有数据都留在你的电脑上。
速度有多快?
我们在两台普通的游戏电脑上做了测试。一个 token 大约相当于 ¾ 个英文单词。
- 写回答: 短对话中回复出现的速度。每秒 60 个 token 已经比你的阅读速度还快。
- 读提示: 读入你发送内容的速度(这里是一份 32K token 的文档、代码或聊天记录)。
| NVIDIA:RTX 5070(12 GB)、Ryzen 5 7600、64 GB 内存 | AMD:RX 9070 XT(16 GB)、Ryzen 9 3900X、47 GB 内存 | ||||||||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
|
|
NVIDIA:Q2_0 用的是引擎 0.1.36,其他各行用的是 0.1.26(4K 回答,32K 提示)。完整表格见 DETAILS.md。显存越大的显卡越快:RTX 3090(24 GB)写回答应该能达到每秒约 100-140 个 token。长对话和其他显卡的数据:各模型的速度、 社区测试结果。
你需要什么
| 显卡 | NVIDIA GeForce RTX 20、30、40 或 50 系列,或 AMD Radeon RX 7900 XT / XTX、RX 7800 XT / 7700 XT、RX 9060 XT、RX 9070 / 9070 XT、Radeon AI PRO R9700 或 RX 6800 / 6900 系列。需要 12 GB 或以上显存。 |
| 内存 | 32 GB 或以上。内存大小决定能装下哪个模型。64 GB 可以运行所有规格。 |
| 硬盘 | 约 80 GB 可用空间。尽量用 SSD:第一次启动会快很多。 |
| 系统 | Windows 10 / 11 或 Linux,以及 NVIDIA 或 AMD 的最新显卡驱动。 |
其他的都由安装程序搞定。两到三张显卡可以分担同一个模型(多 GPU)。
实验性支持,由社区成员在自己的机器上编写和测试:
- 较老的显卡(Tesla P40 / V100、GTX 10、Radeon VII / MI50、RX 6700 XT、RX 5500 XT):较老的 GPU。
- Intel Arc,在 Linux 上从源码构建:Intel Arc。
- AMD Ryzen AI Max(Strix Halo),在 Linux 上从源码构建:Strix Halo。
- 不支持 AVX2 的老处理器:能用,但很慢。较老的 CPU。
完整列表:docs/INSTALL.md。
安装
让你的 AI 帮你装
你在用 AI 编程助手吗(Claude Code、Cursor、Codex、GitHub Copilot 等)?把下面这段粘贴给它:
Set up Strata on this PC for me: https://github.com/Niko1221/Strata - follow docs/AI_SETUP.md in that repository.
它会检查你的显卡、内存和硬盘,选出合适的模型。然后安装并启动它,再告诉你怎么连接你的应用。AI 工具也可以通过 Strata 的 MCP 服务器来安装、启动和停止 Strata。
或者自己动手
下载 Strata 并解压(或者用 git clone)。 Windows: 双击 START-HERE.bat。Linux: 在 Strata 文件夹里运行 ./setup.sh。
NVIDIA 和 AMD 的步骤完全一样。安装程序会识别你的显卡,并装好对应的引擎。它会问你几个问题:
- 用哪个模型、哪个规格,
- 上下文多大(模型能记住多少文字),
- 是否要识别图片。
每次直接按回车就是推荐选项。之后它会下载模型(约 70 GB)并启动。如果下载中断了,再运行一次即可:它会从中断的地方继续。 浏览器会打开 Strata 应用,地址是 http://127.0.0.1:8080。
模型启动时,你的电脑可能会变慢或卡住 1-3 分钟(第一次最久)。 Strata 会把 35-55 GB 加载到内存,并为显卡锁定其中一部分。这是正常的。请耐心等待,不要关闭窗口。 窗口里会显示 Strata 正在做什么。
下次使用时,再运行一次 START-HERE.bat(或 ./setup.sh)。它会马上启动,已下载的东西不会重复下载。关闭它的窗口就能停止模型。 UPDATE.bat(./update.sh)只更新 Strata,不启动。更新、Docker、多张显卡、文件存放位置以及所有选项: docs/INSTALL.md。
该选哪个模型
安装程序会根据你的内存推荐一个。同一个模型有几种规格,压缩程度不同。规格越小越快,越大越聪明一些。
| 你的内存 | 选择 | 原因 |
|---|---|---|
| 32 GB | Coder | 32 GB 装得下,而且专为代码打造(如果显卡是 24 GB,Q2_0 和 IQ2_XS 也能跑) |
| 48 GB | IQ2_XS(或 Q2_0,最快) | 更大的规格装不下 |
| 64 GB | IQ2_XS(推荐),或 IQ3_XXS / IQ3_S | 所有规格都装得下;IQ3_S 最好,也最慢 |
| 96 GB 或以上 | IQ3_S,或 Unsloth 的 UD-IQ4_XS(约 4-bit) | 开着其他程序也能放下最大的规格 |
- Coder: 编程版本,去掉了一半专家。它达到完整模型 SWE-bench Verified 分数的 91%(由其作者测得), 32 GB 内存就能装下。代码以外的能力较弱,包括中文和其他中日韩文本(#438)。这类用途请选 Q2_0、IQ2_XS 或 IQ3_S, 它们保留了所有专家。
- Swift 1.5: 一个微调版本,回答前思考的时间短得多。你能更早拿到答案,质量基本不变。
- Unsloth UD-IQ4_XS: Unsloth 的约 4-bit 版本,质量介于 IQ3_S 和 UD-Q4_K_XL 之间。 下载 94 GB。内存少于约 80 GB 时,Strata 回答时要从 SSD 读取其中一部分,所以会更慢(NVMe SSD 有帮助)。
- Unsloth UD-Q4_K_XL(实验性):最接近完整模型。但 Strata 回答时要从 SSD 读取其中大部分内容,所以在 64 GB 的电脑上每秒只能写 7-8.5 个 token。
- OrcaRouter 的 Uncensored IQ3_XXS: 需要手动设置,不在安装程序的菜单里。
规格、下载以及各配置能装下什么:docs/MODELS.md。以后想再添加模型,运行 SETUP.bat(Linux:./setup.sh --setup)。
使用方法

Strata 应用的 Monitor(左),编程智能体正在写视频里的宝塔花园(右)
- 在浏览器里: 打开
http://127.0.0.1:8080。里面有 Chat(聊天)、实时 Monitor(监控模型和你的 GPU/CPU/内存),以及 About(设置和地址)。 - 你的应用和编程智能体: 添加一个“OpenAI 兼容”的提供商,base URL 填
http://127.0.0.1:8080/v1。 API key 和模型名随便填都行。- 使用 Anthropic API 的应用:
http://127.0.0.1:8080/v1/messages(Claude Code:ANTHROPIC_BASE_URL=http://127.0.0.1:8080)。 - Codex CLI 和其他使用 OpenAI Responses API 的应用:
/v1/responses(设置方法)。
- 使用 Anthropic API 的应用:
- 思考: 在聊天菜单或应用的“reasoning effort”里选择 off、low、medium 或 high。off 最快, high 最适合难题。
- 图片: 在安装时对“Images?”选是。然后在聊天里点 Picture,或在你的应用里附上图片。 AMD 显卡在 Linux 上通过处理器识别图片;在 Windows 上暂时还不行。
- 从手机或另一台电脑访问:
START-HERE.bat --setup --host 0.0.0.0 --api-key <secret>。一定要设置 key。 - 一次处理一个请求: 默认情况下 Strata 一次只回答一个请求,其他请求排队等待。想同时回答多个, 设置
"parallel": 2(BATCHING.md)。在 12 GB 显卡上,这会让每个回答变慢。 - 长提示: Strata 会完整读入对话的第一条消息,大约每 30,000 个 token 需要 1 分钟。之后的消息几秒内就开始回答。
出问题了?
- Strata 第一次启动时电脑卡死了。 加载模型时这是正常的。请耐心等待,不要关闭窗口。 10 分钟后还卡着?重启电脑,关掉其他程序再试一次,或者换一个更小的规格。
- 下载或安装时中断了。 再运行一次
START-HERE.bat(或./setup.sh)。它会从中断的地方继续。 - 非常慢,硬盘灯一直闪,或者提示“the engine stopped unexpectedly”。 你的电脑可用内存不够。 关掉其他程序(浏览器很占内存),或者换一个更小的规格(Q2_0 或 IQ2_XS)。
- 提示 8080 端口已被占用。 Strata 已经在运行了。找一下它的窗口。
更多问题和解决办法:docs/TROUBLESHOOTING.md。还是解决不了?提交一个 issue,并附上 Strata 文件夹里的 strata-<model>.log。发现了安全问题? 请私下报告:SECURITY.md。
它是怎么工作的?
这类模型通常运行在拥有数百 GB 显存的服务器上。而你的显卡只有 12-24 GB。Strata 让模型装得下的办法是 把工作分摊到整台电脑上。可以想象一个厨房:常用的东西放在台面上,其余的放在储藏室里。

- 这个模型是由 24,576 个小专家(“experts”)组成的团队。 每个词只需要其中 10 个。
- 你的显卡 存放最常用的几千个专家。你的内存 存放全部专家, 你的处理器 同时处理其余的部分。你的 SSD 存放一张大查找表。

- 先猜,再检查: 一个小助手先猜接下来的几个词,大模型再一次性检查它们。答案完全一样,但快 1.6-1.8 倍。
- 长文本分大块读入(每次最多 8,192 个 token),速度超过每秒 1,000 个 token。
更详细的解释:docs/HOW_IT_WORKS.md。每个部分及其数据: 详细说明和论文。
原创文章,作者:云东方,如若转载,请注明出处:https://www.yundongfang.com/Yun878.html