Strata 让游戏 PC 跑 125B 大模型,RTX 4090 可达 100T/s
开源工具 Strata 让 Qwen3.8-Flash-Next 在消费级显卡上本地运行,无需服务器。实测 RTX 5070 与 RX 9070 XT 均能流畅生成,RTX 4090 预计每秒写 100-140 token。模型完全本地运行,数据不出 PC,对隐私敏感和低成本用户很有吸引力。
Strata 是一个免费开源工具,目标是把 1250 亿参数的 Qwen3.8-Flash-Next 模型搬到普通游戏电脑上。这个模型原本需要服务器级硬件,现在被压缩到 12 GB 显存以上的 NVIDIA 或 AMD 显卡就能跑,支持 Windows 和 Linux。它不仅能聊天,还能写代码、读图,并兼容 OpenAI 和 Anthropic 的 API,方便接入 Claude Code、Cursor 等编程助手。
实测数据来自两台普通游戏电脑:一台是 RTX 5070(12 GB)加 Ryzen 5 7600 和 64 GB 内存,另一台是 RX 9070 XT(16 GB)加 Ryzen 9 3900X 和 47 GB 内存。在 32K token 的输入提示下,RTX 5070 的写入速度接近 60 token/秒,这个速度已经比人阅读还快。官方还估计,拥有 24 GB 显存的 RTX 3090 能达到约 100-140 token/秒。
安装过程不算复杂:下载解压后,双击 START-HERE.bat(或运行 ./setup.sh),安装程序会自动检测显卡和内存,推荐合适的模型版本。首次启动需要下载约 70 GB 的模型文件,中途断了还能断点续传。模型加载时会占用 35-55 GB 内存,期间电脑可能卡顿 1-3 分钟,这是正常的。浏览器会打开本地界面,默认地址是 http://127.0.0.1:8080。
Strata 还支持多 GPU 分摊模型,也提供针对代码优化的 Coder 版本(砍掉一半专家,SWE-bench 得分达到原版的 91%)。如果你用 AI 编程助手,可以直接把仓库地址粘给它,让 AI 自动完成安装配置。项目的社区成员也在测试老旧显卡(如 Tesla P40、GTX 10 系列)和 Intel Arc 的兼容性。
本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。