AI+ 2026-10-02

Strata:把 125B 大模型塞进游戏显卡的开源项目

2026 年 10 月 2 日,开源项目 Strata 冲上 Hacker News 首页(590+ 分):它让阿里的 Qwen3.8-Flash-Next(1250 亿参数)在普通游戏 PC 上流畅运行——NVIDIA 或 AMD 显卡、12GB 显存起步、Windows/Linux 皆可,免费开源,数据完全不出本机。「服务器级」大模型进入消费级硬件,这是本地部署门槛的又一次实质性下探。

实测数据(项目 README 口径)

  • RTX 5070(12GB 显存):Q2_0 量化下生成 94 tokens/s、读取(32K 长上下文)2,650 tokens/s——94 tokens/s 已快于常人的阅读速度;
  • RX 9070 XT(16GB):生成 60 tokens/s、读取 1,160 tokens/s;
  • 24GB 显存的 RTX 3090 预计可达 100-140 tokens/s(HN 热帖标题所称「RTX 4090 上 100 tokens/s」即这一量级);
  • 支持 128K 上下文(RTX 5070 + IQ3_S 量化);能聊天、写代码、读图片,并可与编程 agent 协作。

官方案例颇具展示性:在 RTX 5070 上以一次提示词生成了一座可交互的体素(voxel)宝塔花园。

为什么重要:三层门槛同时坍缩

过去一年本地大模型的叙事是「小模型够用了」——7B、14B 模型进家庭设备。Strata 展示的是另一条路径:用极致量化 + 推理引擎优化,让「旗舰级」的大模型进消费级硬件。三层门槛同时变化:

  1. 1硬件门槛:12GB 显存(一张中端卡)就能跑百亿级参数模型,不再需要 48GB 的专业卡;
  2. 2成本门槛:本地推理零边际成本,对高频调用场景(内部知识库、代码助手、文档处理)意味着账单直接归零;
  3. 3合规门槛:数据不出本机,对金融、医疗、政务等强合规行业,本地部署从「无奈的自建」变成「顺手的选择」。

需要保持清醒的量化代价:Q2_0/IQ3 级别的高压缩量化必然伴随质量损失,官方基准之外的第三方评测尚未跟上——「能跑」与「生产可用」之间仍有距离。

对企业的启示

  1. 1试点成本清单化:一张 RTX 5070 级显卡 + 开源模型栈即可搭建 PoC,AI 落地试点的硬件预算从「数十万」降到「数千元」量级,值得各部门把「本地小试点」列入季度计划;
  2. 2国产模型的反向输出:Qwen 系列持续成为海外本地部署生态的首选基座之一——国产开源模型在国际开发者生态的地位已从「备选项」变为「默认项」;
  3. 3ProMen 为企业提供 AI 私有化部署咨询:从硬件选型、模型量化到与现有系统(含 FileMaker)的集成。如果您在评估本地化 AI 方案,欢迎与我们交流。

继续阅读