开源推理框架 Strata 正式登场,借助创新的权重分层调度技术,消费级 12GB 显存显卡就能够本地运行 125B 参数大模型,不用依赖昂贵的多卡服务器硬件,普通 PC 用户也可以在本地电脑部署超大参数 AI 模型,实现离线推理。传统 125B 大模型完整权重加载需要数百 GB 显存,普通消费显卡无法直接承载,Strata 采用混合专家权重卸载、模型量化以及投机解码技术,把高频专家权重放入显卡显存,全部模型权重存放在系统内存,静态查找表放置在 SSD,三级存储协同调度,在 12GB 显存显卡上实现稳定推理,实测 RTX5070 12GB 显卡最高可以达到 94 词元每秒的生成速度。想要使用 Strata 在 12GB 显存显卡运行 125B 模型,先确认电脑硬件满足内存要求,下载 Strata 开源项目包与对应量化版 125B 模型权重,按照文档执行一键部署脚本,启动本地推理服务,调用兼容 OpenAI 接口的本地 API,就可以使用 125B 大模型进行对话、代码编写等任务。Strata 的出现打破了超大参数模型对高端服务器显卡的门槛限制,让 AI 爱好者和开发者可以在普通消费 PC 上体验本地 125B 大模型能力。
产品核心清单
- 项目主体:Strata 开源本地推理框架,MIT 开源协议,基于 C++ 与 CUDA 开发
- 核心能力:支持 12GB 显存消费显卡本地运行 125B 参数 Qwen3.8-Flash-Next 模型
- 核心技术:MoE 专家权重卸载、模型量化、投机解码,显存 / 内存 / SSD 三级调度
- 实测性能:RTX5070(12GB 显存)搭配 64GB 内存,最高可达 94 词元 / 秒
- 硬件门槛:显卡显存≥12GB,最低 32GB 内存,推荐 64GB 内存,预留约 70GB 硬盘空间
- 接口支持:本地部署后提供兼容 OpenAI、Anthropic 标准 API 接口,方便各类工具接入
【常见问题】
问题 1:Strata 框架可以实现什么效果,12GB 显存显卡能跑多大模型?
回答 1:Strata 框架正式登场,借助权重分层调度技术,12GB 显存显卡就能够本地运行 125B 参数大模型,在普通消费电脑实现离线 AI 推理。
问题 2:Strata 框架靠什么技术让 12GB 显存显卡运行 125B 模型?
回答 2:Strata 采用 MoE 专家权重卸载、模型量化、投机解码技术,采用显存、内存、SSD 三级存储协同,让 12GB 显存显卡可以承载 125B 大模型推理。
问题 3:使用 Strata 框架在 12GB 显存显卡运行 125B 模型需要什么额外硬件?
回答 3:使用 Strata 在 12GB 显存显卡运行 125B 模型,电脑最低配备 32GB 内存,推荐 64GB 内存,硬盘预留 70GB 空间存放模型权重文件。
【数据来源】
[2026-10-06](12GB 显存显卡跑 125B 模型:Strata 登场)IT 之家
[2026-10-05](Strata 实战:一张游戏显卡把 Qwen3.8-Flash-Next 125B 跑进 12GB 显存)YOMXXX
[2026-10-04](Strata runs a 125B model on a 12GB gaming GPU)AILog
免责声明
本内容信息仅供产品了解参考,Strata 框架部署要求、模型量化版本、推理性能表现等详情请以 Strata 项目 GitHub 官方仓库公布为准。
继续下一条素材吗?
