三元量化 + 高性能推理引擎 + 视觉识图 + 一键启动,解压即用。
想在本地跑大模型,但显存只有 8GB?
27B 参数的模型全精度要 18GB 显存,连 12GB 卡都装不下。但通过三元量化(1.58-bit),权重被压缩到不到 6GB——8GB 卡不仅能装下,还能跑出 60 tok/s 的解码速度,配合投机解码更是能突破 100 tok/s。
这篇文章分享一个我整理的本地推理整合包:基于 NInfer 推理引擎 + Bonsai2-27B 三元量化模型,在 RTX 5060 Laptop(8GB 显存)上实测可用,解压后双击就能跑。
组件说明
NInfer 推理引擎 (sm_120a)专为 RTX 50 系列优化的高性能单卡推理引擎
默认模型Bonsai2-27B PTQ1 三元量化,纯文本,5.96 GB
视觉模型同上 + 视觉塔,能看图识图,6.23 GB
破限模型同上 + 去审查处理(Heretic),5.96 GB
一键启动器start.bat 三选一菜单,选完直接起服务
WinRAR附带一份无广告解压工具,方便没装的用户
总大小约 20GB(解压后),不需要安装任何额外软件。
默认版视觉版破限版
文本对话✅✅✅
图片识别❌✅❌
内容限制有有无
推荐场景日常首选看图问答、图表分析创意写作、无限制对话
三个模型底座相同(Qwen3.8-27B),智能水平一致。实测在 20 题社区基准上得分 19/20 = 95%,和全精度 27B 模型持平。
这个包是给 RTX 50 系列(5060 / 5070 / 5080 / 5090)准备的。
项目要求
显卡NVIDIA RTX 50 系列(sm_120a 架构)
显存8 GB 及以上
内存16 GB 起步,64 GB 体验最好
系统Windows
驱动最新版 NVIDIA 驱动
不需要额外安装 CUDA、Python 或任何运行库,引擎自带了全部依赖。
40 系和 30 系跑不了(架构不同,引擎不通用)。
第一步:解压
release.rar(引擎 + 启动脚本)到任意不含中文的路径models.rar,把三个 .ninfer 模型文件放进 release\models\ 目录第二步:启动
双击 start.bat,看到菜单:
============================================================
Bonsai2-27B launcher (port 1234, model id qwen3.8-27b)
============================================================
1 default text only, smallest VRAM (max-tokens 32768)
2 vision read images (cpu tower) (max-tokens 32768)
3 heretic uncensored, text only (max-tokens 32768)
Q quit
------------------------------------------------------------
Enter 1 / 2 / 3 (default 1):
输入数字回车,约 5 秒后看到 listening on http://127.0.0.1:1234 就成功了。
第三步:连接
打开你常用的 AI 客户端(OpenWebUI、ChatBox、Cherry Studio、甚至 curl),填入:
http://127.0.0.1:1234/v1qwen3.8-27b就可以聊天了。关掉黑窗口停止服务。
视觉版模型配合 overlay 模式,视觉塔在 GPU 上加速运行,图像编码约 50-75ms 完成。支持发图问答、图表识别、截图分析。
需要注意:发图时图片要排在文字前面(API 层面是 image_url 在 content 数组第一位),否则图片会被静默丢弃——这是引擎的一个小坑,不报错,只是不读图。
默认不开思考(回复最快)。遇到数学、逻辑、编程等需要深度推理的问题,在请求里加 "reasoning_effort": "high" 或 "xhigh" 即可开启思考模式。
实测 xhigh 档在 20 题基准上打到 95%,和全精度模型一样。
引擎支持 KVMem ring 模式:GPU 上保持一个热窗口(6K-16K token),超出部分自动换到主机内存。逻辑上下文上限 256K token,配合 64GB 内存体验最佳。
长文档、长对话、多轮 agent 任务都能撑住。
想加密码保护?在 start.bat 旁边放一个 api-key.txt,里面写一行密码,重启就生效。客户端填同样的 key 才能连。删掉文件就回到无密码状态。
指标数值
引擎冷启动约 5 秒
文本解码45-60 tok/s
投机解码(MTP K=4)峰值 100+ tok/s
文本预填充400-600 tok/s
图像编码(视觉版)50-75 ms/张
显存占用约 6.5-7 GB
内存占用16-24 GB(host KV 池)
注:不同任务和文本长度会有波动,以上为多次实测的典型值。
这个包背后是几个开源/公开项目的组合:
三元量化将每个权重压至 ~1.58 bit({-1, 0, +1}),信息论下限附近,配合 Hadamard 旋转基维持表达力。实测 PPL 6.445(全精度参照 6.82 ± 0.54),20 题基准 19/20,和全精度模型打平且错题相同。
引擎的 KVMem ring 模式用"查询条件化的内容打分"决定哪些 KV 页留在 GPU、哪些换到内存,让 8GB 卡也能跑 256K 上下文而不丢历史。
github.com/Neroued/ninfer夸克网盘:https://pan.quark.cn/s/2110c41ea363
如有问题欢迎留言交流。