Quansloth 本地 AI 服务器使用手册
📋 目录
项目简介
什么是 Quansloth?
Quansloth 是一个基于 Google TurboQuant (ICLR 2026) 技术构建的本地 AI 服务器,专为消费级 GPU 设计。它通过 KV 缓存压缩技术,可以在有限的显存上运行大规模上下文的大型语言模型。
核心特性
| 75% 显存节省 | 通过 TurboQuant 技术将 KV 缓存从 16-bit 压缩到 4-bit |
| 超长上下文 | 在 6GB GPU 上运行 32k+ token 上下文 |
| 实时硬件监控 | UI 实时显示 VRAM 分配和节省情况 |
| 文档注入 | 支持 PDF/TXT/CSV/MD 文档直接输入 |
| Cyberpunk UI | 暗色主题 Gradio 界面 |
技术架构
┌─────────────────────────────────────────────────────────┐
│ Gradio Web UI │
│ (Port 7860) │
├─────────────────────────────────────────────────────────┤
│ OpenAI API Client │
│ (http://127.0.0.1:8080/v1) │
├─────────────────────────────────────────────────────────┤
│ llama.cpp TurboQuant Backend │
│ (Port 8080, CUDA Accelerated) │
└─────────────────────────────────────────────────────────┘
核心优势
- 防止 OOM 崩溃: 标准 LLM 推理在处理长文档时会遇到\”内存墙\”,Quansloth 通过压缩 AI 的\”记忆\”(KV 缓存)从 16-bit 到 4-bit 来防止崩溃
- 硬件级稳定性: 界面监控 CUDA 后端,确保模型在 GPU 物理限制内运行
- 适合预算 GPU: 在 RTX 3060 6GB 上运行需要 RTX 4090 24GB 的任务
系统要求
硬件要求
| GPU | NVIDIA RTX 3060 6GB | RTX 4090 24GB | 双卡 RTX 5060 Ti 16G ✅ |
| 显存 | 6GB | 16GB+ | 32GB (16G×2) ✅ |
| 内存 | 16GB RAM | 32GB RAM | 建议 32GB+ |
| 存储 | 10GB 可用空间 | 50GB+ SSD | 建议 NVMe SSD |
软件要求
| 操作系统 | Ubuntu 20.04+ / WSL2 | – |
| NVIDIA 驱动 | 535+ | nvidia-smi 检查 |
| CUDA Toolkit | 12.0+ | sudo apt install nvidia-cuda-toolkit |
| Python | 3.10 | conda create -n quansloth python=3.10 |
| Git | 2.30+ | sudo apt install git |
| CMake | 3.20+ | sudo apt install cmake |
| Build Essential | – | sudo apt install build-essential |
网硕互联帮助中心




评论前必须登录!
注册