市场概览
查看全部动态 →QuelLLM 产品套件 — 参考指南 按用途.
每种用途一套套件:完整指南、可直接粘贴的配置,以及可终身访问的在线空间。
根据条件查找合适的 LLM 您的需求
不想使用配置工具?我们的主题榜单按使用场景和硬件,精选可自行托管的最佳模型。
文档 QuelLLM.
335+ 适用于 Windows、macOS 和 Linux 的法语教程。每篇指南都会注明实际执行的测试,内容涵盖从首次安装到高级 RAG 和微调技术。
精选
——我们的核心指南在 Windows 11 上安装 Ollama:完整指南(2026)
下载适用于 Windows 11 的 Ollama,安装后启用 GPU(CUDA),并运行第一个模型:2026 年分步指南,涵盖常见错误。
RTX 4090 (24 GB) 适合运行哪个 LLM?
RTX 4090 24 GB,2026年面向大众的本地AI标杆产品。Qwen 3.8 27B,Devstral 24B,gpt-oss 20B,GLM 4.7 Flash,tokens/sec基准测试,CUDA Ada优化。
RTX 5090 (32 GB) 适合运行哪个 LLM?
2025 年 RTX 5090:32 GB GDDR7 显存,带宽为 1792 GB/s。在本地运行 2026 年的大型 MoE 模型(Qwen 3.6 35B-A3B、Nemotron 3.5 Lightning)以及采用长上下文的 Qwen 3.8 27B,基准测试与理想配置。
本地部署 DeepSeek V4 Pro:VRAM、硬件与安装
运行 DeepSeek V4 Pro(1.6T MoE,49B 激活参数,MIT 协议)需要什么机器?所需 VRAM/RAM、本地安装、与 GPT-5 的基准测试对比及实际限制。
LM Studio 新手入门:10 分钟完成首次本地对话
使用 LM Studio 运行您的第一个本地 LLM:在 10 分钟内完成安装、下载模型并开始对话。无需命令行操作,非常适合初学者。
RTX 3060 12 GB 上适合运行哪个 LLM?
RTX 3060 12 GB:低预算 LLM GPU 的经典之选。二手 12 GB 显卡售价 250 欧元,Gemma 4 12B、Qwen 3.5 9B、Granite 4.2 8B,详细基准测试。
DeepSeek V4 Flash 284B:能在 Mac Studio 上运行的首个前沿模型
DeepSeek V4 Flash 284B MoE(13B 活跃参数,MIT 许可证,1M 上下文):首个可在工作站上运行的前沿模型。在 Mac Studio Ultra 上安装、基准测试,以及与 Pro 的对比。
在 macOS(Apple Silicon)上安装 Ollama:2026 指南
充分利用 Metal 和 M1/M2/M3/M4 的统一内存
Mac mini M4 / M4 Pro(16–64 GB)适合跑哪个 LLM?
Mac mini M4:2026 年本地 AI 的最佳性价比。基准测试、推荐配置、家用服务器用途。
RTX 3090 / 3090 Ti (24 GB) 适合运行哪个 LLM?
二手 RTX 3090 和 3090 Ti 24 GB:2026 年运行 LLM 依然表现出色。Qwen 3.8 27B、Qwen3-Coder 30B、基准测试、性价比评估、散热。
12 GB 显存适合运行哪个 LLM?
12 GB VRAM(RTX 3060 12GB、4070、5070):2026 年的理想配置档位。Qwen 3.5 9B Q8 量化,Gemma 4 12B,多阶段 RAG。终极指南。
本地部署 Qwen 3.8 27B:Ollama 安装与 VRAM 需求
本地运行 Qwen3.8-27B:准确的 Ollama 命令、各量化版本的显存需求、Mac 上的 MLX 版本、256k 上下文的陷阱、思考模式及官方基准测试。
您的第一次本地对话
启动 Ollama,加载 Mistral,开始对话。第一天的教程。
RTX 5070 Ti (16 GB) 适合运行哪个 LLM?
RTX 5070 Ti 16 GB:2025 年本地 AI 性能与价格的理想平衡点。Ollama 基准测试,轻松运行 14B/24B 模型,与 4070 Ti Super 对比。
MacBook Pro M4 Pro / Max(24–128 GB)适合跑哪个 LLM?
MacBook Pro M4 Pro / Max 2025:带宽 546 GB/s,哪些模型能真正发挥芯片的性能,实际使用有哪些限制。
RTX 4070 / 4070 Super / 4070 Ti (12 GB) 适合运行哪个 LLM?
RTX 4070、4070 Super 和 4070 Ti 12 GB:LLM 对比、可轻松运行的 13B 模型、12 GB 的限制及实测基准结果。
Ollama、LM Studio、Jan 与 GPT4All 对比
汇总表,帮助您选择适合自身情况的工具。
8 GB 显存适合运行哪个 LLM?
8 GB VRAM(RTX 3050/3060 8GB、4060、5050、5060)完整指南:Qwen 3.5 9B、Granite 4.2 8B,以及充分利用显存的技巧。
企业中的编程 AI:保护专有代码、NDA 和工业机密
为受 NDA 和工业机密保密要求约束的开发团队部署 100% 本地运行的编程 AI(Ollama + Cline + Aider + Tabby):为什么 Copilot 和 Cursor 会暴露你的专有代码,GDPR 和 AI Act 有哪些要求,工作站部署与 Tabby GPU 服务器部署的架构对比,以及验证数据不外泄的审计。
5 分钟安装 Ollama(Windows、macOS、Linux)
如何在 Windows、macOS 和 Linux 上用 5 分钟安装 Ollama:RAM/GPU 要求、必备命令,以及安装后紧接着启动的第一个本地模型。
提示词工程基础
组织好请求内容,以获得有用的回答。
MacBook Pro M3 Pro / Max(18–128 GB)适合跑哪个 LLM?
MacBook Pro M3 Pro / Max:2026 年最适合本地 AI 的笔记本电脑。Qwen 3.6 35B-A3B,128k 上下文,Flash Attention。
RTX 5080 (16 GB) 适合运行哪个 LLM?
RTX 5080 Blackwell:16 GB GDDR7,带宽 960 GB/s。Qwen 3.5、Granite 4.2、Gemma 4、gpt-oss、Devstral 的 Q4 基准测试。Ollama 最佳配置。
16 GB 显存适合运行哪个 LLM?
16 GB VRAM(RTX 4070 Ti Super、5070 Ti、5080、4060 Ti 16GB):Mistral Small 24B、Devstral 24B、gpt-oss 20B,2026 年的专业级配置档位。
本地 LLM 选什么 GPU?RTX 4070 至 5090,Mac(2026)
RTX 4070 vs 4090 vs Mac M-Max:2026年购买指南。
本地 RAG:简介
理解检索增强生成(RAG),以便与您的文档对话
Mac Studio (M2 / M3 / M4 Ultra, 64–512 GB) 上选哪个 LLM?
Mac Studio Ultra:最高 512 GB 统一内存。本地运行 Llama 4 Maverick 402B、Qwen3-235B、DeepSeek 671B。高级用户指南。
RTX 4080 / 4080 Super(16 GB)上能运行哪个 LLM?
使用 16 GB 的 RTX 4080 和 4080 Super 运行本地 LLM:所有能装入显存的模型、基准测试、4080 与 4080 Super 对比及购买建议。
Radeon RX 7900 XTX (24 GB) 适合哪个 LLM?
Radeon RX 7900 XTX 24 GB:运行 LLM 时可替代 RTX 4090 的 AMD 显卡。ROCm 6.x、Qwen 3.8 27B、每秒 token 数基准测试、2026 年评估结论。
24 GB 显存该选哪个 LLM?
24 GB VRAM(RTX 3090、4090、RX 7900 XTX):Qwen 3.8 27B 完全载入显存,大型 MoE 35B-A3B,LoRA 微调。面向高要求的配置档位。
评测与测试 AI工具.
当本地运行无法满足需求时,哪些在线服务值得您付费?评估了 14 个品牌,排除了其中 7 个。每份介绍都先列出免费的本地替代方案。
三条路径,
根据您的身份而定。
每条学习路线都由一系列指南组成,专为特定人群设计,从首次下载一直到完成可正常使用的配置。
« 我只想试试,不想折腾。 »
您听说过本地LLM,想看看在自己的设备上运行效果如何。无需代码,无需系统配置——10分钟内即可与您的第一个模型对话。