开发者 — “本地 Copilot,100% 离线,0 云延迟。”
通过 Continue.dev 将 Qwen2.5 Coder 32B 接入 VSCode。自动补全、聊天、整份文件的重构——您的代码一行都不会泄露给 Microsoft、OpenAI 或 Anthropic。您的 PR 中包含 API 密钥?它会留在 PR 中。
此流程结束后,您将拥有一个后台运行的llama.cpp服务器,搭载Qwen2.5 Coder 32B模型,采用Q4量化。Continue.dev将与VSCode集成,支持FIM自动补全和侧边栏聊天功能,延迟低于100毫秒,自动补全质量可媲美Copilot,部分情况下在近期代码上表现更优。
适用人群 适合哪些人?
我们更希望尽早告知您,而不是让您白白浪费30分钟。
- ✓你每天都写代码,已经厌倦了把代码片段复制到网页界面里。
- ✓您的雇主禁止使用 GitHub Copilot、ChatGPT 和 Cursor——理由充分。
- ✓您处理的是专有代码、受保密协议(NDA)约束的内容,或包含明文 API 密钥的内容。
- ✓您拥有 RTX 4070 Ti+、RTX 4090、RTX 5090,或配备 32 GB 及以上内存的 MacBook Pro M2/M3/M4。
- ✓200 毫秒的云端 API 延迟会破坏您的使用节奏。
- ·您有8GB显存:可以运行,但使用7B模型时,效果远低于Copilot。
- ·您每周编码 1 小时:使用云服务免费账户将带来更少的麻烦。
- ·如果您想使用通用聊天助手,请查看更简单的好奇者路线。
这条学习路径分为 4 步
每一步都附有详细指南的链接,您可以在操作时配合阅读。步骤顺序已经过优化:第一次操作时,请不要跳过任何步骤。
- 1步骤 01·12 分钟·高级
编译支持 GPU 加速的 llama.cpp
从源码编译,以获得最高的每秒 token 生成速度。NVIDIA 上使用 CUDA,Apple Silicon 上使用 Metal,AMD 上使用 ROCm。速度比 Ollama 快 15% 至 30%。
llama-server 二进制程序已就绪,可提供兼容 OpenAI 的 API。阅读指南 →你使用的是 Mac? 查看 macOS 版本 → - 2步骤 02·6 分钟·进阶
下载 Qwen2.5 Coder 32B (Q4)
同类中最好的开放权重代码模型。Q4_K_M 版本可放入约 19 GB 显存中,保留 FP16 版本 95% 的质量。从 Hugging Face 下载。
模型在 localhost:8080 上以 chat completions 格式提供服务。阅读指南 → - 3步骤 03·8 分钟·进阶
将 Continue.dev 连接到 VSCode
从扩展市场安装 Continue 扩展,编辑 ~/.continue/config.json,使其指向您的本地端点,并配置 FIM 模型以实现自动补全。
按 Tab 接受建议,Cmd+L 打开选中内容的聊天窗口。阅读指南 → - +额外步骤·4 分钟·高级
附加内容 — 在命令行中使用 Aider
对于范围更大的任务(如重构一个模块、生成测试),Aider支持在终端中用自然语言编辑文件,并自动通过Git提交修改。
一个连接到同一后端、具备智能体能力的命令行工具,可与 Continue 互补。阅读指南 →
推荐模型
为本学习路径测试过的三款选择——从最轻量到能力最强。点击查看详细介绍(显存、上下文、基准测试)。
多功能。14B = 9 GB(Q4),代码质量优秀,可在 12 GB VRAM 上运行。
如果您有 16 GB VRAM,这是一个不错的折中选择,用途也更广泛。
查看详情 →如果您拥有 64 GB 内存的 Mac 或 48 GB 显存的 GPU,这是最佳选择。延迟较高,但输出质量一流。
常见问题
我们通过邮件和Mastodon收到的真实问题。如果您的问题未被覆盖,请提交工单。
注重保密的专业人士 — “我的文件资料不会离开我的电脑。”
法律专业人士、医生、人力资源人员、顾问、专业会计师、公证人——您的文件受职业保密义务或保密协议(NDA)约束。将本地 LLM 与 RAG 结合,您就可以针对这些文件提问、生成摘要……
用 100 % 本地代码副驾驶替代 GitHub Copilot 和 Cursor——权威指南,含配置。
- 在线空间,终身可用
- PDF + 文件
- 30 天内退款
有疑问、发现错别字或遇到 bug?
这条学习路线会随着每次新模型发布而更新。您的反馈是改进的基础。