路径 02 · 编程

开发者 — “本地 Copilot,100% 离线,0 云延迟。”

通过 Continue.dev 将 Qwen2.5 Coder 32B 接入 VSCode。自动补全、聊天、整份文件的重构——您的代码一行都不会泄露给 Microsoft、OpenAI 或 Anthropic。您的 PR 中包含 API 密钥?它会留在 PR 中。

总时长
~30 分钟
所需水平
熟悉终端操作
成本
0 €
典型设备配置
配备 16 GB 显存的 GPU,或配备至少 32 GB 内存的 M 系列 Mac
↑
我们的承诺

此流程结束后,您将拥有一个后台运行的llama.cpp服务器,搭载Qwen2.5 Coder 32B模型,采用Q4量化。Continue.dev将与VSCode集成,支持FIM自动补全和侧边栏聊天功能,延迟低于100毫秒,自动补全质量可媲美Copilot,部分情况下在近期代码上表现更优。

适用人群 适合哪些人?

我们更希望尽早告知您,而不是让您白白浪费30分钟。

✓ 如果您符合以下情况,这条学习路径适合您
  • ✓你每天都写代码,已经厌倦了把代码片段复制到网页界面里。
  • ✓您的雇主禁止使用 GitHub Copilot、ChatGPT 和 Cursor——理由充分。
  • ✓您处理的是专有代码、受保密协议(NDA)约束的内容,或包含明文 API 密钥的内容。
  • ✓您拥有 RTX 4070 Ti+、RTX 4090、RTX 5090,或配备 32 GB 及以上内存的 MacBook Pro M2/M3/M4。
  • ✓200 毫秒的云端 API 延迟会破坏您的使用节奏。
✕ 如果您符合以下情况,请考虑其他选择
  • ·您有8GB显存:可以运行,但使用7B模型时,效果远低于Copilot。
  • ·您每周编码 1 小时:使用云服务免费账户将带来更少的麻烦。
  • ·如果您想使用通用聊天助手,请查看更简单的好奇者路线。

这条学习路径分为 4 步

每一步都附有详细指南的链接,您可以在操作时配合阅读。步骤顺序已经过优化:第一次操作时,请不要跳过任何步骤。

累计 · 约 30 分钟
  1. 1
    步骤 01·12 分钟·高级

    编译支持 GPU 加速的 llama.cpp

    从源码编译,以获得最高的每秒 token 生成速度。NVIDIA 上使用 CUDA,Apple Silicon 上使用 Metal,AMD 上使用 ROCm。速度比 Ollama 快 15% 至 30%。

    llama-server 二进制程序已就绪,可提供兼容 OpenAI 的 API。
    阅读指南 →
  2. 2
    步骤 02·6 分钟·进阶

    下载 Qwen2.5 Coder 32B (Q4)

    同类中最好的开放权重代码模型。Q4_K_M 版本可放入约 19 GB 显存中,保留 FP16 版本 95% 的质量。从 Hugging Face 下载。

    模型在 localhost:8080 上以 chat completions 格式提供服务。
    阅读指南 →
  3. 3
    步骤 03·8 分钟·进阶

    将 Continue.dev 连接到 VSCode

    从扩展市场安装 Continue 扩展,编辑 ~/.continue/config.json,使其指向您的本地端点,并配置 FIM 模型以实现自动补全。

    按 Tab 接受建议,Cmd+L 打开选中内容的聊天窗口。
    阅读指南 →
  4. +
    额外步骤·4 分钟·高级

    附加内容 — 在命令行中使用 Aider

    对于范围更大的任务(如重构一个模块、生成测试),Aider支持在终端中用自然语言编辑文件,并自动通过Git提交修改。

    一个连接到同一后端、具备智能体能力的命令行工具,可与 Continue 互补。
    阅读指南 →

推荐模型

为本学习路径测试过的三款选择——从最轻量到能力最强。点击查看详细介绍(显存、上下文、基准测试)。

参考模型
qwen2.5-14b

多功能。14B = 9 GB(Q4),代码质量优秀,可在 12 GB VRAM 上运行。

多功能
Mistral Small 3
Mistral AI · 24B · Q4 量化下 14 GB

如果您有 16 GB VRAM,这是一个不错的折中选择,用途也更广泛。

查看详情 →
参考模型
llama-3.3-70b

如果您拥有 64 GB 内存的 Mac 或 48 GB 显存的 GPU,这是最佳选择。延迟较高,但输出质量一流。

常见问题

我们通过邮件和Mastodon收到的真实问题。如果您的问题未被覆盖,请提交工单。

在逐行补全方面,Qwen2.5 Coder 32B 表现非常接近,有时在近期代码(2024年之后)上表现更优。在聊天场景中,Copilot Chat(基于 GPT-4o)仍领先一档。但您始终对自身数据拥有控制权。
完成这条学习路径后
下一个学习路径

注重保密的专业人士 — “我的文件资料不会离开我的电脑。”

法律专业人士、医生、人力资源人员、顾问、专业会计师、公证人——您的文件受职业保密义务或保密协议(NDA)约束。将本地 LLM 与 RAG 结合,您就可以针对这些文件提问、生成摘要……

→
本地副驾驶套件

用 100 % 本地代码副驾驶替代 GitHub Copilot 和 Cursor——权威指南,含配置。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款

有疑问、发现错别字或遇到 bug?

这条学习路线会随着每次新模型发布而更新。您的反馈是改进的基础。