进阶 15 分钟IDE

本地免费 Copilot:在 VS Code 中使用 Cline、Tabby 与 CodeGeeX (2026)

GitHub Copilot 每月收费 10 €,会将您输入的每个字符发送至微软服务器。三个免费的 VS Code 扩展可解决这两个问题,通过将聊天和自动补全功能连接到本地 LLM 实现:Cline、Tabby 和 CodeGeeX。本指南将安装这三个扩展,说明应使用哪些模型,并对比它们的实际功能,以帮助您选择一个免费的本地 VS Code 助手。

作者: Mohamed Meguedmi·更新于 2026-08-27·已在 Windows、macOS 和 Linux 上测试
i
Continue 已停止维护(2026 年 6 月)
Continue 于 2026 年 6 月 18 日被 Cursor(Anysphere)收购:代码仓库已归档(v2.0.0 是最后一个版本),扩展已不再维护——仍可通过社区分支安装,按本指南现有步骤操作仍然可行。对于新搭建的环境,我们更推荐 Cline(开源、MIT 许可证、兼容 Ollama):请参阅我们的指南《从 Continue 迁移到 Cline》。

#为什么要在 VS Code 中使用免费的本地 Copilot?

Copilot 和 Cursor 会将您的代码发送至 OpenAI 或 Anthropic。对于受保密协议约束的客户项目、专有代码,或仅仅出于原则性考虑,这并不总是可以接受。本地编程助手可以一次解决三个问题:零数据外泄(任何内容都不会离开笔记本电脑)、零订阅费用、零网络延迟。

需要坦诚说明这一取舍:本地运行的 Qwen 3.5 9B 在质量上比不上 Copilot Pro 的最新模型。但在日常使用中——补全循环、编写测试、重构一个 30 行的函数——Q4 量化的 9B 至 24B 模型能够胜任。对于本地模型无法完成的任务,您仍可同时使用 Copilot。

i
这 3 个工具的功能
Cline = 聊天 + 多文件智能体(不支持内联自动补全)。Tabby = 仅自动补全,侧重团队自托管使用。CodeGeeX = 补全 + 聊天,内置自有模型。三者都能在 VS Code 和 JetBrains 中运行。
→
那 Continue.dev 呢?
Continue.dev 一直到 2026 年都出现在各类推荐汇总中,但它已被 Cursor 收购(于 2026 年 6 月 18 日宣布),v2.0.0 是最后发布的稳定版本,独立扩展的未来尚不明确。我们已用 Cline 取代它,这是一个仍在积极发展的同类开源工具。如果您之前还在使用 Continue.dev,请注意,托管数据的导出窗口已于 2026 年 7 月 15 日关闭。

#先决条件

本地编程副驾驶套件

本指南带你上手模型。工具包则帮你用上能在你的编辑器中编写代码的编程助手。

  • 在线空间,终身可用
  • PDF + 文件
  • 终身更新
较新版本的 VS Code
需使用 1.85 或更高版本,以支持行内补全 API。这三个工具也都有 JetBrains 扩展。
Ollama 已安装
作为 Cline 的推理后端,默认监听 http://localhost:11434。Tabby 自带运行时;CodeGeeX 可以连接到 Ollama。
GPU 至少 8 GB VRAM
RTX 3060 12 GB、4060 Ti 16 GB、配备16 GB统一内存的Mac M2/M3。若配置低于上述水平,请使用1.5B模型(qwen2.5-coder:1.5b)进行代码补全,这些模型仍能保持快速响应。
20 GB 存储空间
一个 Q4 量化的 7B 编程模型占用 4–5 GB。若要测试多个模型或多种工具,请预留充足空间。
→
不同规模代码模型的实际显存占用
Qwen 3.5 9B Q4 ≈ 6.6 GB · Gemma 4 12B ≈ 7.6 GB · Devstral 24B Q4 ≈ 14 GB · Qwen 3.6 35B-A3B ≈ 23 GB。对于内联补全(FIM),低延迟比质量更重要:Qwen2.5-Coder 这样的小型 FIM 模型就足够了。如果显存足够,可保留 Qwen 3.5 9B 用于聊天,并保留 Devstral 24B 用于智能体。

#1. Cline(聊天 + 智能体)

在辅助功能方面,Cline 是最全面的选项:提供侧边聊天和能读取、修改多个文件的智能体模式,类似 Cursor,而且全部通过 Ollama 在本地运行。它采用 MIT 许可证开源,支持自带 LLM(BYO-LLM),是 Continue.dev 的自然替代选择。Cline 的分支 Roo Code 也停止运营,因此 Cline 成为这一生态系统的整合中心。它的局限是没有行内自动补全功能——下文会用 Tabby 来补足。

  1. 01
    安装扩展
    在 VS Code 中,打开扩展面板(Ctrl+Shift+X),搜索 Cline 并安装。左侧侧边栏将出现 Cline 图标。
  2. 02
    下载模型
    Qwen 3.5 9B 在 8 GB 显存上处理聊天和智能体任务时表现尚可。如果有足够的余量,可升级至 Devstral 24B 或 Qwen 3.6 35B-A3B;Devstral 专为智能体任务设计。
  3. 03
    配置Ollama服务提供商
    打开 Cline 的设置,选择 Ollama 作为服务提供方,填写本地 URL,然后选择模型。
  4. 04
    测试聊天
    提出问题,粘贴代码,请求修复。回答会显示在面板中,不会向云端发送任何内容。
  5. 05
    测试智能体
    描述一项涉及多个文件的任务。Cline 会提出计划,然后以代码差异(diff)的形式应用更改,由您逐一确认。
下载模型
ollama pull qwen3.5:9b
# Plus de VRAM ? Devstral, spécialiste agent de code, suit mieux le mode agent
ollama pull devstral:24b
Cline 的服务提供方设置
Provider : Ollama
Base URL : http://localhost:11434
Modèle   : qwen3.5:9b
→
用于智能体的指令微调版本
使用 Cline 的聊天和智能体功能时,使用模型的 instruct/chat 变体(而非 -base 变体,后者仅用于自动补全)。该变体能更好地遵循多步骤指令。

#2. Tabby(自托管自动补全)

Tabby (TabbyML) 正好弥补了 Cline 的不足:支持行内自动补全。它专为团队设计——一个服务器托管模型,所有开发者从其 IDE 连接该服务器。该服务器内置运行时,无需 Ollama 即可运行。

  1. 01
    启动 Tabby 服务器
    Docker 的方法最为简单。服务器在 :8080 暴露一个 HTTP 端点,并提供一个 Web 管理界面。
  2. 02
    创建管理员账户
    在浏览器中打开 http://localhost:8080。首次登录时,创建所有者账户。进入 Settings → Information,获取认证令牌。
  3. 03
    在 VS Code 中安装扩展
    在扩展面板中搜索 Tabby(发布者:TabbyML)。安装该扩展。
  4. 04
    连接扩展
    打开设置(Ctrl+,),搜索 tabby。将 Endpoint 设置为 http://localhost:8080,并粘贴令牌。VS Code 状态栏会显示 Tabby: ready;输入时,补全建议会以灰色文字显示。
启动 Tabby(NVIDIA GPU)
docker run -d --name tabby \
  --gpus all -p 8080:8080 \
  -v $HOME/.tabby:/data \
  registry.tabbyml.com/tabbyml/tabby \
  serve --model StarCoder-1B --device cuda
i
Cline + Tabby:完整组合
Cline 负责聊天和智能体功能,Tabby 负责行内自动补全。两者结合,就能在本地免费获得完整的 Copilot 使用体验。无论是个人工作站还是团队,都推荐这一组合。如果您希望连代码补全也继续使用 Ollama,Twinny 可以作为 Tabby 的替代方案。

#3. CodeGeeX

CodeGeeX(清华 KEG / Zhipu AI)是“一体化”方案:该扩展已内置代码补全和聊天功能,使用由其提供并托管的免费专有模型。不过,它也可以连接本地模型,这正是本文关注的重点。

  1. 01
    安装扩展
    在 VS Code 中搜索 CodeGeeX(发布者:aminer)。安装该扩展。侧边栏会出现 CodeGeeX 图标。
  2. 02
    切换至本地模式
    打开 CodeGeeX 设置(侧边栏中的齿轮图标)。找到“Local mode”部分并启用它。
  3. 03
    指向 Ollama
    请输入本地模型的URL。CodeGeeX支持OpenAI兼容的端点——Ollama上的http://localhost:11434/v1端点符合要求。
  4. 04
    选择模型
    codegeex4(9B)是可在 Ollama 中使用的自研模型。也可以选择任何近期发布的代码模型(qwen3-coder、devstral)。
Ollama 中的 CodeGeeX 模型
ollama pull codegeex4
!
默认启用云端模式
默认情况下,CodeGeeX使用中国智谱AI的服务器。除非您在设置中明确切换到本地模式,否则您的代码会发送至其服务器。请检查VS Code状态栏中的徽章:应显示‘Local’,而非‘Cloud’。

#对比表

VS Code 中可替代 Copilot 的 3 个免费本地方案
工具它能做什么本地后端许可证最适合的场景
Cline聊天 + 可处理多个文件的智能体Ollama (1个岗位)MIT协议,开源单用户,高级用户
Tabby内联自动补全内置运行时(服务器)Self-hosted团队,Cline的补充工具
CodeGeeX补全 + 聊天兼容OpenAI的端点免费(默认为云端)轻量级一体化配置方案
应用场景覆盖
Cline:聊天 + 智能体(不支持代码补全)。Tabby:代码补全(不支持高级聊天)。CodeGeeX:代码补全 + 基础聊天。Cline + Tabby 的组合可覆盖上述全部用途。
部署工作量
CodeGeeX(5 分钟)< Cline + Ollama(10 分钟)< Tabby 自托管版本(15-20 分钟)
Multi-utilisateurs
只有 Tabby 原生支持多用户使用。Cline/CodeGeeX = 一台工作站 = 一个 Ollama。
隐私
Cline 和 Tabby 默认在本地运行。只要尚未启用本地模式,CodeGeeX 就会将数据发送到云端——这一点需要留意。
→
实用建议
独立运行:Cline + Qwen 3.5 9B 在 Ollama 上用于聊天和代理,搭配 Tabby 实现自动补全。对于3人以上共享GPU的团队:使用 Tabby 实现共享补全,Cline 运行在本地工作站。CodeGeeX 仍是一种轻量级一体化替代方案。

#故障排除

Cline 无法响应
请检查 ollama ps:当发起请求时,模型应出现在列表中。若 Ollama 无响应,请在终端运行 curl http://localhost:11434/api/tags 进行测试。同时请确认Cline中选择的提供商为 Ollama。
没有灰色的行内补全提示
Cline 不支持内联自动补全:这是正常现象。请安装 Tabby(或 Twinny)以实现逐行补全,并检查 VS Code 中 editor.inlineSuggest.enabled 的设置。
Tabby 显示“Connection refused”
容器未运行或端口未暴露。执行 docker ps 应列出 tabby。执行 docker logs tabby 可查看具体原因(通常为:模型首次启动时未下载,需等待5-10分钟)。
CodeGeeX返回中文回答
在系统提示词中明确指定语言(Settings CodeGeeX → Custom system prompt → “始终用法语回答”),或者使用 Qwen 3.5 9B:当您用法语与它交流时,它会用法语回答。
全部同时运行时显存耗尽
您可能已加载了两个模型(Tabby 自动补全 + Cline 聊天)。在 8 GB 显存下,为补全保留一个轻量级 FIM 模型,为聊天保留一个 Qwen 3.5 9B 模型。ollama ps 可显示模型的资源占用情况。

#FAQ

本地免费替代 Copilot 的最佳选择是什么?+
没有唯一的答案,因为这些工具满足的需求各不相同。对于聊天和处理多个文件的智能体功能,Cline 最为全面。对于行内自动补全,可选 Tabby(或 Twinny)。实际使用中,Cline + Tabby 的组合可以在本地免费重现 Copilot 的完整体验。CodeGeeX 是安装最快的一体化方案。
为何本指南不再提及Continue.dev?+
Continue.dev 已被 Cursor 收购(以吸纳团队为目的的收购于 2026 年 6 月 18 日宣布)。v2.0.0 是最后发布的稳定版本,独立扩展的未来尚不确定。代码仍采用 Apache 2.0 许可证,因此固定版本的构建仍可继续运行,但若希望使用持续维护的项目,最好迁移到 Cline。托管数据的导出截止日期为 2026 年 7 月 15 日(现已过去)。
Cline 是否像 Copilot 一样支持自动补全?+
不。Cline 专注于聊天和智能体模式(读取和修改多个文件)。它不提供逐行显示灰色建议文本的代码补全功能。如需这项功能,可同时添加 Tabby 或 Twinny——所选扩展与 Cline 可以在 VS Code 中共存,互不冲突。
选择哪个本地模型用于编程?+
对于内联自动补全(FIM),Qwen2.5-Coder 凭借低延迟仍是可靠之选。对于聊天和智能体任务:8 GB 下可使用 Qwen 3.5 9B,16 GB 下可使用 Devstral 24B 或 gpt-oss 20B,若容量有余裕则可使用 Qwen 3.6 35B-A3B。Devstral 专为代码智能体设计,是一个很好的替代方案。简单原则:用轻量模型做补全,用更大的模型做推理。
使用它是否需要高性能 GPU?+
不需要。8 GB 显存足以运行用于聊天的 Q4 量化 Qwen 3.5 9B,再加上一个用于补全的小型 FIM 模型。显存更少时,建议使用仍能快速响应的轻量级 FIM 模型。配备 16 GB 统一内存的 Mac M2/M3 也能很好地完成这项任务。

#深入了解

您的本地编程助手已经运行起来了。根据您的个人情况,可以考虑以下三个方向:

深入了解 Cline
《使用 Cline 实现本地 Copilot》专题指南深入介绍了配置:将 Ollama 设为模型提供商、使用智能体模式、通过 Tabby/Twinny 实现自动补全,以及智能体功能的精细设置。
您之前使用的是Continue.dev
迁移指南 Continue → Cline 详细说明了迁移过程(包括等效设置、模型和本地数据)。
选择您的硬件
在进一步使用 14B 或 32B 模型之前,《为本地 AI 选择 GPU》指南能帮助您避免买到显存容量勉强够用的显卡。

如果您想节省配置时间,付费指南《本地代码助手》提供完整的 Ollama + Cline + Aider 配置包,开箱即用,可直接粘贴,既适用于个人工作环境,也适用于团队。

这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。