进阶 20 分钟Dev

使用 Cline 的本地 Copilot:VS Code 中的 AI 智能体 (Ollama)

GitHub Copilot 会将您的代码发送给微软。对于签署保密协议的自由职业开发者,或受监管行业的团队来说,这一点令人无法接受。Cline 是一款 VS Code/JetBrains 扩展,通过 Ollama 使用本地模型来替代 Copilot,提供聊天功能和能够读取、修改多个文件的智能体模式。本指南介绍如何安装 Cline、配置较新的代码模型(Qwen 3.5、Devstral),以及如何重现 Copilot 的主要用户体验,同时将您的代码保留在本地。

作者: Mohamed Meguedmi·更新于 2026-08-27·已在 Windows、macOS 和 Linux 上测试
i
Continue 已停止维护(2026 年 6 月)
Continue 于 2026 年 6 月 18 日被 Cursor(Anysphere)收购:代码仓库已归档(v2.0.0 是最后一个版本),扩展已不再维护——仍可通过社区分支安装,按本指南现有步骤操作仍然可行。对于新搭建的环境,我们更推荐 Cline(开源、MIT 许可证、兼容 Ollama):请参阅我们的指南《从 Continue 迁移到 Cline》。

#为什么使用本地 Copilot

隐私
不会有任何代码片段离开您的设备。保密协议、商业机密、客户代码:所有内容均保留在本地。
Offline
在飞机上,在没有互联网的实验室深处,或在度假时。模型就在您的硬盘上。
成本
购买 GPU 后免费。一名开发者使用 Copilot 两年,其成本相当于中端显卡的价格。
模型选择
您可以将 Qwen 3.5 换为 Devstral、Qwen3-Coder 或 GLM 4.7 Flash,具体取决于语言和可用 VRAM

#为什么本指南改用Cline

本指南最初基于 Continue.dev。Continue 于 2026 年 6 月被 Cursor 收购,其仓库现已归档,独立产品不再维护:因此我们将其更新为 Cline,这是一个功能对等、活跃且同样通过 Ollama 实现 100% 本地运行的开源助手。

本地副驾驶套件

本指南带你上手模型。工具包则帮你用上能在你的编辑器中编写代码的编程助手。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款
i
您之前用的是 Continue 吗?
迁移过程很轻松:您的Ollama后端保持不变,只需替换扩展。您固定版本的Continue分叉仍可合法运行(代码采用Apache 2.0许可证),但请注意,托管数据的导出窗口已于2026年7月15日关闭。如有需要,可参阅专门的指南,了解逐步迁移流程。

#可使用的模型

⭐ Qwen 3.5 9B
2026 年 8 GB 配置的首选。支持多语言(包括法语)、256k 上下文和视觉,采用 Apache 2.0 许可。无论用于聊天,还是作为智能体处理 Python、TypeScript 和 Rust 任务,都表现良好。Q4 量化下约占 6.6 GB。
Devstral 24B (Mistral AI)
专长于智能体编程,采用 Apache 2.0 许可证。在 16 GB 显存配置上,它是使用 Cline 修改多个文件的首选。Q4 量化后约为 14 GB。
Qwen3-Coder 30B-A3B
面向代码的 MoE 模型(30 亿个活跃参数,因此速度快),上下文长度为 256k。适合 24 GB 配置:提供可与 Copilot 媲美的高端聊天和 AI 智能体能力。Q4 量化下约占 19 GB。
Qwen 3.8 27B
2026 年的“接近 Copilot”之选(发布于 2026 年 8 月 14 日),262k 上下文,支持视觉,采用 Apache 2.0 许可证。适用于 24 GB 显存——需将推理级别设为“low”,以免过度思考。
根据可用VRAM推荐的模型
VRAMCline 模型(聊天 + 智能体)量化
6 GBgranite4.2:8bQ4_K_M(~5.3 GB)
8 GBqwen3.5:9bQ4_K_M(约 6.6 GB)
16 GBdevstral:24b / gpt-oss:20bQ4 / MXFP4 (~14 GB)
24 GB+qwen3-coder:30b / qwen3.8:27bQ4(约18-19 GB)
→
Cline 偏好一个能遵循指令的模型
与单纯的自动补全不同,智能体模式会发送多步骤指令。请优先选择模型的 instruct/chat 变体(而非 -base 变体);如果显存容量允许,请使用更大的模型(Devstral 24B、Qwen3-Coder 30B),以提高可靠性。

#1. 安装Cline

  1. 01
    安装 Ollama
    如果尚未安装,请参阅《在 Windows/macOS/Linux 上安装 Ollama》指南。Ollama 是在后台运行模型的引擎。
  2. 02
    下载模型
    使用下面的命令下载适合您显存容量的代码模型。
  3. 03
    安装 Cline 扩展
    在 VS Code 中:Extensions(Ctrl+Shift+X)→ 搜索 Cline → Install。在 JetBrains 中,请通过插件市场安装。
  4. 04
    打开面板
    左侧边栏会出现一个 Cline 图标。点击它即可打开聊天和智能体面板。
需下载的模型
# Modèle principal (chat + agent)
ollama pull qwen3.5:9b

# Plus de VRAM ? Devstral, le spécialiste du mode agent (16 Go)
ollama pull devstral:24b

#2. 配置 Ollama 提供商

Cline需要知道模型的位置。打开其参数设置(面板中的齿轮图标),选择Ollama提供商,填写本地服务的地址,并从检测到的模型列表中选择所需模型。

提供商设置
Provider     : Ollama
Base URL     : http://localhost:11434
Modèle       : qwen3.5:9b
!
请确保始终使用本地提供程序
Cline 也能与云端 API 通信。对于 100% 本地使用,请检查当前激活的提供商是 Ollama 而不是远程供应商——这是区分私有使用和向第三方服务器发送代码的唯一设置。

#3. 聊天模式

聊天模式就相当于本地版的 Copilot Chat 面板。您可以提问、粘贴代码、请求解释或修复。

打开聊天窗口
点击侧边栏中的 Cline 图标。对话将显示在面板中。
附上代码
在编辑器中选中一个代码块,然后将其加入聊天上下文,让模型针对这段代码进行推理。
提及文件
Cline 可以引用您项目中的文件,结合正确的上下文作答,无需您复制粘贴全部内容。
本地保存历史记录
您的对话保留在您自己的机器上。任何内容都不会同步到云端。

#4. 智能体模式

这正是Cline比普通聊天更进一步的地方。在智能体模式下,它可以查看目录树、打开文件、提出涉及多个文件的修改建议,并执行命令——每项操作都需经您批准。

规划阶段后进入执行阶段
用法语描述任务(“添加一个 /health 端点及其测试”)。Cline 会提出一个计划,然后逐步应用更改。
经确认的代码差异(diff)
每次修改均以 diff 形式呈现,您可选择接受或拒绝。您始终保有控制权。
受控的命令执行
智能体可以建议运行命令(测试、构建)。未经您明确同意,任何操作都不会执行。
给智能体的指令示例
- Ajoute du logging pour tracer les entrées/sorties
- Convertis cette fonction en async/await
- Extrais ce bloc dans un fichier util.ts et mets à jour les imports
- Écris des tests unitaires pour les cas limites
→
为智能体提供上下文
指令越精确(目标文件、预期行为、风格约束),结果越好。一个 24B 模型(Devstral)比 9B 模型更忠实遵循多步骤指令。

#5. 自动补全:Tabby 或 Twinny

重要提示:Cline 是聊天助手兼 AI 智能体,不提供输入时显示为“灰色文字”的行内自动补全。要获得类似 Copilot 的便捷体验,请添加一个专用扩展,并将它也连接到 Ollama。

Tabby
自托管的自动补全扩展,非常适合多个开发者共享同一 GPU 的场景。逐行补全内容以灰色显示;按 Tab 接受。
Twinny
轻量级 VS Code 扩展,支持自动补全和聊天,可直接连接 Ollama。对于独立开发者,它是 Cline 的良好补充,适合大量连续编写代码。
好用的双工具组合
Cline 用于聊天和智能体功能,Tabby 或 Twinny 用于行内代码补全。两者都连接同一个 Ollama,两边的代码都保留在本地。
→
专用补全模型
对于自动补全(Fill-In-the-Middle),qwen2.5-coder:7b-base 在 2026 年仍是标杆(约 4.7 GB),而且响应依然非常迅速——这是少数 2024 年发布的模型至今仍处于领先地位的情况之一。请将您的聊天或智能体模型(Qwen 3.5 9B、Devstral 24B)留给 Cline 使用。

#性能与高级设置

num_ctx 较高
在 Ollama 中,通过 Modelfile 将 num_ctx 设置为 16384,以便智能体能够发送大量上下文(文件、代码差异)。
Flash Attention
使用 RTX 30/40/50 时,请在 Ollama 中启用 FA(设置变量 OLLAMA_FLASH_ATTENTION=1)。速度提升约 20%。
量化后的 KV 缓存
OLLAMA_KV_CACHE_TYPE=q8_0 会将上下文的显存占用减半。智能体处理大文件时,这一点至关重要。
每个角色一个模型
使用一个专用的 FIM 模型(qwen2.5-coder:7b-base,约 4.7 GB)进行自动补全(Tabby/Twinny),使用一个 24B/30B 模型(Devstral、Qwen3-Coder)进行聊天并供 Cline 智能体使用。Ollama 会加载被请求的模型。
扩展上下文窗口
# Modelfile : devstral-16k
FROM devstral:24b
PARAMETER num_ctx 16384
创建上下文扩展模型
ollama create devstral-16k -f Modelfile
# puis sélectionnez devstral-16k comme modèle dans Cline

#常见问题

FAQ
Cline 真的能替代 GitHub Copilot 吗?+
对于聊天和智能体模式(读取或修改多个文件、运行命令),可以。对于输入时显示“灰色文字”的行内自动补全,则不行:Cline 不提供这项功能。添加 Tabby 或 Twinny,并连接到同一个 Ollama,即可恢复这种便利。
为什么不继续使用Continue.dev?+
Continue 于 2026 年 6 月被 Cursor 收购;开发工作在 Cursor 继续进行(v2.0.0 为最新稳定版),但独立产品的未来尚不确定。扩展仍可安装,采用 Apache 2.0 许可证的代码仍可合法运行,但没有更新或修复。Cline 采用 MIT 开源许可证,仍在积极开发,是整合时的推荐选择。
如果只有 8GB 显存,应选择哪个模型?+
采用 Q4_K_M 量化的 Qwen 3.5 9B(约 6.6 GB)能轻松装入 8 GB 显存,在 2026 年仍是这一档的最佳选择(256k 上下文、多语言、视觉能力)。如果显存确实很紧张,Granite 4.2 8B(约 5.3 GB)占用更少。两者都足以用于聊天;若想使用更可靠的多步骤智能体模式,只要显存容量(16 GB)允许,就升级到 Devstral 24B。
使用Cline时我的代码会上传到互联网吗?+
不,只要当前激活的提供商是 Ollama(http://localhost:11434),Cline 也能与云端 API 通信:请在设置中确认您使用的是本地提供商 Ollama,这是区分 100% 私有使用与向第三方服务器发送数据的唯一设置。
Cline 能在 JetBrains 上运行,而不仅限于 VS Code 吗?+
是的。Cline 支持 VS Code 以及 JetBrains IDE(通过插件市场)。Ollama 提供商的配置和模型选择在两种环境下完全一致。

#结论

大约二十分钟,您就能拥有一个 100% 本地的代码副驾驶:用 Cline 进行聊天并使用智能体模式,以 Ollama 为引擎运行较新的代码模型(Qwen 3.5 9B,或用于智能体的 Devstral 24B),再用 Tabby 或 Twinny(配合 qwen2.5-coder:7b-base)进行行内自动补全。您的代码始终不会离开您的机器,您可以离线工作,并且可以根据所用编程语言自由更换模型。如果您想省去数小时的配置调整,从经过验证的基础开始,付费指南《本地代码副驾驶》提供了一套完整、开箱即用的 Ollama + Cline + Aider 配置包。

这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。