使用 Cline 的本地 Copilot:VS Code 中的 AI 智能体 (Ollama)
GitHub Copilot 会将您的代码发送给微软。对于签署保密协议的自由职业开发者,或受监管行业的团队来说,这一点令人无法接受。Cline 是一款 VS Code/JetBrains 扩展,通过 Ollama 使用本地模型来替代 Copilot,提供聊天功能和能够读取、修改多个文件的智能体模式。本指南介绍如何安装 Cline、配置较新的代码模型(Qwen 3.5、Devstral),以及如何重现 Copilot 的主要用户体验,同时将您的代码保留在本地。
#为什么使用本地 Copilot
- 隐私
- 不会有任何代码片段离开您的设备。保密协议、商业机密、客户代码:所有内容均保留在本地。
- Offline
- 在飞机上,在没有互联网的实验室深处,或在度假时。模型就在您的硬盘上。
- 成本
- 购买 GPU 后免费。一名开发者使用 Copilot 两年,其成本相当于中端显卡的价格。
- 模型选择
- 您可以将 Qwen 3.5 换为 Devstral、Qwen3-Coder 或 GLM 4.7 Flash,具体取决于语言和可用 VRAM
#为什么本指南改用Cline
本指南最初基于 Continue.dev。Continue 于 2026 年 6 月被 Cursor 收购,其仓库现已归档,独立产品不再维护:因此我们将其更新为 Cline,这是一个功能对等、活跃且同样通过 Ollama 实现 100% 本地运行的开源助手。
#可使用的模型
- ⭐ Qwen 3.5 9B
- 2026 年 8 GB 配置的首选。支持多语言(包括法语)、256k 上下文和视觉,采用 Apache 2.0 许可。无论用于聊天,还是作为智能体处理 Python、TypeScript 和 Rust 任务,都表现良好。Q4 量化下约占 6.6 GB。
- Devstral 24B (Mistral AI)
- 专长于智能体编程,采用 Apache 2.0 许可证。在 16 GB 显存配置上,它是使用 Cline 修改多个文件的首选。Q4 量化后约为 14 GB。
- Qwen3-Coder 30B-A3B
- 面向代码的 MoE 模型(30 亿个活跃参数,因此速度快),上下文长度为 256k。适合 24 GB 配置:提供可与 Copilot 媲美的高端聊天和 AI 智能体能力。Q4 量化下约占 19 GB。
- Qwen 3.8 27B
- 2026 年的“接近 Copilot”之选(发布于 2026 年 8 月 14 日),262k 上下文,支持视觉,采用 Apache 2.0 许可证。适用于 24 GB 显存——需将推理级别设为“low”,以免过度思考。
| VRAM | Cline 模型(聊天 + 智能体) | 量化 |
|---|---|---|
| 6 GB | granite4.2:8b | Q4_K_M(~5.3 GB) |
| 8 GB | qwen3.5:9b | Q4_K_M(约 6.6 GB) |
| 16 GB | devstral:24b / gpt-oss:20b | Q4 / MXFP4 (~14 GB) |
| 24 GB+ | qwen3-coder:30b / qwen3.8:27b | Q4(约18-19 GB) |
#1. 安装Cline
- 01安装 Ollama如果尚未安装,请参阅《在 Windows/macOS/Linux 上安装 Ollama》指南。Ollama 是在后台运行模型的引擎。
- 02下载模型使用下面的命令下载适合您显存容量的代码模型。
- 03安装 Cline 扩展在 VS Code 中:Extensions(Ctrl+Shift+X)→ 搜索 Cline → Install。在 JetBrains 中,请通过插件市场安装。
- 04打开面板左侧边栏会出现一个 Cline 图标。点击它即可打开聊天和智能体面板。
#2. 配置 Ollama 提供商
Cline需要知道模型的位置。打开其参数设置(面板中的齿轮图标),选择Ollama提供商,填写本地服务的地址,并从检测到的模型列表中选择所需模型。
#3. 聊天模式
聊天模式就相当于本地版的 Copilot Chat 面板。您可以提问、粘贴代码、请求解释或修复。
- 打开聊天窗口
- 点击侧边栏中的 Cline 图标。对话将显示在面板中。
- 附上代码
- 在编辑器中选中一个代码块,然后将其加入聊天上下文,让模型针对这段代码进行推理。
- 提及文件
- Cline 可以引用您项目中的文件,结合正确的上下文作答,无需您复制粘贴全部内容。
- 本地保存历史记录
- 您的对话保留在您自己的机器上。任何内容都不会同步到云端。
#4. 智能体模式
这正是Cline比普通聊天更进一步的地方。在智能体模式下,它可以查看目录树、打开文件、提出涉及多个文件的修改建议,并执行命令——每项操作都需经您批准。
- 规划阶段后进入执行阶段
- 用法语描述任务(“添加一个 /health 端点及其测试”)。Cline 会提出一个计划,然后逐步应用更改。
- 经确认的代码差异(diff)
- 每次修改均以 diff 形式呈现,您可选择接受或拒绝。您始终保有控制权。
- 受控的命令执行
- 智能体可以建议运行命令(测试、构建)。未经您明确同意,任何操作都不会执行。
#5. 自动补全:Tabby 或 Twinny
重要提示:Cline 是聊天助手兼 AI 智能体,不提供输入时显示为“灰色文字”的行内自动补全。要获得类似 Copilot 的便捷体验,请添加一个专用扩展,并将它也连接到 Ollama。
- Tabby
- 自托管的自动补全扩展,非常适合多个开发者共享同一 GPU 的场景。逐行补全内容以灰色显示;按 Tab 接受。
- Twinny
- 轻量级 VS Code 扩展,支持自动补全和聊天,可直接连接 Ollama。对于独立开发者,它是 Cline 的良好补充,适合大量连续编写代码。
- 好用的双工具组合
- Cline 用于聊天和智能体功能,Tabby 或 Twinny 用于行内代码补全。两者都连接同一个 Ollama,两边的代码都保留在本地。
#性能与高级设置
- num_ctx 较高
- 在 Ollama 中,通过 Modelfile 将 num_ctx 设置为 16384,以便智能体能够发送大量上下文(文件、代码差异)。
- Flash Attention
- 使用 RTX 30/40/50 时,请在 Ollama 中启用 FA(设置变量 OLLAMA_FLASH_ATTENTION=1)。速度提升约 20%。
- 量化后的 KV 缓存
- OLLAMA_KV_CACHE_TYPE=q8_0 会将上下文的显存占用减半。智能体处理大文件时,这一点至关重要。
- 每个角色一个模型
- 使用一个专用的 FIM 模型(qwen2.5-coder:7b-base,约 4.7 GB)进行自动补全(Tabby/Twinny),使用一个 24B/30B 模型(Devstral、Qwen3-Coder)进行聊天并供 Cline 智能体使用。Ollama 会加载被请求的模型。
#常见问题
Cline 真的能替代 GitHub Copilot 吗?+
为什么不继续使用Continue.dev?+
如果只有 8GB 显存,应选择哪个模型?+
使用Cline时我的代码会上传到互联网吗?+
Cline 能在 JetBrains 上运行,而不仅限于 VS Code 吗?+
#结论
大约二十分钟,您就能拥有一个 100% 本地的代码副驾驶:用 Cline 进行聊天并使用智能体模式,以 Ollama 为引擎运行较新的代码模型(Qwen 3.5 9B,或用于智能体的 Devstral 24B),再用 Tabby 或 Twinny(配合 qwen2.5-coder:7b-base)进行行内自动补全。您的代码始终不会离开您的机器,您可以离线工作,并且可以根据所用编程语言自由更换模型。如果您想省去数小时的配置调整,从经过验证的基础开始,付费指南《本地代码副驾驶》提供了一套完整、开箱即用的 Ollama + Cline + Aider 配置包。
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。