进阶 14 分钟智能体

Cline + Ollama:在VS中实现100%本地代码代理 代码

Cline 将 VS Code 转变为自主代码代理:它会读取您的文件、提出差异变更、执行命令,并迭代直到任务完成。通过连接 Ollama,所有工作都保留在您的本地设备上——无需将任何令牌发送至第三方服务器。本指南将搭建一个完整的、可运行的 Cline + Ollama 环境:根据您的 VRAM 选择合适的模型,配置 Ollama 以避免上下文异常,以及那些决定代理是否真正可用的关键设置。

作者: Mohamed Meguedmi·更新于 2026-08-27·已在 Windows、macOS 和 Linux 上测试

#为什么在本地使用Cline智能体

Cline(原名 Claude Dev)是一款 VS Code 扩展,通过智能体循环驱动大语言模型:它会规划任务、编辑多个文件、在终端中执行命令、读取输出并进行修正。与简单的内联补全不同,它能够执行完整任务——例如编写函数、迁移模块、根据堆栈跟踪排查错误。

将它与 Ollama 配合使用,而非接入云端 API,有三个具体优势:您的专有代码始终不会离开本机,不产生任何按 token 计费的费用(Cline 消耗大量上下文,在云端费用很快就会累积),而且智能体可以离线运行。代价是:一个好的本地代码模型需要显存,而 Ollama 的默认设置不适合智能体用途。

i
本指南并非迁移指南
如果您从 Continue.dev 转过来,希望找回原有配置,请优先参考我们的专门指南《Continue.dev 被 Cursor 收购:迁移到 Cline》——其中介绍了数据导出和设置映射。这里则从零开始,搭建一套干净的 Cline + Ollama 环境。

#先决条件

本地副驾驶套件

本指南带你上手模型。工具包则帮你用上能在你的编辑器中编写代码的编程助手。

  • 在线空间,终身可用
  • PDF + 文件
  • 终身更新
VS Code
较新的版本(1.90+)。Cline 也能在兼容 Open VSX 的分支版本(VSCodium、Cursor)中运行,但本指南针对标准版 VS Code。
Ollama 已安装
守护进程必须保持运行,并监听 http://localhost:11434。如果尚未完成这一步,请参阅我们的 Ollama 安装指南。
具备足够显存的 GPU
要流畅使用智能体,至少需要16 GB 显存;使用高端模型则需要24 GB。仅用 CPU 仍然可行,但对智能体的循环执行来说速度太慢。
在 VS Code 中打开的项目
Cline 在当前工作区目录中操作:请打开一个真实仓库,而非孤立文件。

#根据VRAM选择模型

模型选择比其他一切都重要:Cline 智能体会接连调用工具、读取文件并处理差异,因此需要一个能遵循指令并严格遵守工具格式的模型。三种配置方案可以覆盖 2026 年的大多数显卡。

24 GB(RTX 4090、3090、RX 7900 XTX)—— Qwen3-Coder 32B
目前最好的本地智能体。采用 Q4_K_M 量化时,它占用约 19 GB 显存,还能为 32k 上下文留出余量。如果您的显卡能容纳它,这就是应当优先考虑的模型。
16 GB(RTX 4080、5070 Ti、4060 Ti 16GB)— Devstral Small 2
这款 Mistral 模型专为编程智能体设计,采用 Q4_K_M 量化时可装入 16 GB 显存,并保留实用的上下文空间。它是这一档显卡上的最佳折中选择。
通用性强 — Qwen 3.6 27B
如果您想用一个模型兼顾代码和其他任务,27B版本经Q4量化后能装进24GB显存,作为智能体使用时也表现出色。它在纯代码任务上比Qwen3-Coder稍逊一筹,但用途更广。
→
Q4 量化下的显存占用参考
采用 Q4_K_M 量化(推荐的默认选项)时:14B 模型约需 9 GB,27B 模型约需 16–17 GB,32B 模型约需 19 GB。还要加上上下文占用的显存:窗口越大,KV 缓存就越大。始终预留 2–3 GB 的余量。

避免在智能体应用中使用小于 14B 的模型:它们会破坏工具调用格式、陷入循环,或生成无法应用的代码差异补丁(diff)。小而快的模型非常适合行内补全(通过 Tabby 或 Continue),但不适合驱动 Cline。

#1. 准备Ollama

首先确认 Ollama 正在运行,然后拉取所选模型。这里以 Qwen3-Coder 32B 为例——请将模型标签替换为适合您显存容量的标签。

终端
# Vérifier que le daemon répond
curl http://localhost:11434/api/version

# Tirer le modèle de code (adapter au tag exact affiché sur ollama.com)
ollama pull qwen3-coder:32b

# Alternatives selon la VRAM
ollama pull devstral-small-2   # 16 Go
ollama pull qwen3.6:27b        # généraliste 24 Go

# Lister ce qui est installé
ollama list
!
请核对准确的标签
Ollama 的标签名称会变化(量化后缀、版本等)。请从 ollama.com 上的模型官方页面复制标签,而不要自行猜测:不存在的标签会返回静默的拉取错误。

#2. 配置Ollama的上下文

这是大家都会漏掉的步骤。默认情况下,Ollama以4096个token的上下文窗口提供模型服务。而Cline会发送多个文件的内容、任务历史和工具定义:上下文窗口只有4k时,智能体每一轮都会忘记自身任务的开头,从而变得无法使用。

需要提高 num_ctx 的值。规范的做法是通过 Modelfile 创建衍生模型,使该设置长期生效,并且不依赖 Cline。

Modelfile
# Fichier : Modelfile
FROM qwen3-coder:32b

# Contexte élargi pour l'usage agent (32k)
PARAMETER num_ctx 32768

# Un peu de déterminisme pour le code
PARAMETER temperature 0.2
终端
# Créer le modèle dérivé
ollama create qwen3-coder-agent -f Modelfile

# Il apparaît désormais dans la liste
ollama list
!
num_ctx 会消耗 VRAM
将上下文从 4k 提升至 32k,会使 KV 缓存增加数 GB。在 16 GB 显存上,请保持 16k(num_ctx 16384),而不是 32k,否则 Ollama 会将显存装不下的模型部分卸载到系统 RAM,导致智能体运行缓慢。请监控 `ollama ps`:如果 PROCESSOR 列显示有 CPU 参与,请缩短上下文或降低量化位数。

#3. 安装 Cline

  1. 01
    打开扩展市场
    在 VS Code 中,打开扩展面板(Ctrl+Shift+X)。
  2. 02
    查找 Cline
    在搜索栏中输入「Cline」。官方扩展由「Cline Bot Inc.」发布——请检查发布者以避免使用仿制品。
  3. 03
    安装并固定
    点击Installer。侧边活动栏中会出现Cline图标;将其固定,以便快速访问。

#4. 将Cline连接到 Ollama

Cline原生支持 Ollama :无需手动构建兼容OpenAI API的URL。打开Cline面板,点击设置图标,然后配置服务提供商。

  1. 01
    API Provider → Ollama
    在“API Provider”下拉列表中,选择“Ollama”。
  2. 02
    Base URL
    保留 http://localhost:11434(默认值)。仅在 Ollama 运行在其他设备或容器中时才更改该值。
  3. 03
    Model
    请选择qwen3-coder-agent(在第2步创建的衍生模型),而非4k上下文的原始模型。
  4. 04
    检查上下文窗口
    Cline 中有一个名为「Context Window」的字段。请将其设置为与 Modelfile 中的 num_ctx 一致的值(32768)。如果两者不一致,提示词就会在到达 Ollama 之前被 Cline 截断。
i
Plan Mode 与 Act Mode
Cline区分Plan模式(思考并提出策略,不修改文件)和Act模式(执行操作)。使用本地模型时,请先进入Plan模式,确认方案是否合适:这样可以避免能力稍弱的模型朝错误的方向修改十个文件。

#5. 首次以智能体模式运行

打开一个实际项目,然后给 Cline 分配一项具体且范围明确的任务。初次测试最好只涉及少量文件:添加一个测试、修复一个已发现的 bug,或编写一个小型工具函数。

Cline提示词
Ajoute une fonction `slugify(texte)` dans src/utils/strings.js qui met en minuscules, remplace les accents et les espaces par des tirets. Écris aussi un test unitaire dans le fichier de tests existant à côté.

Cline 会读取文件夹内容,提出差异补丁(diff),并要求您确认每次修改和每条命令。首次使用时,请逐步批准,以了解它的行为。熟悉并信任它之后,您可以在设置中启用某些操作的自动批准,例如读取文件和执行非破坏性命令。

→
项目规则文件
在仓库根目录添加一个 `.clinerules` 文件,为智能体明确规则:命名约定、要运行的测试命令,以及绝不能修改的目录。规则明确且简短时,本地模型能更好地遵循这些规则。

#常见陷阱

智能体忘记了自己的任务
这几乎总是上下文设置的问题:Ollama 端的 num_ctx 过低,或 Cline 端的 Context Window 设置不当。请重新调整,使这两个值保持一致。
无法应用差异补丁
模型太小或量化程度过高,无法遵循编辑格式。请提升一个档次(14B → 27B/32B),或从 Q3 改用 Q4_K_M。
推理切换至CPU
模型与上下文所需的显存超出了 VRAM 容量。请检查 `ollama ps`;减小 num_ctx 或选择更小的模型。部分依赖 CPU 运行的智能体会变得无法使用。
工具调用陷入无限循环
某些模型会重复执行同一条命令。请先切换到 Plan Mode,并将任务拆分为更小的子任务。
连接被拒绝
Ollama 未在监听,或未在预期的 URL 上监听。请测试 `curl http://localhost:11434/api/version`。如果在容器中运行,请暴露端口,并让 Cline 指向正确的地址。

#深入了解

您现在拥有一个 100% 在本地运行的 Cline 智能体,可以编辑您的代码而不泄露任何信息。接下来可以自然地从两个方向完善:优化模型选择,以及补充 Cline 不提供的行内自动补全功能。

→
本地协作者套件
在本地替代 GitHub Copilot 的完整组合:用 Cline(聊天 + 智能体)处理任务,用 Tabby 在输入时提供灰色的自动补全建议,再搭配一个适合您 GPU 的代码模型。所有组件都在您的机器上运行。
2026 年最适合编程的本地 LLM
Devstral / Qwen3-Coder 及其他替代模型的对比,涵盖显存需求和代码质量——帮助您进一步选择接入 Cline 的模型。
Continue.dev 被 Cursor 收购:迁移至 Cline
如果您是从 Continue.dev 转来,此处提供专为将您的配置导出并迁移到本环境而设计的指南。
选择量化方案(Q4、Q5、Q8、FP16)
理解质量与显存之间的权衡,以在您的显卡上容纳尽可能大的模型。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。