Cline + Ollama:在VS中实现100%本地代码代理 代码
Cline 将 VS Code 转变为自主代码代理:它会读取您的文件、提出差异变更、执行命令,并迭代直到任务完成。通过连接 Ollama,所有工作都保留在您的本地设备上——无需将任何令牌发送至第三方服务器。本指南将搭建一个完整的、可运行的 Cline + Ollama 环境:根据您的 VRAM 选择合适的模型,配置 Ollama 以避免上下文异常,以及那些决定代理是否真正可用的关键设置。
#为什么在本地使用Cline智能体
Cline(原名 Claude Dev)是一款 VS Code 扩展,通过智能体循环驱动大语言模型:它会规划任务、编辑多个文件、在终端中执行命令、读取输出并进行修正。与简单的内联补全不同,它能够执行完整任务——例如编写函数、迁移模块、根据堆栈跟踪排查错误。
将它与 Ollama 配合使用,而非接入云端 API,有三个具体优势:您的专有代码始终不会离开本机,不产生任何按 token 计费的费用(Cline 消耗大量上下文,在云端费用很快就会累积),而且智能体可以离线运行。代价是:一个好的本地代码模型需要显存,而 Ollama 的默认设置不适合智能体用途。
#先决条件
- VS Code
- 较新的版本(1.90+)。Cline 也能在兼容 Open VSX 的分支版本(VSCodium、Cursor)中运行,但本指南针对标准版 VS Code。
- Ollama 已安装
- 守护进程必须保持运行,并监听 http://localhost:11434。如果尚未完成这一步,请参阅我们的 Ollama 安装指南。
- 具备足够显存的 GPU
- 要流畅使用智能体,至少需要16 GB 显存;使用高端模型则需要24 GB。仅用 CPU 仍然可行,但对智能体的循环执行来说速度太慢。
- 在 VS Code 中打开的项目
- Cline 在当前工作区目录中操作:请打开一个真实仓库,而非孤立文件。
#根据VRAM选择模型
模型选择比其他一切都重要:Cline 智能体会接连调用工具、读取文件并处理差异,因此需要一个能遵循指令并严格遵守工具格式的模型。三种配置方案可以覆盖 2026 年的大多数显卡。
- 24 GB(RTX 4090、3090、RX 7900 XTX)—— Qwen3-Coder 32B
- 目前最好的本地智能体。采用 Q4_K_M 量化时,它占用约 19 GB 显存,还能为 32k 上下文留出余量。如果您的显卡能容纳它,这就是应当优先考虑的模型。
- 16 GB(RTX 4080、5070 Ti、4060 Ti 16GB)— Devstral Small 2
- 这款 Mistral 模型专为编程智能体设计,采用 Q4_K_M 量化时可装入 16 GB 显存,并保留实用的上下文空间。它是这一档显卡上的最佳折中选择。
- 通用性强 — Qwen 3.6 27B
- 如果您想用一个模型兼顾代码和其他任务,27B版本经Q4量化后能装进24GB显存,作为智能体使用时也表现出色。它在纯代码任务上比Qwen3-Coder稍逊一筹,但用途更广。
避免在智能体应用中使用小于 14B 的模型:它们会破坏工具调用格式、陷入循环,或生成无法应用的代码差异补丁(diff)。小而快的模型非常适合行内补全(通过 Tabby 或 Continue),但不适合驱动 Cline。
#1. 准备Ollama
首先确认 Ollama 正在运行,然后拉取所选模型。这里以 Qwen3-Coder 32B 为例——请将模型标签替换为适合您显存容量的标签。
#2. 配置Ollama的上下文
这是大家都会漏掉的步骤。默认情况下,Ollama以4096个token的上下文窗口提供模型服务。而Cline会发送多个文件的内容、任务历史和工具定义:上下文窗口只有4k时,智能体每一轮都会忘记自身任务的开头,从而变得无法使用。
需要提高 num_ctx 的值。规范的做法是通过 Modelfile 创建衍生模型,使该设置长期生效,并且不依赖 Cline。
#3. 安装 Cline
- 01打开扩展市场在 VS Code 中,打开扩展面板(Ctrl+Shift+X)。
- 02查找 Cline在搜索栏中输入「Cline」。官方扩展由「Cline Bot Inc.」发布——请检查发布者以避免使用仿制品。
- 03安装并固定点击Installer。侧边活动栏中会出现Cline图标;将其固定,以便快速访问。
#4. 将Cline连接到 Ollama
Cline原生支持 Ollama :无需手动构建兼容OpenAI API的URL。打开Cline面板,点击设置图标,然后配置服务提供商。
- 01API Provider → Ollama在“API Provider”下拉列表中,选择“Ollama”。
- 02Base URL保留 http://localhost:11434(默认值)。仅在 Ollama 运行在其他设备或容器中时才更改该值。
- 03Model请选择qwen3-coder-agent(在第2步创建的衍生模型),而非4k上下文的原始模型。
- 04检查上下文窗口Cline 中有一个名为「Context Window」的字段。请将其设置为与 Modelfile 中的 num_ctx 一致的值(32768)。如果两者不一致,提示词就会在到达 Ollama 之前被 Cline 截断。
#5. 首次以智能体模式运行
打开一个实际项目,然后给 Cline 分配一项具体且范围明确的任务。初次测试最好只涉及少量文件:添加一个测试、修复一个已发现的 bug,或编写一个小型工具函数。
Cline 会读取文件夹内容,提出差异补丁(diff),并要求您确认每次修改和每条命令。首次使用时,请逐步批准,以了解它的行为。熟悉并信任它之后,您可以在设置中启用某些操作的自动批准,例如读取文件和执行非破坏性命令。
#常见陷阱
- 智能体忘记了自己的任务
- 这几乎总是上下文设置的问题:Ollama 端的 num_ctx 过低,或 Cline 端的 Context Window 设置不当。请重新调整,使这两个值保持一致。
- 无法应用差异补丁
- 模型太小或量化程度过高,无法遵循编辑格式。请提升一个档次(14B → 27B/32B),或从 Q3 改用 Q4_K_M。
- 推理切换至CPU
- 模型与上下文所需的显存超出了 VRAM 容量。请检查 `ollama ps`;减小 num_ctx 或选择更小的模型。部分依赖 CPU 运行的智能体会变得无法使用。
- 工具调用陷入无限循环
- 某些模型会重复执行同一条命令。请先切换到 Plan Mode,并将任务拆分为更小的子任务。
- 连接被拒绝
- Ollama 未在监听,或未在预期的 URL 上监听。请测试 `curl http://localhost:11434/api/version`。如果在容器中运行,请暴露端口,并让 Cline 指向正确的地址。
#深入了解
您现在拥有一个 100% 在本地运行的 Cline 智能体,可以编辑您的代码而不泄露任何信息。接下来可以自然地从两个方向完善:优化模型选择,以及补充 Cline 不提供的行内自动补全功能。
- 2026 年最适合编程的本地 LLM
- Devstral / Qwen3-Coder 及其他替代模型的对比,涵盖显存需求和代码质量——帮助您进一步选择接入 Cline 的模型。
- Continue.dev 被 Cursor 收购:迁移至 Cline
- 如果您是从 Continue.dev 转来,此处提供专为将您的配置导出并迁移到本环境而设计的指南。
- 选择量化方案(Q4、Q5、Q8、FP16)
- 理解质量与显存之间的权衡,以在您的显卡上容纳尽可能大的模型。
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。