进阶 11 分钟IDE

IntelliJ和JetBrains + Ollama:本地部署的AI助手 IDE

将IntelliJ(或PyCharm、WebStorm、GoLand等)与Ollama结合,即可获得类似Copilot的代码助手,但完全在本地运行:项目聊天、行末补全、重构——无需任何代码发送至第三方服务器。本指南将筛选出兼容Ollama的插件,展示如何通过「AI代理」进行连接,并根据您的显卡选择合适的代码模型。

作者: Thomas P.·更新于 2026-08-27·已在 Windows、macOS 和 Linux 上测试

#为什么要在自己的 IDE 中使用本地 LLM

云端助手(GitHub Copilot、JetBrains AI、Cursor)很方便,但会将您的代码上下文——有时是整个文件,有时是整个仓库——发送到远程服务器。对于受保密协议(NDA)约束的代码、专有软件,或仅仅出于原则上的考虑,这都无法接受。将本地 LLM 接入 IntelliJ,可以从根本上解决这个问题:模型在您的 GPU 上运行,提示词和补全内容始终不会离开这台机器。

另一个理由是成本。Copilot 或 JetBrains AI 的订阅需要持续按月付费。安装 Ollama 并下载代码模型后,您就可以进行代码补全和对话,没有配额限制,也不按 token 计费,离线时也能使用。需要权衡的是质量:小型本地模型无法媲美顶尖云端模型,但 Qwen 3.8 27B 或 Devstral 24B 在代码补全和日常对话方面已接近这一水平。

隐私
代码、提示和回答均保留在本地。云端不会记录任何内容。
零订阅费用
模型下载后无任何持续费用,使用无限制。
离线
在火车上、隔离网络中,或受严格企业代理限制的环境中都能运行。
模型控制
您可选择模型大小、量化方式,并根据任务切换不同模型。

#与 Ollama 交互的 JetBrains 插件

本地编程副驾驶套件

本指南带你上手模型。工具包则帮你用上能在你的编辑器中编写代码的编程助手。

  • 在线空间,终身可用
  • PDF + 文件
  • 终身更新

JetBrains 生态系统没有普遍适用的 Ollama 原生支持,需要通过插件市场中的插件来实现。三种方案几乎覆盖所有需求,各有不同的优势。

ProxyAI(原CodeGPT)
本地功能最全面。支持聊天、行内补全、编辑选中内容,并内置 Ollama 连接器。它就是标题中提到的“AI 代理”:在 IDE 与 Ollama 守护进程之间充当桥梁。
Continue
开源,可通过配置文件进行丰富的设置。支持聊天、自动补全和代码操作,对 Ollama 作为模型服务提供方提供一流支持。如果您希望精细调整每个模型,这是理想的选择。
JetBrains AI Assistant
JetBrains官方助手。自2025年起,它支持在离线模式下连接通过Ollama或LM Studio运行的本地模型。如果您希望继续使用JetBrains自家的工具,这很方便,但本地代码补全的灵活性较低。
i
一个守护进程,多个客户端
所有这些插件都连接到同一个 Ollama 端点(http://localhost:11434)。您可以同时安装两个插件——例如用 ProxyAI 聊天,用 Continue 补全代码——只要它们指向同一个服务器。Ollama 只会将模型加载到显存中一次。

#先决条件

这里假设 Ollama 已安装并能正常运行。除此之外,只需较新版本的 JetBrains IDE,以及至少一个已下载的编程模型。

一个 JetBrains IDE 2024.1+
IntelliJ IDEA、PyCharm、WebStorm、GoLand、Rider、PhpStorm……上述插件都可以通过同一个插件市场安装到这一系列的所有产品中。
Ollama正常运行
守护进程已安装,并可通过 http://localhost:11434 访问。在进行任何配置之前,请使用 ollama list 测试。
聊天/代码模型
qwen3.5:9b 是一个适合作为起点的通用模型(256k 上下文,支持视觉输入)。采用 Q4_K_M 量化时,约 6.6 GB 显存即可容纳。
建议使用 GPU
代码补全必须在不到一秒内响应才有实用价值。RTX 3060 12 GB 可以轻松运行 7B 模型;如果没有 GPU,建议只用于聊天,不用于自动补全。
终端 — 准备 Ollama
# Vérifier que le daemon répond
ollama list

# Modèle de code polyvalent (chat + edit)
ollama pull qwen3.5:9b

# Tester l'API que les plugins vont utiliser
curl http://localhost:11434/api/tags

#配置ProxyAI + Ollama

ProxyAI(原名 CodeGPT)是在 JetBrains 中获得功能完整的本地助手的最便捷途径。其 Ollama 连接器支持聊天、编辑选中的内容和补全,无需 API 密钥或账户。

  1. 01
    安装插件
    Settings → Plugins → Marketplace,搜索“ProxyAI”(或根据版本搜索“CodeGPT”)并安装。如果系统提示需要重启,请重启 IDE。
  2. 02
    选择 Ollama 作为服务提供方
    Settings → Tools → ProxyAI → Providers。请选择 Ollama (Local) 作为提供商,而不是云端选项(OpenAI、Anthropic 等)。
  3. 03
    检查服务器URL
    Base URL 字段应指向 http://localhost:11434。如果 Ollama 运行在网络中的另一台机器上,请将 localhost 替换为该机器的 IP 地址。
  4. 04
    选择模型
    在模型列表中选择您已下载的模型(例如 qwen3.5:9b)。ProxyAI 会调用 Ollama 来列出可用模型。
  5. 05
    测试聊天
    打开 ProxyAI 面板(侧边栏中的图标),针对一个已打开的文件提问。回答应在本地返回,且不应出现外部连接警告。
→
向聊天添加上下文
请在打开聊天前选择代码,或使用上下文文件添加命令:模型将基于您具体的代码进行响应,而非空泛回答。小模型上下文窗口有限——请勿一次性加载整个项目,应聚焦于相关文件。

#Continue 与原生 AI Assistant

如果您喜欢调整每一个细节,Continue 的配置通过文件提供,而不是通过菜单设置。您需要在文件中明确指定 Ollama 这一提供商、聊天模型,并单独指定补全模型。这种方式需要写更多配置,但也精确得多,尤其适合将一个小而快的模型分配给自动补全,将一个更大的模型分配给聊天。

Continue — config.json(节选)
{
  "models": [
    {
      "title": "Qwen 3.5 9B",
      "provider": "ollama",
      "model": "qwen3.5:9b",
      "apiBase": "http://localhost:11434"
    }
  ],
  "tabAutocompleteModel": {
    "title": "Autocomplete",
    "provider": "ollama",
    "model": "qwen2.5-coder:7b-base",
    "apiBase": "http://localhost:11434"
  }
}

对于 JetBrains AI Assistant,操作流程受到更多限制:在助手设置中启用本地模型,并将连接地址设为 Ollama。这有助于只使用一个工具,但原生助手仍主要面向 JetBrains 云服务;其本地补全功能不如 ProxyAI 或 Continue 成熟。对于需要认真投入使用的 100% 本地方案,我们更推荐后两者。

#根据 VRAM 选择代码模型

规则很简单:模型越大,回答质量越好,但显存占用也越高,回答速度也越慢。Qwen 3.5 / Qwen 3.8 系列覆盖了各个规模档位,是 2026 年本地代码任务的标杆;Devstral 24B(专用于代码智能体的模型)和 Granite 4.2 是不错的替代选择。以下是采用 Q4_K_M 量化时的参考指标(这是模型大小与质量之间的最佳折中)。

轻量级 3B — ~2 GB VRAM
granite4.2:3b。适合快速排查问题和回答简单问题,资源消耗很低。即使在小型 GPU 上也能运行;用于非交互式任务时,也可以在 CPU 上运行。
通用 9B 模型 — 约 6.6 GB 显存
qwen3.5:9b。均衡之选:聊天、编辑和重构表现都不错,具备 256k 上下文和视觉能力。适用于 RTX 3060 12 GB / 4070 12 GB。
舒适之选:12B — 约 7.6 GB 显存
gemma4:12b。在推理和多文件重构方面明显更出色,支持多模态,采用 Apache 2.0 许可证。可在配备 16 GB 显存的 RTX 4080 上流畅运行。
高端 27B — ~18 GB VRAM
qwen3.8:27b。在本地编程方面最接近云端水平的模型(262k 上下文,支持视觉)。需要配备 24 GB 显存的 RTX 4090,或配备至少 32 GB 统一内存的 Apple Silicon Mac。提示:将其推理级别设为“low”,它默认往往会过度思考。
i
两个模型,两个角色
聊天可以容忍延迟,补全则不行。因此,通常会分开这两种任务:用一个强劲的模型(Gemma 4 12B 或 Qwen 3.8 27B)处理聊天和编辑,用一个专用基座模型(qwen2.5-coder:7b-base)在输入时进行自动补全。只要显存能容纳这两个模型,Ollama 就会让它们同时驻留在内存中。

#本地代码补全:注意 FIM

类似 Copilot 的代码补全依赖“中间填充”(fill-in-the-middle,FIM):模型必须同时了解光标前后的代码,才能补全代码中间的部分。并非所有模型都支持这一功能。instruct 版本是针对聊天而训练的,并非针对 FIM;要实现自动补全,请使用专门为此设计的 base 版本。

终端 — 补全模型(基础模型 = FIM)
# Modèle base de référence pour le FIM (autocomplétion inline)
ollama pull qwen2.5-coder:7b-base

# En Q4_K_M il tient dans ~4,7 Go et reste LA référence 2026 pour la complétion
ollama list
基础模型,而非指令模型
进行代码补全时,请选择 qwen2.5-coder:7b-base,它在 2026 年仍是 FIM 领域的标杆。指令模型会产生啰嗦或不符合格式要求的补全结果。
以速度为首要考虑
在自动补全中,速度比精细程度更重要。一个能在半秒内响应的专用基础模型,比一个需要 2 秒才能响应的大型聊天模型更实用。
几乎需要 GPU 支持
没有硬件加速时,代码补全结果来得太慢,跟不上打字速度。这种情况下,请将本地AI仅用于聊天。
!
代码补全速度慢或结果不连贯?
两种常见原因:在需要基础模型的地方使用了指令微调模型(导致 FIM 失败),或者模型太大,GPU 无法完全容纳,因而部分运行任务转由 CPU 承担。请检查模型标签(-base),并在输入时使用 nvidia-smi 监控显存。

#本地 AI 在 IDE 中尚未实现的功能

在本地部署方面已取得进展,但与高端云端助手相比仍存在差距。了解这些差异有助于合理设定期望,避免失望。

多文件推理
大型代码仓库的内容会超出本地模型的上下文窗口。模型只能看到您提供的文件,而不是您的整个架构。Copilot Workspace 或 Cursor 会为整个项目建立索引;在本地,这仍然需要手动拼凑。
高级智能体模式
执行命令、运行测试并循环迭代(如Cline/Cursor Agent)需要一个能够可靠处理工具调用的模型。本地小型模型往往无法满足此需求;应选择专用代码模型(如Devstral 24B、Qwen3-Coder 30B或GLM 4.7 Flash),并接受可能的失败情况。
处理复杂代码时的实际表现
在处理复杂算法或训练数据中覆盖较少的新框架时,参数量为 80 亿至 120 亿的本地模型仍不及顶尖云端模型。
精细的产品集成
自动检测编程语言、丰富的上下文相关操作、处理 PR……本地工具正在追赶,但体验仍比精心打磨的商业助手稍逊一筹。

实际使用中,本地方案擅长代码补全、围绕单个文件进行对话、解释代码和局部重构。对于复杂的智能体任务和整个代码仓库的分析,云端仍有优势——因此,同时保留两种方案,并根据代码的敏感程度选择路由,很有价值。

#故障排除

插件未列出任何模型
插件无法连接到 Ollama。请检查守护进程是否正在运行(ollama list),并确认 URL 为 http://localhost:11434。如果 Ollama 在另一台机器上运行,请使用 OLLAMA_HOST=0.0.0.0 启动它,并将连接地址设为那台机器的 IP 地址。
« Connection refused »
Ollama 未启动,或防火墙阻止了端口 11434。请从与 IDE 相同的机器上使用 curl http://localhost:11434/api/tags 进行测试。
该模型未出现在列表中
标签不匹配。请复制 ollama list 返回的准确模型名称,包括标签(qwen3.5:9b,而不是 qwen3.5)。
响应非常缓慢
模型无法完全装入显存,部分转由 CPU 运行。请改用更小的模型或 Q4_K_M 量化,并用 nvidia-smi 确认 GPU 确实在被使用。
补全结果为空或不合逻辑
您正在使用指令模型进行 FIM。请切换到 -base 变体(qwen2.5-coder:7b-base)。
IDE 在生成过程中运行缓慢
加载两个模型会耗尽 VRAM。请减小其中一个模型的尺寸,或每次仅启用一个插件。

#深入了解

IDE 中本地助手的效果取决于支撑它运行的守护进程和 GPU。这些指南可帮助完善部署。

安装 Ollama
基础步骤:安装并启动在端口11434上运行代码模型服务的守护进程。
本地免费 Copilot:在 VS Code 中使用 Cline、Tabby 与 CodeGeeX
VS Code 中的对应方案,用于比较不同编辑器的实现方式和插件。
在Claude Code和Cursor中使用Ollama
将同样的本地模型接入其他助手,并根据任务在本地与云端之间作出选择。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。