您的首次对话 locale
要与本地大语言模型(LLM)交互,请使用 ollama run 启动模型,用一到两句话完整表述您的请求并包含需要处理的文本,阅读模型回复后,通过明确指令进行修正,而非重新提问。您所输入的任何内容都不会离开您的设备。在十五分钟左右,您就能完成一份摘要、一封邮件、一些代码,并理解如何修正错误的回复。
Ollama 已经安装好了,眼前的光标正在闪烁。这份首日入门教程将带您进行一次真正的对话:启动适合您内存容量的模型,提出有效的请求,使用会话命令,识别模型何时偏离正轨,并避开上下文和内存方面的陷阱。
#通过本教程,您将学会哪些操作
您将请求生成摘要、让模型撰写邮件、获取一个小脚本、测试一个超出模型能力范围的问题,然后纠正一条偏离方向的回答。这些操作能让您独立使用模型。本指南假设您已经安装 Ollama;如果尚未安装,请先阅读适用于您操作系统的安装指南。若想进一步了解如何组织指令,可接着阅读提示词基础指南。
#选择能装入您机器内存的模型
只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。
- 在线空间,终身可用
- PDF + 文件
- 30 天内退款
模型是一个大小为数 GB 的文件:它必须能装入显卡的显存,或装入 Mac 或没有独立显卡的 PC 的内存。Ollama 模型库中的 Gemma 4 页面列出了各个版本及其下载大小。对您的机器而言过大的版本仍能运行,但会将部分计算转移到 CPU 上,因此速度很慢。
| 标签 | 下载大小 | 需预留内存 |
|---|---|---|
| gemma4:e2b | 4.6 至 7.5 GB | 配备 8 GB 内存的设备 |
| gemma4 (e4b, 默认) | 6.6至9.5 GB | 配备 12 至 16 GB 内存的机器 |
| gemma4:12b | 7.7 至 8.0 GB | 16 GB及以上内存的设备 |
| gemma4:26b | 16 到 19 GB | 显存容量为 24 GB 或以上的显卡 |
| gemma4:31b | 19至20 GB | 24 至 32 GB 显存的显卡,需缩短上下文 |
右侧一列是我们的保守估算:请在上述大小的基础上,加上上下文所需的内存,并为系统预留余量。如果拿不准,请选择最小的版本:小模型快速给出的回答,比大模型极其缓慢地给出的回答更能让您学到东西。您随时都可以更换模型。
#您的首次会话,逐步引导
完成以下八个步骤大约需要十五分钟,涵盖从启动到验证回答的全过程。每个步骤都相互独立:您可以在第二步后停下来,稍后再继续。关闭会话时,唯一会丢失的是对话历史记录,因为终端不会保存它。
#1. 启动模型
Ollama 文档将 ollama run gemma4 命令列为运行模型的示例。首次启动时会下载模型,所需时间取决于模型大小和您的网络连接。随后会出现命令提示符,模型等待您输入消息。在您输入之前,不会发生任何事。
#2. 用完整句子与之交流
第一个常见错误:像使用搜索引擎那样输入关键词。语言模型并不搜索文档,而是续写文本。因此,请描述您想要什么,并说明背景和预期结果。
一个几乎总是有效的框架:任务、待处理的数据、预期的格式。以下四个练习可供您练手:让模型总结个人笔记,写一封三行的取消邮件,请模型编写一个统计文件中单词数量的 Python 函数,提出一个模型无法回答的问题,例如询问一份您未提供给它的文档的内容。
#3. 测试模型不知道的内容
最后一个练习最有启发性。模型不会访问互联网或您的文件,除非连接了工具;它只知道训练中学到的内容和对话文本。请向它询问一个虚构文档的内容或近期事件,并观察:好的模型会回答不知道,可靠性较低的模型则会编造一个看似合理的回答。这种行为称为幻觉。由此得出的规则是:信息越精确、越新、越与您个人有关,您就越需要在提示中提供这些信息或进行核实。我们关于幻觉的指南详细介绍了应对措施。
#4. 无需从头开始即可修正
模型答非所问?不要只是输入“不,重来”:这样并没有让它多理解任何信息。请补充一项明确的约束,说明哪里不对,以及您期待什么。
- 长度
- 项目符号条目数、行数或字数。
- Ton
- 正式、随意、新闻风格、教学风格。
- 形式
- 列表、表格、JSON、邮件、代码
- 用肯定句表达禁止事项
- 比起「不要说‘以下是’」,更建议使用「直接从答案开始」。
#5. 会话指令
在会话中,以斜杠开头的行不会发送给模型:它们用于控制 Ollama。命令 /? 会显示完整列表。
- /set parameter num_ctx 8192
- 设置会话的上下文长度:Ollama 的 FAQ 中提到此命令用于更改窗口大小。
- /set system
- 设置一条系统消息,为整个会话指定固定角色。
- /show info
- 显示已加载模型的信息:架构、大小、上下文长度、量化方式。
- /clear
- 清除当前对话的上下文,但不将模型从内存中卸载。
- /bye
- 关闭会话,或按Ctrl+D。
根据 Ollama 的常见问题解答,会话关闭后,模型默认会在内存中保留五分钟,以加快下一次启动。若需立即将其从内存中卸载,请执行 ollama stop,后接模型名称;ollama ps 会列出已加载的模型,并显示分别在 GPU 和 CPU 上执行的比例。
#6. 维持多轮对话
模型仅记忆上下文窗口内的内容:每次交互,应用都会将完整历史记录返回给模型。因此,您可以连续发送相互依赖的请求。
限制在于上下文大小。根据 Ollama 的文档,在显存低于 24 GiB 时,默认值约为 4 000 tokens;在 24 到 48 GiB 之间为 32k;超过 48 GiB 则为 256k。当历史记录超出窗口时,最早的交互将被丢弃。如果模型“忘记”了长会话的开头,请使用 num_ctx 命令增加窗口大小,同时请记住每个上下文 token 都会消耗内存。
#7. 请求代码并进行验证
代码是很好的试验对象,因为结果可以测试。请给出编程语言、输入、预期输出和一项约束:“编写一个 Python 函数,接收文本文件的路径并返回词数。先只给出代码,再附上一句解释。”将代码复制到文件中,用一个您已知答案的用例运行它;如果出现错误,请将完整的错误信息粘贴到对话中,并要求模型修正。这种“提出请求—执行—修正”的循环,比要求模型一次就给出完美代码更有效。
#8. 以批判性眼光阅读回答
流畅的回复并不等于准确的回复。模型生成的是看似合理的文本,但不会进行验证。请养成在使用前核查关键内容的习惯。
- 数字与日期
- 请用一个来源交叉核实这些信息:它们是模型最容易编造的内容。
- 名称、参考文献和引文
- 请核实它们是否真实存在。模型可能会编造听起来像真的书名或法律条文。
- 代码
- 在信任之前请先运行它,并仔细检查它对您文件的操作内容。
- 一致性
- 用两种方式提出同一个问题:如果回答不一致,请对两个回答都保持怀疑。
一个良好的习惯是自行提供参考文本,并要求模型引用支持每一陈述的具体段落。这样可以在几秒钟内验证内容,而无需进行全盘搜索。
#继续使用终端,还是切换到图形界面?
| 路径 | 优点 | 限制 |
|---|---|---|
| 终端(ollama run) | 无需额外安装,适合初次尝试 | 没有整理好的历史记录,处理长文本不太方便 |
| 聊天界面(Open WebUI、LM Studio、Jan) | 历史记录、附件、可读的排版 | 额外安装 |
| API(脚本) | 自动化,与您的工具集成 | 需要少量代码 |
先从终端入手,了解基本原理;当您开始粘贴长文本,或想找回之前的对话时,再改用图形界面。两者可以配合使用:通过 Ollama 下载一次的模型也可供图形界面使用,无需再次下载,前提是它们使用同一个本地服务器。
#当出现问题时
| 问题表现 | 可能原因 | 解决方案 |
|---|---|---|
| 响应非常缓慢 | 模型的一部分转由 CPU 运行 | 运行 ollama ps,然后选择更小的模型版本或减少上下文长度 |
| 模型遗忘开头内容 | 上下文窗口已满 | 增大 num_ctx,或用一份摘要重新开始 |
| 英文回答 | 偏向英语的指令或模型 | 在请求中或在 /set system 中写入「用法语回答」 |
| 虚构文本 | 提示中缺失信息 | 提供源文本并要求引用原文段落 |
| “找不到模型”错误 | 名称或标签错误 | 请在 Ollama 模型库中该模型的页面上核对拼写。 |
要更精细地调节创造性,可以参考 Ollama 的 Modelfile 文档对温度参数作用的概述:温度越高,模型越有创造性;温度越低,模型的输出越连贯。关于温度和 top-p 的指南详细介绍了可尝试的数值。
#第一次对话之后呢?
- 永久角色
- 系统提示指南展示了如何为模型设定稳定的规则。
- 更舒适的界面
- Open WebUI 或 LM Studio 提供历史记录、文件附件和清晰易读的排版。
- 您自己的文档
- RAG可让您查询文件而无需每次将文件内容粘贴进去
如何首次与LLM进行交互?+
与本地模型对话是否需要互联网连接?+
如何退出Ollama的对话?+
为什么模型会忘记对话的开头?+
初学者应选择哪个模型?+
模型能否读取我的文件或网上的内容?+
#深入了解
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。