入门 10 分钟Prompting

您的首次对话 locale

直接回答

要与本地大语言模型(LLM)交互,请使用 ollama run 启动模型,用一到两句话完整表述您的请求并包含需要处理的文本,阅读模型回复后,通过明确指令进行修正,而非重新提问。您所输入的任何内容都不会离开您的设备。在十五分钟左右,您就能完成一份摘要、一封邮件、一些代码,并理解如何修正错误的回复。

Ollama 已经安装好了,眼前的光标正在闪烁。这份首日入门教程将带您进行一次真正的对话:启动适合您内存容量的模型,提出有效的请求,使用会话命令,识别模型何时偏离正轨,并避开上下文和内存方面的陷阱。

作者: Mohamed Meguedmi·更新于 2026-09-30·已在 Windows、macOS 和 Linux 上测试

#通过本教程,您将学会哪些操作

您将请求生成摘要、让模型撰写邮件、获取一个小脚本、测试一个超出模型能力范围的问题,然后纠正一条偏离方向的回答。这些操作能让您独立使用模型。本指南假设您已经安装 Ollama;如果尚未安装,请先阅读适用于您操作系统的安装指南。若想进一步了解如何组织指令,可接着阅读提示词基础指南。

#选择能装入您机器内存的模型

本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款

模型是一个大小为数 GB 的文件:它必须能装入显卡的显存,或装入 Mac 或没有独立显卡的 PC 的内存。Ollama 模型库中的 Gemma 4 页面列出了各个版本及其下载大小。对您的机器而言过大的版本仍能运行,但会将部分计算转移到 CPU 上,因此速度很慢。

Ollama 模型库中的 Gemma 4 变体(大小以 Ollama 标示为准)
标签下载大小需预留内存
gemma4:e2b4.6 至 7.5 GB配备 8 GB 内存的设备
gemma4 (e4b, 默认)6.6至9.5 GB配备 12 至 16 GB 内存的机器
gemma4:12b7.7 至 8.0 GB16 GB及以上内存的设备
gemma4:26b16 到 19 GB显存容量为 24 GB 或以上的显卡
gemma4:31b19至20 GB24 至 32 GB 显存的显卡,需缩短上下文

右侧一列是我们的保守估算:请在上述大小的基础上,加上上下文所需的内存,并为系统预留余量。如果拿不准,请选择最小的版本:小模型快速给出的回答,比大模型极其缓慢地给出的回答更能让您学到东西。您随时都可以更换模型。

#您的首次会话,逐步引导

完成以下八个步骤大约需要十五分钟,涵盖从启动到验证回答的全过程。每个步骤都相互独立:您可以在第二步后停下来,稍后再继续。关闭会话时,唯一会丢失的是对话历史记录,因为终端不会保存它。

#1. 启动模型

首次启动
ollama run gemma4:e2b

Ollama 文档将 ollama run gemma4 命令列为运行模型的示例。首次启动时会下载模型,所需时间取决于模型大小和您的网络连接。随后会出现命令提示符,模型等待您输入消息。在您输入之前,不会发生任何事。

i
您的消息始终保留在本地
Ollama 的常见问题解答指出,当在本地运行模型时,Ollama 无法看到您的提示或数据。这在云端模型中不成立,云端模型会将您的消息发送至服务提供商的服务器:请确认模型名称末尾不带 cloud。

#2. 用完整句子与之交流

第一个常见错误:像使用搜索引擎那样输入关键词。语言模型并不搜索文档,而是续写文本。因此,请描述您想要什么,并说明背景和预期结果。

先看一个模糊的请求,再看一个完整的请求
# Trop vague
résumer réunion points importants

# Précis
Voici des notes de réunion. Résume-les en 5 puces : d'abord les décisions
prises, puis les actions à faire avec leur responsable.

Notes :
- Alice propose de migrer vers Postgres d'ici juin
- Bob rappelle qu'il faut finir l'audit sécurité avant
- Décision : on migre, mais l'audit passe avant (fin mai)
- Charles s'occupe de l'audit
- Alice s'occupe de la migration

一个几乎总是有效的框架:任务、待处理的数据、预期的格式。以下四个练习可供您练手:让模型总结个人笔记,写一封三行的取消邮件,请模型编写一个统计文件中单词数量的 Python 函数,提出一个模型无法回答的问题,例如询问一份您未提供给它的文档的内容。

#3. 测试模型不知道的内容

最后一个练习最有启发性。模型不会访问互联网或您的文件,除非连接了工具;它只知道训练中学到的内容和对话文本。请向它询问一个虚构文档的内容或近期事件,并观察:好的模型会回答不知道,可靠性较低的模型则会编造一个看似合理的回答。这种行为称为幻觉。由此得出的规则是:信息越精确、越新、越与您个人有关,您就越需要在提示中提供这些信息或进行核实。我们关于幻觉的指南详细介绍了应对措施。

#4. 无需从头开始即可修正

模型答非所问?不要只是输入“不,重来”:这样并没有让它多理解任何信息。请补充一项明确的约束,说明哪里不对,以及您期待什么。

有针对性的追问
Refais, mais en 3 puces maximum et sans jargon technique.
Chaque puce doit tenir sur une ligne.
长度
项目符号条目数、行数或字数。
Ton
正式、随意、新闻风格、教学风格。
形式
列表、表格、JSON、邮件、代码
用肯定句表达禁止事项
比起「不要说‘以下是’」,更建议使用「直接从答案开始」。

#5. 会话指令

在会话中,以斜杠开头的行不会发送给模型:它们用于控制 Ollama。命令 /? 会显示完整列表。

/set parameter num_ctx 8192
设置会话的上下文长度:Ollama 的 FAQ 中提到此命令用于更改窗口大小。
/set system
设置一条系统消息,为整个会话指定固定角色。
/show info
显示已加载模型的信息:架构、大小、上下文长度、量化方式。
/clear
清除当前对话的上下文,但不将模型从内存中卸载。
/bye
关闭会话,或按Ctrl+D。

根据 Ollama 的常见问题解答,会话关闭后,模型默认会在内存中保留五分钟,以加快下一次启动。若需立即将其从内存中卸载,请执行 ollama stop,后接模型名称;ollama ps 会列出已加载的模型,并显示分别在 GPU 和 CPU 上执行的比例。

#6. 维持多轮对话

模型仅记忆上下文窗口内的内容:每次交互,应用都会将完整历史记录返回给模型。因此,您可以连续发送相互依赖的请求。

连续进行三轮交互
Je dois écrire un courriel pour annuler une réservation au restaurant.
Fais-le en 3 lignes, poli mais pas guindé.

[réponse du modèle]

Bien. Refais la même, mais plus chaleureuse, et précise que je
reprogrammerai dans 15 jours.

[réponse du modèle]

Parfait. Traduis-la en anglais.

限制在于上下文大小。根据 Ollama 的文档,在显存低于 24 GiB 时,默认值约为 4 000 tokens;在 24 到 48 GiB 之间为 32k;超过 48 GiB 则为 256k。当历史记录超出窗口时,最早的交互将被丢弃。如果模型“忘记”了长会话的开头,请使用 num_ctx 命令增加窗口大小,同时请记住每个上下文 token 都会消耗内存。

#7. 请求代码并进行验证

代码是很好的试验对象,因为结果可以测试。请给出编程语言、输入、预期输出和一项约束:“编写一个 Python 函数,接收文本文件的路径并返回词数。先只给出代码,再附上一句解释。”将代码复制到文件中,用一个您已知答案的用例运行它;如果出现错误,请将完整的错误信息粘贴到对话中,并要求模型修正。这种“提出请求—执行—修正”的循环,比要求模型一次就给出完美代码更有效。

#8. 以批判性眼光阅读回答

流畅的回复并不等于准确的回复。模型生成的是看似合理的文本,但不会进行验证。请养成在使用前核查关键内容的习惯。

数字与日期
请用一个来源交叉核实这些信息:它们是模型最容易编造的内容。
名称、参考文献和引文
请核实它们是否真实存在。模型可能会编造听起来像真的书名或法律条文。
代码
在信任之前请先运行它,并仔细检查它对您文件的操作内容。
一致性
用两种方式提出同一个问题:如果回答不一致,请对两个回答都保持怀疑。

一个良好的习惯是自行提供参考文本,并要求模型引用支持每一陈述的具体段落。这样可以在几秒钟内验证内容,而无需进行全盘搜索。

#继续使用终端,还是切换到图形界面?

与本地模型交互的三种方式
路径优点限制
终端(ollama run)无需额外安装,适合初次尝试没有整理好的历史记录,处理长文本不太方便
聊天界面(Open WebUI、LM Studio、Jan)历史记录、附件、可读的排版额外安装
API(脚本)自动化,与您的工具集成需要少量代码

先从终端入手,了解基本原理;当您开始粘贴长文本,或想找回之前的对话时,再改用图形界面。两者可以配合使用:通过 Ollama 下载一次的模型也可供图形界面使用,无需再次下载,前提是它们使用同一个本地服务器。

#当出现问题时

常见症状及解决方案
问题表现可能原因解决方案
响应非常缓慢模型的一部分转由 CPU 运行运行 ollama ps,然后选择更小的模型版本或减少上下文长度
模型遗忘开头内容上下文窗口已满增大 num_ctx,或用一份摘要重新开始
英文回答偏向英语的指令或模型在请求中或在 /set system 中写入「用法语回答」
虚构文本提示中缺失信息提供源文本并要求引用原文段落
“找不到模型”错误名称或标签错误请在 Ollama 模型库中该模型的页面上核对拼写。

要更精细地调节创造性,可以参考 Ollama 的 Modelfile 文档对温度参数作用的概述:温度越高,模型越有创造性;温度越低,模型的输出越连贯。关于温度和 top-p 的指南详细介绍了可尝试的数值。

#第一次对话之后呢?

永久角色
系统提示指南展示了如何为模型设定稳定的规则。
更舒适的界面
Open WebUI 或 LM Studio 提供历史记录、文件附件和清晰易读的排版。
您自己的文档
RAG可让您查询文件而无需每次将文件内容粘贴进去
FAQ
如何首次与LLM进行交互?+
使用 ollama run 命令并在其后加上模型名称来启动模型,等待输入提示出现,然后输入完整请求:任务、待处理文本和期望的输出格式。阅读回答后,用明确的指令加以修正,而不是重新开始。几轮交流就足以了解模型能做什么。
与本地模型对话是否需要互联网连接?+
仅用于下载模型。之后对话在本地设备上进行,无需联网。Ollama 的常见问题解答明确指出,当本地运行模型时,Ollama 不会看到您的提示或数据。带有 cloud 后缀的模型则在远程服务器上运行,需要联网。
如何退出Ollama的对话?+
输入 /bye 或按 Ctrl+D 关闭会话。之后,模型默认会继续驻留在内存中五分钟,从而加快下一次启动。若要立即将模型从内存中卸载,请执行 ollama stop 并在后面加上模型名称,再执行 ollama ps 检查哪些模型仍驻留在内存中。
为什么模型会忘记对话的开头?+
因为历史记录超出了上下文窗口。在 VRAM 少于 24 GiB 时,Ollama 默认使用约 4,000 个 token。可在会话中通过 /set parameter num_ctx 增大该值,同时检查模型是否仍能完整放入 GPU 显存,或者先总结对话再继续。
初学者应选择哪个模型?+
在您想尝试的模型系列中,选择质量合格、规模最小且适合您内存容量的模型:响应快的模型能让您学到的东西,比庞大而缓慢的模型更多。如果您有 8 GB 内存,Gemma 4 的 e2b 版本大小约为 4.6 至 7.5 GB。如果质量令您失望,再选择更大的模型。
模型能否读取我的文件或网上的内容?+
默认情况下不会。它仅知晓自身的训练数据和对话文本。若要让它阅读您的文档或在互联网上搜索信息,需为其连接一个工具,例如 Open WebUI 这类支持 RAG 或网页搜索的界面。否则,请将文本直接粘贴到提示中。

#深入了解

这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。