LLM 工作原理: Prompt Engineering 解析

大语言模型本质是概率引擎,通过 Token 切分和数字编码逐步预测下一个内容。由于概率采样的非确定性特性,输出存在自然波动,这是设计而非缺陷。温度参数控制输出创意度,最大 Token 数限制回复长度, Top-P 核采样限定选词范围,上下文窗口决定记忆容量。实操建议:温度和 Top-P 只调其一,配合最大 Token 数系统性配置,可有效提升提示词工程的可控性。

发布于2026年5月9日 22:09
编辑小创
评论0
阅读89

大语言模型的运作逻辑:提示词工程入门

大语言模型( LLM )并不像人类那样阅读文字。它本质上是一台概率引擎,把语言拆碎、编成数字、再预测下一个该出现的内容。理解这个底层机制,是真正驾驭提示词工程( Prompt Engineering )的前提。

当一段文字输入 LLM ,模型做的第一件事是把它切分成 Token。 Token 并不等于单词。“dog” 可能就是一个 Token ,而“ButterFly”则可能被拆成“Butter”和“Fly”两个 Token 。切完之后,每个 Token 被转换成一个数字 ID ,模型全程只和这些数字打交道,逐步预测下一个 Token 应该是哪个。不同模型的切分方式不同, GPT 采用字节对编码( Byte-Pair Encoding ), BERT 则使用 WordPiece ,同一句话在不同架构下的处理路径可以完全不同。

正因为如此,向 LLM 提同一个问题,两次得到的答案可能并不一致。这不是 bug ,而是模型在从概率分布中采样时的自然结果。它不总是选最可能的那个 Token ,而是按概率随机取样。这种非确定性( non-deterministic )特质,是 LLM 与传统程序最根本的区别。

而真正让提示词从“碰运气”变成“可工程化”的,是几个可调节的参数。

温度( Temperature )控制的是模型选 Token 时的“冒险程度”。设在 0.0 到 0.3 之间,输出趋于确定和精准,适合事实查询。调到 0.7 到 1.0 ,输出变得更有创意和多样性。超过 1.5 ,输出基本就开始语无伦次了。

最大 Token 数( Max Tokens )决定回复的长度上限。粗略换算, 1 个 Token 约等于 0.75 个英文单词。 50 到 150 个 Token 够写一段简短摘要, 500 到 1000 个 Token 可以支撑一篇详细解释, 2000 个 Token 以上才能跑出完整的长文。这个参数是天花板,不是目标长度,设得太低会导致回答在句子中途被截断。

Top-P (核采样, nucleus sampling )则从另一个维度限定选词范围。设为 0.9 ,意味着模型只从累计概率达到 90% 的 Token 集合里挑选,数值越低,输出越集中。 Funmilola Fagbola ( PhD )在文中给出了一个实用建议: Temperature 和 Top-P 只调其中一个,同时调两个容易引发不可预期的输出行为。

上下文窗口( Context Window )决定模型在单次对话中能“记住”多少内容。早期的 GPT-3.5 只有 8k Token , Gemini 1.5 Pro 已扩展至超过 100 万 Token , Claude 3.5 Sonnet 支持 20 万 Token ,相当于约 15 万英文单词或 500 页文本。一旦超出这个上限,模型会悄无声息地丢弃最早的内容,没有任何提示。

相关文章

ChatGPT Work 实测:27 分钟跑通闭环路网到一键部署网站
智能体工程
2026年9月15日
0 条评论
小创

ChatGPT Work 实测:27 分钟跑通闭环路网到一键部署网站

ChatGPT Work 标志着大模型向全托管自主智能体跃迁。其通过云端沙箱、无头浏览器、持久化存储及一键部署四大基础设施,实现从信息检索到网站上线的闭环自动化。系统提供 Cloud 与 Local 双形态及多档推理级别,适配不同任务需求。尽管具备强大自主执行能力,用户仍需警惕上下文压缩、CSP 限制及提示注入等风险。目前该工具仍面临云端与本地环境状态同步未打通的挑战,但已重塑软件工程协作模式。

#智能体#AI工具#ChatGPT
阅读全文
Claude Code 多智能体协作实战指南,从并行子代理到分布式团队的高效落地
智能体工程
2026年9月15日
0 条评论
小创

Claude Code 多智能体协作实战指南,从并行子代理到分布式团队的高效落地

Claude Code 多智能体协作提供 subagents 与 Agent Teams 两种架构。subagents 采用星型拓扑,适合独立任务委派;Agent Teams 为点对点网状结构,支持双向通信与状态共享,适用于复杂并行工作流。实战中需根据任务依赖度选型,并通过 Git worktrees 隔离并发写入冲突。同时应合理配置模型路由以控制成本,规避描述重叠与死锁风险。若缺乏三条以上独立并行流,建议优先使用单会话或 subagents 以提升效率。

#智能体#AI工具#vibe coding
阅读全文
OpenRouter 同模型性能实测相差 23 分,锁定靠谱后端避开路由陷阱
智能体工程
2026年9月14日
0 条评论
小创

OpenRouter 同模型性能实测相差 23 分,锁定靠谱后端避开路由陷阱

OpenRouter 动态路由因后端异构导致同模型性能差异显著,实测准确率落差达 23 分,且存在多模态失效、参数被忽略及协议格式污染等隐患。开发者不应将其视为免运维黑盒,需建立防御体系:通过基准数据筛选优质节点,利用 provider.only 锁定白名单并保留降级兜底,同时在客户端实现空响应校验与工具调用容错解析。此外,跨托管商的上下文缓存连续性仍是当前待突破的工程瓶颈。

#AI工具#智能体#OpenRouter
阅读全文
互动讨论

评论区

围绕《LLM 工作原理: Prompt Engineering 解析》展开交流,未登录用户可浏览评论,登录后可参与讨论。

评论数
0
登录后参与评论
支持发表观点与回复一级评论,互动后将同步到消息中心。
登录后评论
暂无评论,欢迎成为第一个参与讨论的人。