什么是大语言模型(LLM)?原理与应用速览
一句话定义:大语言模型(LLM,Large Language Model)是基于 Transformer 架构、用海量文本训练出来的深度学习模型,核心能力是"根据上文,逐个预测最可能的下一个词",从而理解与生成自然语言。
LLM 是怎么工作的?
可以拆成三步:第一步分词(Tokenize),把文字切成一个个 token;第二步送入多层 Transformer,靠"自注意力"机制衡量每个词与上下文的关系;第三步预测下一个 token,再把结果接到输入末尾,循环生成,直到成句成篇。
LLM 能做什么、不能做什么?
它的强项与短板都来自"预测下一个词"这一本质。
| 擅长 | 局限 |
|---|---|
| 写作、改写、摘要、翻译 | 可能"一本正经地编造"(幻觉) |
| 问答、分类、信息抽取 | 知识有截止时间,不一定最新 |
| 代码生成与解释 | 复杂多步推理/精确计算易出错 |
| 对话与角色扮演 | 对提示词敏感,结果有随机性 |
常见应用场景有哪些?
- 内容生产:文案、摘要、翻译、润色。
- 智能问答/客服:结合企业知识库回答问题。
- 编程辅助:补全代码、解释报错、写测试。
- 信息处理:从长文档里抽取、归类、结构化。
用好 LLM 的几个要点
- 把需求说清楚:给背景、目标、格式、示例,输出更稳。
- 对事实和数字要复核,尤其涉及时效性内容。
- 敏感/关键决策不要完全交给模型,保留人工把关。
参数量和上下文长度是什么意思?
参数量指模型内部可学习的权重数量,常以"亿""千亿"计。通常参数越多,潜在能力越强,但训练与推理的成本、显存占用也越大。上下文长度(上下文窗口)指模型一次能"看到"的最大 token 数,决定了它能处理多长的输入,例如能否一次读完整篇文档;超出部分会被截断,或需要分段、检索等额外手段处理。
如何减少大模型的"幻觉"?
常见做法有三类。一是检索增强(RAG):先从可信资料库检索相关内容,再让模型基于检索到的材料作答,而不是仅凭记忆。二是明确的提示词:要求模型"不确定就说不知道""给出依据与出处"。三是人工核查:对关键事实、数字与引用务必二次核实。这些方法能显著降低幻觉,但目前无法完全消除。
开源模型和闭源模型怎么选?
闭源模型(通过 API 调用)通常能力强、开箱即用、免运维,但数据需要出本地、按调用量付费,且受服务方策略约束。开源模型可本地或私有化部署,数据可控、可微调、长期成本更低,但需要自备算力与工程能力。选择时主要权衡:数据敏感度、成本结构、定制需求,以及团队的运维能力,很多团队会两者混用,把敏感任务放本地、通用任务用云端 API。
常见的大语言模型有哪些?
业界有多个知名的模型系列,例如 OpenAI 的 GPT 系列、Google 的 Gemini、Anthropic 的 Claude、以及 Meta 的开源 Llama 系列等。它们大多基于 Transformer 架构,通过大规模预训练(pre-training)再加微调(fine-tuning)得到。早期的 BERT 更擅长理解类任务(如分类、抽取),而 GPT 类的生成式模型更擅长续写与对话。选择时可结合能力、成本、上下文长度(context window)以及是否开源等因素综合考量。
常见问题(FAQ)
问:LLM 和搜索引擎有什么区别?
答:搜索引擎是"找到并返回已有网页",LLM 是"根据训练所学生成新文本"。前者给链接,后者给答案,但答案需要你自己核实。
问:为什么同一个问题它每次答得不一样?
答:生成过程带有随机性(受温度等参数影响),所以措辞会变;可通过降低随机性或给定更明确的提示来让结果更稳定。
问:什么是"幻觉"?
答:指模型生成了看似合理、实则错误或虚构的内容。因为它优化的是"像不像",而不是"对不对",所以关键信息务必核实。
“Transformer 架构由 Vaswani 等人在 2017 年的论文《Attention Is All You Need》中提出,其核心是完全基于注意力机制来建模序列关系,摒弃了此前的循环网络结构。”
—— Vaswani et al.,《Attention Is All You Need》(2017)
评论