什么是大语言模型(LLM)?原理与应用速览

一句话定义:大语言模型(LLM,Large Language Model)是基于 Transformer 架构、用海量文本训练出来的深度学习模型,核心能力是"根据上文,逐个预测最可能的下一个词",从而理解与生成自然语言。

大语言模型工作流程:输入文本→分词→Transformer 多层→预测下一个词→生成输出
LLM 的基本工作流程:分词、经多层 Transformer、逐词预测生成

LLM 是怎么工作的?

可以拆成三步:第一步分词(Tokenize),把文字切成一个个 token;第二步送入多层 Transformer,靠"自注意力"机制衡量每个词与上下文的关系;第三步预测下一个 token,再把结果接到输入末尾,循环生成,直到成句成篇。

LLM 能做什么、不能做什么?

它的强项与短板都来自"预测下一个词"这一本质。

广告
广告
广告
擅长 局限
写作、改写、摘要、翻译 可能"一本正经地编造"(幻觉)
问答、分类、信息抽取 知识有截止时间,不一定最新
代码生成与解释 复杂多步推理/精确计算易出错
对话与角色扮演 对提示词敏感,结果有随机性

常见应用场景有哪些?

  • 内容生产:文案、摘要、翻译、润色。
  • 智能问答/客服:结合企业知识库回答问题。
  • 编程辅助:补全代码、解释报错、写测试。
  • 信息处理:从长文档里抽取、归类、结构化。

用好 LLM 的几个要点

  • 把需求说清楚:给背景、目标、格式、示例,输出更稳。
  • 事实和数字要复核,尤其涉及时效性内容。
  • 敏感/关键决策不要完全交给模型,保留人工把关。

参数量和上下文长度是什么意思?

参数量指模型内部可学习的权重数量,常以"亿""千亿"计。通常参数越多,潜在能力越强,但训练与推理的成本、显存占用也越大。上下文长度(上下文窗口)指模型一次能"看到"的最大 token 数,决定了它能处理多长的输入,例如能否一次读完整篇文档;超出部分会被截断,或需要分段、检索等额外手段处理。

如何减少大模型的"幻觉"?

常见做法有三类。一是检索增强(RAG):先从可信资料库检索相关内容,再让模型基于检索到的材料作答,而不是仅凭记忆。二是明确的提示词:要求模型"不确定就说不知道""给出依据与出处"。三是人工核查:对关键事实、数字与引用务必二次核实。这些方法能显著降低幻觉,但目前无法完全消除。

开源模型和闭源模型怎么选?

闭源模型(通过 API 调用)通常能力强、开箱即用、免运维,但数据需要出本地、按调用量付费,且受服务方策略约束。开源模型可本地或私有化部署,数据可控、可微调、长期成本更低,但需要自备算力与工程能力。选择时主要权衡:数据敏感度、成本结构、定制需求,以及团队的运维能力,很多团队会两者混用,把敏感任务放本地、通用任务用云端 API。

广告
广告
广告

常见的大语言模型有哪些?

业界有多个知名的模型系列,例如 OpenAI 的 GPT 系列、Google 的 Gemini、Anthropic 的 Claude、以及 Meta 的开源 Llama 系列等。它们大多基于 Transformer 架构,通过大规模预训练(pre-training)再加微调(fine-tuning)得到。早期的 BERT 更擅长理解类任务(如分类、抽取),而 GPT 类的生成式模型更擅长续写与对话。选择时可结合能力、成本、上下文长度(context window)以及是否开源等因素综合考量。

常见问题(FAQ)

问:LLM 和搜索引擎有什么区别?
答:搜索引擎是"找到并返回已有网页",LLM 是"根据训练所学生成新文本"。前者给链接,后者给答案,但答案需要你自己核实。

问:为什么同一个问题它每次答得不一样?
答:生成过程带有随机性(受温度等参数影响),所以措辞会变;可通过降低随机性或给定更明确的提示来让结果更稳定。

广告
广告
广告

问:什么是"幻觉"?
答:指模型生成了看似合理、实则错误或虚构的内容。因为它优化的是"像不像",而不是"对不对",所以关键信息务必核实。

“Transformer 架构由 Vaswani 等人在 2017 年的论文《Attention Is All You Need》中提出,其核心是完全基于注意力机制来建模序列关系,摒弃了此前的循环网络结构。”

—— Vaswani et al.,《Attention Is All You Need》(2017)

参考来源

觉得有用?分享给需要的人

评论

广告