实践大模型(LLM)

大白话讲,大模型(LLM)就是一个“读过海量资料、特别会理解和生成文字的超级语言预测器”

你可以先把它想成:

你给它一句话,它根据自己学过的大量内容,理解你想干什么,然后不断预测“接下来最应该说什么”。

比如你问:

“Java 怎么连接 MySQL?”

它不是像数据库一样,先找到一篇文章再复制给你,而是根据训练过程中学到的 Java、MySQL、编程知识以及语言规律,现场组织出一个回答

那“大”在哪里?

主要是三个“大”:

数据大:训练时学习了海量的文字、代码等内容。

参数大:模型内部有非常非常多的参数。你可以粗略把参数理解成它学习后形成的无数个“知识和语言关系旋钮”。

能力范围大:一个模型可以同时干很多事情,例如聊天、写代码、翻译、总结、分析、写文档、推理等,不需要每件事情单独训练一个程序。

它到底是怎么工作的?

可以用一个特别简单的例子理解。

你输入:

中国的首都是

模型会计算:

1
2
3
4
北京       98%
上海        1%
南京        0.3%
其他        0.7%

于是选择“北京”。

接下来再预测下一个词。

所以从最底层看,大模型其实一直在干一件事:

根据前面的内容,预测后面最合适的 Token(可以粗略理解为字/词)。

但当模型规模、训练数据和训练方法发展到一定程度后,这种“预测下一个词”的能力会表现出非常复杂的能力,比如写程序、总结文章、分析问题甚至多步骤推理。

可以把传统软件和大模型这样对比

传统程序更像:

程序员把规则写给机器。

例如:

1
2
3
4
如果金额 > 10000
并且国家 = 高风险国家
那么:
    风险等级 = HIGH

而大模型更像:

不给它写死所有规则,而是让它从大量数据中自己学习规律。

你告诉它:

“帮我判断这笔跨境支付交易可能有哪些风险。”

它可以结合输入的信息,生成一个分析结果。

所以可以简单记成:

传统软件 = 人写规则 → 机器执行规则

大模型 = 人给大量数据 → 模型学习规律 → 根据问题生成答案

再往深一层,其实“大模型 → ChatGPT → Agent”是三个不同概念。大模型像“大脑”,ChatGPT 像给大脑配了聊天界面,而 Agent 则像给这个大脑配上了手脚,让它能调用数据库、API、浏览器和其他系统真正去做事情。

大模型按技术架构分类

类型 大白话理解 典型代表/场景
通用语言模型 什么都懂一点,聊天、写作、总结、翻译 GPT、Claude、Gemini、Qwen、DeepSeek
推理模型 遇到难题愿意“多想几步” DeepSeek-R1、OpenAI推理模型
代码模型 特别擅长写代码、改代码、理解工程 Qwen-Coder、DeepSeek-Coder 等
多模态模型 不只认识文字,还能看图片、听声音、理解视频 GPT、Gemini 等多模态模型
视觉/图像生成模型 根据文字“画东西” GPT Image、Stable Diffusion、FLUX
语音模型 听懂人说话或者直接说话 Whisper、各类实时语音模型
Embedding 模型 不负责聊天,而是负责判断“两个东西像不像” 向量检索、RAG
专业领域模型 在某个行业特别强化 医疗、法律、金融、科研模型

把模型看成一组“能力属性”:

1
2
3
4
5
6
7
8
9
10
             一个现代大模型
                  │
    ┌─────────────┼─────────────┐
    ↓             ↓             ↓
 语言能力       推理能力       多模态能力
    │             │             │    写作/翻译      数学/逻辑      图片/声音/视频
    │
    ├── 代码能力
    │
    └── 专业领域能力