大白话讲,大模型(LLM)就是一个“读过海量资料、特别会理解和生成文字的超级语言预测器”。
你可以先把它想成:
你给它一句话,它根据自己学过的大量内容,理解你想干什么,然后不断预测“接下来最应该说什么”。
比如你问:
“Java 怎么连接 MySQL?”
它不是像数据库一样,先找到一篇文章再复制给你,而是根据训练过程中学到的 Java、MySQL、编程知识以及语言规律,现场组织出一个回答。
那“大”在哪里?
主要是三个“大”:
数据大:训练时学习了海量的文字、代码等内容。
参数大:模型内部有非常非常多的参数。你可以粗略把参数理解成它学习后形成的无数个“知识和语言关系旋钮”。
能力范围大:一个模型可以同时干很多事情,例如聊天、写代码、翻译、总结、分析、写文档、推理等,不需要每件事情单独训练一个程序。
它到底是怎么工作的?
可以用一个特别简单的例子理解。
你输入:
中国的首都是
模型会计算:
1 | |
于是选择“北京”。
接下来再预测下一个词。
所以从最底层看,大模型其实一直在干一件事:
根据前面的内容,预测后面最合适的 Token(可以粗略理解为字/词)。
但当模型规模、训练数据和训练方法发展到一定程度后,这种“预测下一个词”的能力会表现出非常复杂的能力,比如写程序、总结文章、分析问题甚至多步骤推理。
可以把传统软件和大模型这样对比
传统程序更像:
程序员把规则写给机器。
例如:
1 | |
而大模型更像:
不给它写死所有规则,而是让它从大量数据中自己学习规律。
你告诉它:
“帮我判断这笔跨境支付交易可能有哪些风险。”
它可以结合输入的信息,生成一个分析结果。
所以可以简单记成:
传统软件 = 人写规则 → 机器执行规则
大模型 = 人给大量数据 → 模型学习规律 → 根据问题生成答案
再往深一层,其实“大模型 → ChatGPT → Agent”是三个不同概念。大模型像“大脑”,ChatGPT 像给大脑配了聊天界面,而 Agent 则像给这个大脑配上了手脚,让它能调用数据库、API、浏览器和其他系统真正去做事情。
大模型按技术架构分类
| 类型 | 大白话理解 | 典型代表/场景 |
|---|---|---|
| 通用语言模型 | 什么都懂一点,聊天、写作、总结、翻译 | GPT、Claude、Gemini、Qwen、DeepSeek |
| 推理模型 | 遇到难题愿意“多想几步” | DeepSeek-R1、OpenAI推理模型 |
| 代码模型 | 特别擅长写代码、改代码、理解工程 | Qwen-Coder、DeepSeek-Coder 等 |
| 多模态模型 | 不只认识文字,还能看图片、听声音、理解视频 | GPT、Gemini 等多模态模型 |
| 视觉/图像生成模型 | 根据文字“画东西” | GPT Image、Stable Diffusion、FLUX |
| 语音模型 | 听懂人说话或者直接说话 | Whisper、各类实时语音模型 |
| Embedding 模型 | 不负责聊天,而是负责判断“两个东西像不像” | 向量检索、RAG |
| 专业领域模型 | 在某个行业特别强化 | 医疗、法律、金融、科研模型 |
把模型看成一组“能力属性”:
1 | |