F

Forever23 · 博客

A text-focused Halo theme

  • 首页
  • 文章
  • 默认分类
  • 关于
主页 大模型入门-1
文章

大模型入门-1

发表于 2026-08-3 更新于 2026-08- 3
作者 Administrator
46~59 分钟 阅读

这是一个非常好的问题。

而且你的目标不是“会用大模型”,而是“真正理解大模型为什么这样训练、为什么这样设计,并最终能够自己设计训练方案”。

如果按照大学课程来讲,这门课至少要讲一个学期(40~60小时)。

我建议我们采用一种MIT/Stanford + 工程实践的方式,而不是网上很多"Transformer→Attention→LLM"这种倒着讲的方法。


我建议的学习路线(零基础 → 专家)

整个路线可以分成 10 个阶段。

第一阶段
计算机如何学习(机器学习本质)

↓

第二阶段
神经网络为什么能够学习

↓

第三阶段
深度学习训练过程

↓

第四阶段
Transformer 为什么革命

↓

第五阶段
LLM 是怎么训练出来的

↓

第六阶段
各种训练方法(Pretrain/SFT/RLHF/DPO...)

↓

第七阶段
分布式训练(DeepSpeed/FSDP/Megatron)

↓

第八阶段
训练优化(FlashAttention、MoE、量化)

↓

第九阶段
推理优化(vLLM、KV Cache)

↓

第十阶段
真正的大模型工程

如果坚持学习,大约:

  • 入门:2个月

  • 熟练:半年

  • 能阅读论文:1年

  • 能设计训练系统:2~3年


今天先讲第一件事情:

为什么机器能够学习?

很多教程一开始就讲Transformer。

其实这是错误的。

Transformer只是一种网络结构。

真正的问题应该是:

机器为什么能够自己变聪明?


第一章 什么叫训练(Training)

假设你教一个小孩认猫。

你拿出很多图片。

图片1
🐱

告诉他:

这是猫。

再来

🐱

这是猫。

再来

🐱

这是猫。

最后

🐶

这是狗。

慢慢地,小孩脑子里就形成了一个概念:

猫一般有:

  • 耳朵尖

  • 胡子

  • 两只眼

  • 四条腿

以后再看到猫:

新的图片

他说:

这是猫。


这就是学习。

机器学习也是一样。

区别只是:

人脑里面是神经元。

机器里面是一堆数字。


第二章 机器里面到底存的是什么?

很多人误以为:

AI训练之后会保存很多图片。

不是。

训练以后保存的是:

几十亿个参数(Parameter)

例如

0.23

-1.45

5.91

0.00023

......

GPT-4可能有上万亿个参数。

Llama 70B

就是700亿个参数。

参数就是:

很多很多数字

这些数字决定了模型怎么看世界。


举个例子。

假设只有三个参数。

w1 = 0.5

w2 = -2

w3 = 4

模型看到一只猫。

经过计算:

0.5×耳朵

-2×尾巴

4×胡子

最后得到:

98%

猫

训练其实就是:

不断修改

w1

w2

w3

直到答案越来越正确。


所以:

训练 = 调参数。

这句话非常重要。

以后看到所有论文,

其实都是:

怎么调参数。


第三章 什么叫模型?

很多人又会混淆:

模型是什么?

其实:

模型 = 数学公式。

例如:

y = ax+b

是不是模型?

当然是。

假设:

x=10

如果

a=2

b=1

那么:

21

这里

a

b

就是参数。


如果

a=100

b=-50

答案又变了。

说明:

参数决定模型能力。


神经网络也是一样。

只是公式超级复杂。

不是

ax+b

而是:

几万亿次矩阵乘法

所以:

Transformer

本质仍然只是:

输入

↓

很多数学公式

↓

输出

第四章 什么叫训练?

假设:

真实答案:

猫

模型说:

狗

怎么办?

老师告诉它:

错了。

于是:

模型修改参数一点点。

比如

原来:

w=5

改成:

w=5.01

再试。

如果更正确。

继续。

如果更差。

换方向。

最终:

越来越准。

整个过程就是:

预测

↓

比较答案

↓

发现错误

↓

修改参数

↓

重新预测

↓

重复几十亿次

这就是训练。


第五章 为什么需要 Loss(损失函数)

训练必须知道:

错了多少?

假设:

真实:

100

模型:

99

错:

1

如果预测:

500

错:

400

于是定义:

Loss = 错误程度

Loss越小越好。

例如:

Loss=100

↓

Loss=20

↓

Loss=5

↓

Loss=0.3

说明:

模型越来越聪明。


所以:

训练真正目标不是:

提高准确率。

而是:

不断降低Loss。


第六章 为什么能够自动修改参数?

这是深度学习最伟大的地方。

假设:

模型:

y=ax+b

真实:

100

模型:

90

Loss:

10

现在:

问题来了:

到底改a?

还是改b?

以前没人知道。

1986年,

反向传播(Backpropagation) 提供了一种高效的方法,可以计算每个参数对最终误差的影响。

它会告诉模型:

a增加一点

Loss下降

↓

继续增加

或者:

b增加一点

Loss变大

↓

不要增加

于是:

所有参数都会得到:

应该往哪个方向改

这就是:

梯度(Gradient)

所以:

训练真正发生的是:

Loss

↓

梯度

↓

更新参数

↓

Loss下降

第七章 为什么需要 GPU?

假设:

模型:

3个参数

CPU:

可以算。

但是:

GPT:

700亿参数

一次训练:

可能涉及:

700亿

×

2048 token

×

80层

×

几十万步

意味着:

一次训练可能要进行数万亿甚至更多次浮点运算。

CPU:

几十个核心

GPU:

上万个CUDA Core

GPU就是:

超级矩阵计算器。

所以:

AI训练几乎全部依赖GPU。


第八章 到这里,其实已经理解了训练

很多人觉得:

训练特别神秘。

其实整个流程只有下面几步:

数据

↓

模型预测

↓

Loss

↓

反向传播

↓

梯度

↓

修改参数

↓

重复

真正复杂的是:

模型结构、数据、优化算法、训练规模和工程实现。


第九章 大模型训练主要有哪些方法?

当你理解了上面的基础后,就可以看懂大模型训练的完整流程了。一个现代 LLM 往往不是只训练一次,而是经过多个阶段。

阶段

方法

目标

优点

缺点

1

预训练(Pretraining)

学会语言、知识和推理基础

通用能力最强

成本极高,需要海量数据和算力

2

继续预训练(Continued Pretraining)

学习新领域(医疗、法律等)

能快速适应专业领域

可能遗忘部分原有知识(灾难性遗忘)

3

监督微调(SFT)

学习按照人类期望回答

指令遵循能力显著提升

依赖高质量标注数据

4

偏好优化(RLHF / DPO 等)

学习人类偏好,让回答更符合预期

回答更自然、更安全

数据采集复杂,训练设计较难

5

领域微调(LoRA、QLoRA 等)

用较低成本适配特定任务

成本低、速度快

能力提升通常局限于目标领域

可以把它类比成培养一位医生:

  • 预训练:从小学到大学,学习所有基础知识。

  • 继续预训练:攻读医学专业。

  • SFT:跟着导师学习如何接诊、写病历。

  • RLHF / DPO:根据病人和专家反馈,不断改进沟通方式和决策。

  • LoRA 微调:额外学习某个细分专科,例如心血管介入。


第十章 每种训练方法如何选择?

如果你的目标不同,起步方式也不同:

① 想入门大模型(推荐)

学习顺序:

Python

↓

线性代数

↓

神经网络

↓

PyTorch

↓

Transformer

↓

LLM

这是最扎实的路线。


② 想成为训练工程师(你的情况比较接近)

建议重点投入:

PyTorch

↓

CUDA

↓

GPU架构

↓

NCCL

↓

InfiniBand/RDMA

↓

Megatron

↓

DeepSpeed

↓

FSDP

↓

FlashAttention

↓

MoE

↓

vLLM

结合你之前一直在研究 NCCL、InfiniBand、GPU、vLLM 加载、容器、CUDA 等问题,这条路线与你目前的工作内容高度契合。


③ 想成为算法研究员

则需要进一步深入:

数学

↓

Transformer论文

↓

Attention

↓

Scaling Law

↓

RLHF

↓

DPO

↓

MoE

↓

最新论文

重点会放在模型设计、训练目标和新算法,而不仅仅是系统实现。


我建议的一条"专家路线"

结合你的提问风格和之前关于 NCCL、IB 网络、GPU 通信、vLLM、容器运行 等内容,我建议采用"算法 + 系统"双线并进,而不是只学算法或只学工程。

建议按下面的顺序,每一步都做到"知道原理 + 能动手实践":

  1. 数学基础:线性代数、概率统计、微积分(理解矩阵、梯度、优化)。

  2. 机器学习基础:监督学习、损失函数、梯度下降、过拟合。

  3. 神经网络与 PyTorch:从手写一个两层神经网络开始,再到使用框架。

  4. Transformer 原理:Embedding、Attention、位置编码、FFN、残差、LayerNorm。

  5. LLM 全流程训练:Pretraining → SFT → RLHF/DPO → 推理。

  6. 分布式训练:Data Parallel、Tensor Parallel、Pipeline Parallel、ZeRO/FSDP。

  7. GPU 与通信:CUDA、NCCL、PCIe、NVLink、InfiniBand、RDMA。

  8. 训练与推理优化:FlashAttention、MoE、KV Cache、PagedAttention、vLLM。

  9. 源码阅读:PyTorch → Megatron-LM → DeepSpeed → vLLM。

这条路线能帮助你不仅理解"模型为什么能学会",还能够理解"为什么训练需要这么多 GPU、为什么 NCCL 会报错、为什么 IB 网络性能会影响训练速度、为什么 FlashAttention 能更快"——这些问题最终都会连成一个完整的知识体系。

大模型入门到...
许可协议:  CC BY 4.0
分享

相关文章

8月 4, 2026

第一学期第四节课

很好,我们继续。 前面三节课,我们已经建立了机器学习最核心的几个概念: 现实世界 ↓ 数据 Data ↓ 特征 Feature ↓ 模型 Model ↓ 参数 Parameter ↓ 训练 Training ↓ 预测 Prediction 今天我们进

8月 4, 2026

第一学期第三节课

很好,我们继续。 到目前为止,我们已经建立了第一棵非常重要的知识树: 现实世界 ↓ 数据 Data ↓ 特征 Feature ↓ 模型 Model ↓ 参数 Parameter ↓ 预测 Prediction 上一节课最后留下了一个非常核心的问题: 如果 A

8月 4, 2026

第一学期第二节课

太好了,我们继续。 这一节开始,我们正式进入机器学习真正的核心概念。 实际上,如果你去读《Pattern Recognition and Machine Learning》(PRML)或者 Andrew Ng 的课程,都会不断提到一个词: Feature(特征) 很多初学者觉得它只是一个术语。 实际

下一篇

大模型入门-2

上一篇

进程、线程和 CPU 核心数

最近更新

  • ai设计方案
  • ai编程规则
  • 第一学期第四节课
  • 第一学期第三节课
  • 第一学期第二节课

热门标签

Halo

目录

©2026 Forever23 · 博客. 保留部分权利。

使用 Halo 主题 Chirpy