返回系列索引
SERIES / ACTIVE
大语言模型前史
从图灵、冯·诺依曼到 GPT-1。这是一条从形式计算、机器记忆、信息概率、学习与注意力一路走到生成式预训练的节目线索。它不把大语言模型讲成突然出现的发明,也不把八十多年的计算史压成一条注定抵达今天的直线。
节目顺序
- EP.011已发布
模仿游戏:Alan Turing 与图灵机
一个过大的问题怎样被改写成可执行的计算动作,或一场可以观察的问答游戏。
- 代表人物
- Alan Turing
- 技术对象
- Turing machine、universal computation、imitation game
- EP.012已发布
“冯·诺依曼架构”:从 EDVAC 到大语言模型
程序成为机器记忆中的对象后,程序、状态、控制与执行的关系怎样跨越不同尺度,并在性能压力下重新显形。
- 代表人物
- John von Neumann
- 技术对象
- stored-program computer、programming languages、data reuse
- EP.013已发布
信息熵:Claude Shannon 与下一个字母
语言怎样变成可以预测和度量的概率分布。
- 代表人物
- Claude Shannon
- 技术对象
- entropy、conditional probability、character prediction
- EP.014已发布
感知机:Frank Rosenblatt 与会犯错的机器
机器怎样从样本和错误中修改参数。
- 代表人物
- Frank Rosenblatt
- 技术对象
- perceptron、learnable weights、linear separability
- EP.015已发布
专家系统:Edward Feigenbaum 与 DENDRAL
从 DENDRAL 的化学判断、知识获取与规则学习,讨论显式知识的能力、维护成本及其与语言模型的不同路径。
- 代表人物
- Edward Feigenbaum
- 技术对象
- symbolic knowledge、heuristic search、knowledge engineering
- EP.016计划中
n-gram:Frederick Jelinek 与 IBM 的语言概率
语言工程怎样从手写规则转向数据、概率和统一评测。
- 代表人物
- Frederick Jelinek
- 技术对象
- n-gram、HMM、perplexity、noisy channel
- EP.017计划中
LSTM:Sepp Hochreiter 与消失的梯度
误差怎样穿过多层网络和漫长时间,并重新接上语言问题。
- 代表人物
- Sepp Hochreiter
- 技术对象
- backpropagation、long-term memory、neural language model bridge
- EP.018计划中
Seq2Seq 与 Attention:Dzmitry Bahdanau 与固定向量瓶颈
可变长度序列怎样被翻译,解码器怎样突破固定向量瓶颈。
- 代表人物
- Dzmitry Bahdanau
- 技术对象
- encoder-decoder、soft alignment、attention
- EP.019计划中
Attention Is All You Need
attention 怎样取代循环,成为可并行扩展的主体架构。
- 代表人物
- Jakob Uszkoreit
- 技术对象
- self-attention、Transformer、parallel training
- EP.020计划中
GPT-1:Alec Radford 与生成式预训练
同一个 Transformer 怎样先从无标签文本学习,再迁移到多个有标签任务。
- 代表人物
- Alec Radford
- 技术对象
- causal language model、pre-training、fine-tuning