冷开场:机器很大,选择很小
0:00一九三六年,Claude Shannon 来到 MIT。他刚从密歇根大学毕业,同时学过电气工程和数学。摆在他面前的,是一台占满房间的微分分析机。它用转轴、齿轮和积分装置求解方程,控制部分则要靠复杂的继电器线路,把一次次开和关组织起来。
操作这台机器,当然要知道哪个开关接到哪里。Shannon 多问了一步:这些线路能不能不再靠工程师逐根追踪,而是被写成一组逻辑关系?如果开代表一,关代表零,那么串联、并联和切换,就可以对应“并且”“或者”“不是”这样的运算。
眼前仍然是金属、触点和导线,问题却缩小了。工程师不必先记住整台机器的每一条路径,可以先计算开关之间的关系,再让计算结果返回线路设计。
[001]
引用 [001]
Gallager 的后见同行回顾支撑人物位置和研究动作;不能据此把 differential analyzer 或 Boolean switching 写成信息论、语言模型或 LLM 的直接起源。
printed pp. 2681-2682: Michigan electrical-engineering / mathematics degrees, MIT differential analyzer and Boolean switching work
这项工作后来进入 Shannon 的 MIT 硕士论文。论文题目谈的是继电器和开关电路的符号分析,不是语言,也不是人工智能。它的重要性先留在当时的工程现场:一张让人头疼的线路图,被改写成可以推导、比较和检查的表达式。
这会成为 Shannon 身上反复出现的一种动作。面对一个混着装置、信号、人类习惯和模糊概念的大问题,他先不急着把全部东西一起解释。他寻找一个足够小、可以算、也可以拿回现实检验的关系。
开关只有两种状态,通信中的消息却几乎无穷。怎样把“可能说什么”也变成一种可以测量的选择?
[002]
引用 [002]
来源共同支撑论文身份与 Gallager 对 Shannon 研究方式的后见概括;正文把两者编辑为人物动作,不声称 switching research 直接导致 1948 理论。
- MIT DSpace,学位论文机构元数据
- Robert G. Gallager, Claude E. Shannon: a retrospective on his life, work, and impact
MIT DSpace metadata fields for A symbolic analysis of relay and switching circuits, 1940; Gallager printed pp. 2681-2682 and 2692-2695
第一章:先把“意思”放到模型外面
1:38从 MIT 到普林斯顿,再到贝尔实验室,Shannon 面对的问题不再只是一排继电器。通信线路要穿过噪声,密码系统要隐藏消息,接收端还要判断收到的信号究竟对应哪一种可能。
他不是在一片空地上开始。一九四八年的论文把 Harry Nyquist 和 Ralph Hartley 的早期通信研究列为重要基础,也感谢 Norbert Wiener 以及多位贝尔实验室同事的建议和批评。这些人没有被压成一个名单:他们让我们看见,Shannon 的坐标来自一个已经积累了带宽、信号、滤波、预测和信息测量问题的工程环境。
Shannon 的选择,是把这些问题重新收束。通信的基本任务,可以先写成:发送端从一组可能消息中选出一条,接收端怎样在另一处把它准确或近似地复现。
[003]
引用 [003]
支撑通信问题环境、论文明确前驱与致谢、以及消息选择的工程表述;Nyquist / Hartley 当前正文不足,不能扩写私下影响或共同机制。
- Robert G. Gallager, Claude E. Shannon: a retrospective on his life, work, and impact
- C. E. Shannon,完整校订重印 PDF
- Crossref,H. Nyquist 论文元数据
- Crossref,R. V. L. Hartley 论文元数据
Gallager printed pp. 2682-2684; 1948 corrected reprint p. 1 Introduction and p. 51 Acknowledgments; Nyquist / Hartley publication metadata
一句话当然有意思。对说话的人、收信的人,意思甚至可能比信号本身更重要。Shannon 没有否认这一点。他做的是一道更克制、也更大胆的切分:在当前的通信工程模型里,先不处理语义,只处理有哪些可能消息、它们出现的概率怎样、经过信道以后还能不能被区分。
像排查一条复杂请求链时,先只追踪请求从哪里来、可能走向哪里、在哪个接口丢失,不等于业务含义不重要。它只是暂时把一个过大的问题切到可以观测的层面。这个类比到这里为止:通信理论研究的是概率、编码和信道,不是一套软件调用链。
语义被放在模型外面,选择便进入了数学。罕见消息带来的信息更多,常见消息带来的信息更少;如果每次选择都像一次二选一,那么平均还要问多少次,才能确定结果,就给了我们理解信息量和熵的第一层直觉。
[004]
引用 [004]
支撑语义边界、选择概率和以二为底的信息量;请求链只解释主动缩小模型的动作,不能把软件机制与通信数学等同。
reprint p. 1 Introduction and pp. 10-11 §6
这也是“熵”最容易被误听的地方。它在这里不是给一段文字的混乱程度打分,也不直接判断一句话有没有意义、写得好不好、说话者聪不聪明。它只在给定的概率模型里,测量一次选择平均还剩多少不确定性。
如果下一个字符几乎肯定是某一个,选择很集中,不确定性就低;如果许多字符机会相近,不确定性就高。这个量让编码、压缩和信道可以被比较,却不会越过模型,替我们回答语言为何有意义。
要看这套切分究竟能做什么,Shannon 没有先去争论“机器懂不懂英语”。他先把英语拆成二十六个字母,再加上空格。
[005]
引用 [005]
支撑熵作为给定概率分布下平均不确定性的最小解释;正文明确排除日常混乱、意义、质量和理解等替换。
reprint pp. 1 and 10-11, Introduction and §6
第二章:翻一本书,造出越来越像英语的乱码
4:15先想象一只盒子,里面装着二十六个字母和一个空格。第一轮,每个符号被抽到的机会完全相同。出来的字符串几乎没有英语的影子。
第二轮,不再让机会相同。英语里常见的字母多出现,少见的字母少出现。再往后,选择不只看单个字符的频率,还看两个字符、三个字符怎样相邻;然后把单位扩大到单词,再看一个单词后面常接什么词。
约束一层层增加,结果开始出现英语的外形。局部组合更熟悉,词与词之间也像有了节奏。可是“更像”不等于“已经有意思”。这些样本展示的是统计结构怎样改变表面,不是机器已经理解句子。
[006]
引用 [006]
支撑从等概率字符到字符 / 词转移的有限阶英文近似;样本外形不能证明意义、语法完备或现代神经语言模型已经出现。
reprint pp. 6-7 §3: six English approximations over 26 letters plus space
其中一轮甚至不需要一台电子计算机。Shannon 给出了一种查书办法:先随机翻开一本书,选到一个字符;再翻到另一页,寻找同一个字符,把它后面的字符抄下来。现在拿着新字符继续翻书,重复寻找、抄写。
每一步都借用了真实英语里的一小段相邻关系。你不知道句子要去哪里,只知道书中某个相同字符后面曾经跟过什么。上一字符像一把很短的筛子,从二十七个候选里压掉了一部分不常见的选择。
这不是现代语言模型的手工版本。它不学习参数,不保存长距离上下文,也不会因为整段输出不自然而修改自己。它真正展示的是更小的一件事:只要让过去的一点信息进入条件,下一步的概率就会改变。
[007]
引用 [007]
支撑查书生成动作;筛子类比只解释条件压窄候选,正文明确排除参数学习、长距离上下文和现代语言模型等同。
reprint p. 8 §3 ending: book-based construction for second-order and related approximations
问题也在这里暴露出来。只记录一个字符后面常跟什么,表格不算太大;要记录更长的字符组合,可能情况会迅速膨胀。再加上单词、习语、语法和一句话前后照应的思路,人类熟悉的英语并没有轻易装进这些短表格。
Shannon 可以继续扩大统计表,但每增加一层,上一步那种翻书工作都会变得更加庞大。更需要的,是一种不必把所有长距离组合先列出来,却能感知“看到这段前文以后,下一个字符还剩多少选择”的办法。
一九四八年的论文先把这个缺口留在桌上。第二年,另一个人把“上下文能压掉多少可能”带去了一个更大的语言问题。
[008]
引用 [008]
支撑有限阶近似随阶数增长而劳动膨胀;正文把它编辑为长上下文测量压力,不声称 Shannon 当时提出神经表示或预见后续路线。
reprint pp. 7-8 §3, especially the labor required for higher-order approximations
第三章:Weaver 把上下文带进翻译问题
6:36Warren Weaver 当时在洛克菲勒基金会推动科学研究。他关心一个计算机尚未真正解决的问题:不同语言之间的翻译,能不能借助电子机器?难点不只是查字典。同一个词放进不同句子,会指向不同意思;只看眼前这一个词,选择往往不够。
一九四九年,Weaver 写下一份机器翻译备忘录。他直接提到 Shannon 刚发表的通信理论,也借用了战争密码分析的经验。一个陌生符号如果孤零零出现,很难判断;周围材料越多,候选解释可能越少。
这一次,Shannon 的影响不是后人从相似动作里猜出来的。Weaver 在原文里点了名,并把统计、上下文和可容忍错误带进了机器翻译的研究议程。
[009]
引用 [009]
支撑 Weaver 的问题位置、对 Shannon 通信理论的直接点名,以及统计 / 密码分析 / 上下文进入翻译议程;不证明当时已有可运行系统。
PDF pp. 1-5 and 8-11, especially §§5 and 7
Weaver 把一个词周围的若干词叫作“微观上下文”。他追问:要看到多大的上下文,才能以足够高的概率选对词义?这已经不只是猜下一个字符,而是把上下文的作用推向歧义和翻译。
可以把它想成代码补全里的同名函数。只看到函数名,候选可能很多;再看到调用它的模块、参数和返回值,范围会迅速缩小。但这个类比并不说明翻译等于代码补全。自然语言的语境、文化和意图不会被几项类型信息完全替代。
Weaver 的贡献,是把“上下文改变可能性”变成一项值得组织研究的问题,不是提前交出今天机器翻译的答案。
[010]
引用 [010]
支撑 micro-context 对词义歧义的研究设想;代码补全类比只解释上下文压窄候选,不能把翻译、类型系统或语义机制等同。
PDF pp. 8-9 §5: micro-context and probability of selecting the intended meaning
备忘录里也有明显的犹疑。Weaver 说自己的想法可能很天真。他是在刺激研究,不是在宣布一套机器已经把翻译做成。把外语看作某种编码后的英语,也只是一个推动问题的比喻,后来需要被大量修正。
Shannon 没有因此变成机器翻译项目的作者。这里真正发生的,是一种提问方式开始离开通信线路,被另一个研究组织者拿去试探语言。
而 Shannon 自己选择的下一步更窄。他不先让机器翻译,也不要求一张无限增长的频率表。他找来一个熟悉英语的人,把后面的文字遮住。
[011]
引用 [011]
支撑备忘录作为带自限的研究倡议;不能据此说 Shannon 参与机器翻译项目、密码破解已经提供完整翻译机制或系统已经运行。
PDF pp. 1-11, including Weaver's repeated tentative / naive framing and the research-proposal character of the memorandum
第四章:正确字符排在第几次
8:46桌上有一段受试者没有读过的英文。除了开头,后面的字符全部遮住。受试者先猜第一个字符。猜对,那个字符被揭开;猜错,实验者也会告诉他正确答案。然后受试者带着已经出现的全部前文,继续猜下一个。
空格也算一个字符,所以每一步都有二十七种可能。刚开始,线索很少;一个单词显出形状以后,常见拼写开始排除候选;句子逐渐展开,语法、习语和已经出现的思路也会参与判断。
论文只把执行猜测的人写作“受试者”,没有给出姓名。我们知道的是实验主语是人,不是一台接受训练的机器。
[012]
引用 [012]
支撑遮住、猜测、揭示和保留前文的实验动作;正文保留 the subject 未具名边界,不把实验改写成机器训练。
printed pp. 54-55 §3: first prediction experiment, revealed context and 27-symbol alphabet
第一种实验只记第一次有没有猜中。Shannon 随后把它改得更细:猜错以后,不立刻揭示答案,而是让受试者继续猜,直到说出正确字符。实验者记录的,不再只是对或错,而是正确答案排在第一次、第二次,还是更后面。
一段一百零二个符号的样本里,有七十九个符号第一次就被猜中,八个排在第二次,三个排在第三次,第四和第五次各有两个,还有八个要猜五次以上。
这些数字不会自动变成每个字符的精确概率,却留下了一张排序的痕迹:正确答案越常出现在前面,说明前文把可能性压得越集中;它越常躲在后面,下一步就越意外。
[013]
引用 [013]
支撑多次猜测过程和 102 符号样本分布;该样本不能推广为全部英语、体裁、语言或读者的固定准确率。
printed pp. 55-56, repeated-guess procedure and sample (9)
现在可以看见“熵”在这场实验里怎样落地。假如正确字符总在第一猜出现,前文几乎把选择锁定了;假如二十七个候选总要试很多次,剩余不确定性就更大。
理想的预测者,会按真实条件概率从高到低排列候选。现实中的人并不理想,也没有直接报出一张完整概率表,所以猜中名次无法交出一个精确答案。Shannon 采用更谨慎的做法:用这些名次的频率,推导英语熵能够落在哪个上界和下界之间。
这一步像只知道一次搜索结果排在列表第几名,却不知道搜索系统给每个结果打了多少分。排名仍能告诉你分布大致集中还是分散,但不能还原全部分数。类比只解释为什么得到的是边界;受试者依靠的语言知识和数学推导,都不是搜索引擎。
[014]
引用 [014]
支撑从猜中名次到熵边界的机制;搜索排名类比只解释名次不等于完整概率,不能替代论文证明或把受试者等同算法。
printed pp. 54-64 §§3-6: prediction ranks, ideal predictor and entropy bounds
在已知一百个前文字符的那组结果里,表中给出的下界大约是每字符零点六 bit,上界大约是一点三 bit。论文开头把普通文学英语概括为大约每字符一个 bit,冗余约四分之三。
“冗余”在这里也不是说四分之三的文字都是废话。它比较的是:如果二十七个符号机会完全相同,选择会有多不确定;真实英语的统计约束,又把这份不确定性减少了多少。
这些数字必须和限制一起听。样本有明显的抽样误差,不同体裁表现不同,人的预测也不是理想预测器。Shannon 给出的是一组有条件的估计边界,不是英语、意义或理解的永恒常数。
[015]
引用 [015]
支撑 N=100 的约 0.6-1.3 bits/character、约 1 bit/character、约 75 percent redundancy 及采样 / 预测者限制;不能表述为精确普遍定律。
printed pp. 50-51 Introduction, pp. 57-58 Table I, and p. 64 §6
这也不是 Shannon 一个人默默完成的纸上游戏。论文明确感谢 Mary E. Shannon 和贝尔实验室的 B. M. Oliver 对实验工作的帮助,以及他们给出的建议和理论批评。但正文没有把每一组样本、每一次猜测或每一条推导分配给具体个人,也没有把 Mary 写成唯一受试者。
证据允许我们看见协作,却不允许节目替档案补上角色。
更重要的边界在实验本身:这里的预测错误被记录下来,是为了测量英语还剩多少不确定性。没有一台模型因为猜错而改变参数。要发生那次责任转移,预测者必须先从人变成模型。
[016]
引用 [016]
支撑 Mary E. Shannon / B. M. Oliver 的实验帮助、建议和理论批评,以及实验只记录人类预测;不能分配具体受试者、样本或公式作者身份。
printed p. 64 Acknowledgment and pp. 54-58 experiment sections
第五章:预测者从人变成模型
12:31四十多年以后,IBM 沃森研究中心的一组研究者重新打开了这个问题。Peter Brown、Stephen Della Pietra、Vincent Della Pietra、Jennifer Lai 和 Robert Mercer 在论文开头直接从“Shannon 一九五一年的论文以来”起算。
他们面对的是人类实验留下的限制。让人逐字猜,能够带入词汇、语法和长距离上下文,却很难把样本扩展到几百万字符,也很难让不同团队反复比较同一套预测者。
如果预测者换成语言模型,概率就可以被机器连续计算。人不再每次坐在遮住的文本前,人的劳动转向准备语料、设计模型和判断测量边界。
[017]
引用 [017]
支撑 IBM 作者组直接从 Shannon 1951 起算及其规模化测量问题;不把整个 IBM / Jelinek 语言模型史归给五位作者。
- Peter F. Brown 等, An Estimate of an Upper Bound for the Entropy of English
- ACL Anthology,Brown 等论文目录 / 权利页
printed pp. 31-33, Abstract and Introduction; ACL metadata for authorship and publication identity
这组研究者用五亿八千三百万词的训练文本,建立一个词三元语言模型。它主要根据前两个词,估计下一个词出现的概率。随后,模型在一份接近六百万字符的平衡英语语料上接受测试。
测试时,真实文本已经写在那里。模型要做的,是给每一步实际出现的词分配概率。真实词如果总能获得较高概率,平均交叉熵就更低;如果模型经常把真实词放到很意外的位置,交叉熵就更高。
论文得到每字符一点七五 bit 的上界。这个数字属于这套模型和这份样本,不是英语熵的精确新常数。模型还有偏差,所以它给出的交叉熵只能把真正的熵从上面压住。
[018]
引用 [018]
支撑训练 / 测试规模、词三元模型、交叉熵和 1.75 上界;不能把上界说成英语熵精确值或全部统计语言模型质量。
printed pp. 31-33 and following model / results sections: 583M-word training text, word trigram model, 5.96M-character Brown Corpus and 1.75 bits/character upper bound
一九五一年的受试者猜得靠后,说明这一步对人更意外;一九九二年的模型给真实文本较低概率,说明这套模型还没有抓住足够多的语言约束。两边都在观察预测误差,误差承担的责任却已经不同。
在人类实验里,误差帮助描述英语;在统计模型里,误差还开始评价模型。换一套概率估计办法,放到同一份测试文本上,数字就能告诉研究者哪一个模型把真实文本解释得更好。
但词三元模型有一道很快出现的墙。它看见过的短词组可以被计数;词表一大,组合急剧增加,大多数可能的句子在训练材料里从未出现。只靠缩短上下文和回退频率,很难让一个见过的句子帮助另一个只替换了相似词的句子。
[019]
引用 [019]
三个来源共同支撑误差用途变化和 n-gram 稀疏压力;这是编辑比较,不证明三个团队形成直接合作或单线引用链。
- C. E. Shannon,BSTJ 扫描 PDF
- Peter F. Brown 等, An Estimate of an Upper Bound for the Entropy of English
- Yoshua Bengio / Réjean Ducharme / Pascal Vincent / Christian Jauvin, A Neural Probabilistic Language Model
Shannon printed pp. 54-64; Brown printed pp. 31-33; Bengio printed pp. 1137-1140 on n-gram dimensionality pressure
第六章:猜错以后,词的位置也会改变
14:50二〇〇三年,Yoshua Bengio、Réjean Ducharme、Pascal Vincent 和 Christian Jauvin 把这道墙称作“维度灾难”。词的组合太多,一段有限语料不可能逐一覆盖。模型没见过某个组合,不代表那个句子不合理;它可能只是把一个常见词换成了意思相近的另一个词。
传统计数很难把这两种情况联系起来。两个词只要名字不同,就落在两格分开的表里。缩短上下文能够找到更多重复,却也会扔掉真正有用的前文。
团队选择不再只保存词的身份和次数。他们为每个词学习一组连续数值,让相似词可以在这个空间里靠近。
[020]
引用 [020]
支撑维度灾难、未见组合和分布式表示选择;不把词向量、神经语言模型或全部贡献归给单一作者。
- Yoshua Bengio / Réjean Ducharme / Pascal Vincent / Christian Jauvin, A Neural Probabilistic Language Model
- JMLR,Bengio 等论文正式目录页
printed pp. 1137-1140, Abstract and Introduction; JMLR metadata for title and four-author identity
关键变化发生在猜错以后。真实的下一个词如果只得到很低的概率,损失就会升高。训练过程沿着这份误差,调整词的坐标,也调整神经网络内部的参数,让相似前文下次更愿意把概率交给真实词。
预测错误不再只被记在实验表格里,也不只给一个完成的模型打分。它进入模型内部,成为表示和参数改变的方向。
这篇论文继续使用条件概率和困惑度,也引用了 Jelinek-Mercer 与 Brown 等人的统计语言模型路线,却没有直接引用 Shannon。我们能说的是问题、方法和指标经过一个领域继续传递;不能把它改写成 Shannon 直接启发 Bengio 发明词向量。
[022]
引用 [022]
支撑预测损失更新表示与网络参数、以及方法 / 指标继承;论文未直接引用 Shannon,不能写成直接影响或单人发明。
printed pp. 1139-1141 and 1144-1150: likelihood objective, joint parameter learning, perplexity and n-gram / Jelinek-Mercer / Brown comparisons
第七章:语言模型不再只是一个终点
17:01神经语言模型学会了表示和预测,新的阻力随之出现。互联网上有大量连续文本,却没有同等数量的人,替每一段文字标好“这是问答”“这是蕴含”“这是分类”。为每个任务单独准备数据、再单独设计一套模型,成本很高,学到的能力也彼此隔开。
二〇一八年,Alec Radford、Karthik Narasimhan、Tim Salimans 和 Ilya Sutskever 提出一条两阶段路线。先让同一个模型在大量无标签文本上做语言预测,再把已经学到的参数带到具体任务里。
论文题目叫《通过生成式预训练改进语言理解》。标题里没有“GPT-1”这个编号;这是后来为了区分后续版本形成的叫法。
[023]
引用 [023]
支撑四位作者、问题压力和两阶段路线;GPT-1 是后见名称,不能改写论文原题或压成单作者故事。
PDF pp. 1-3, Abstract and Introduction: unlabeled text, costly labeled data, two-stage generative pre-training and task adaptation
第一阶段,Transformer 解码器读取前面的 token,预测当前 token。token 是模型处理的文字片段,可能短于一个词,也可能覆盖一个常见词;它不等同 Shannon 实验里的单个字符。
预测真实 token 时产生的误差,通过随机梯度下降修改整套参数。模型反复做这件事,从连续文本里学习一套可以继续使用的表示和关系。
第二阶段,同一组参数被微调到问答、文本蕴含、相似度和分类等有标签任务。语言模型由此不再只是一个等待外部评分的成品,它变成了进入其他任务以前的起点。
[024]
引用 [024]
支撑条件语言模型预训练与多任务微调;token 的最小口播解释不声称固定切分方式,也不把该论文写成当前 LLM 全部训练流程。
PDF pp. 2-4 §§3-4.1: conditional language-model objective, Transformer decoder, stochastic gradient descent and supervised fine-tuning
同一份预测误差,到这里又换了一次工作。一九五一年,它帮助估计英语熵;一九九二年,它评价统计模型;二〇〇三年,它改变词表示和网络参数;二〇一八年,它先塑造一套能被迁往多个任务的起始参数。
这条变化看上去连贯,却不是一条每篇论文都直接引用上一篇的发明链。二〇一八年的论文没有直接引用 Shannon,也没有直接引用 Bengio 二〇〇三。条件语言模型、分布式表示、Transformer 和迁移学习,是在更大的领域里汇流到一起。
本期只需要停在责任变化上。GPT-1 的完整前驱、同期路线和四位作者怎样走到这里,留给这个系列最后一集展开。
[025]
引用 [025]
四阶段责任转移是有来源边界的编辑综合;论文之间不存在本文可证明的逐篇直接引用链,也不取代 Episode 020 的完整 GPT-1 谱系。
- C. E. Shannon,BSTJ 扫描 PDF
- Peter F. Brown 等, An Estimate of an Upper Bound for the Entropy of English
- Yoshua Bengio / Réjean Ducharme / Pascal Vincent / Christian Jauvin, A Neural Probabilistic Language Model
- Alec Radford / Karthik Narasimhan / Tim Salimans / Ilya Sutskever, Improving Language Understanding by Generative Pre-Training
Shannon printed pp. 54-64; Brown printed pp. 31-33; Bengio printed pp. 1139-1150; 2018 paper PDF pp. 1-4
第八章:下一 token 之后,还有一整套系统
19:17二〇二三年的 GPT-4 技术报告,仍然把预训练描述为:根据一份文档已经出现的上文,预测下一个 token。完成预训练以后,模型又使用人类反馈强化学习继续调整。
这里能看见 Shannon 问题的回声:给定过去,下一符号的概率怎样变化。但报告同时划出一大片不可见区域。它没有公开模型规模、硬件、训练算力、数据构造,以及更多训练细节。
所以“下一 token”能够说明一项训练入口,不能单独解释用户在聊天窗口里看到的全部行为。报告没有说出的部分,节目也不能用一个熟悉的历史故事替它补齐。
[026]
引用 [026]
支撑 Transformer-style next-token pretraining、RLHF 和未披露范围;只代表 GPT-4 报告自述,不代表全部 LLM 或未公开机制。
PDF pp. 1-2, Abstract and §2 Scope and Limitations
二〇二五年的 Qwen3 报告,提供了另一个披露更多的实例。它列出十五万一千六百六十九个 token 的词表,大约三十六万亿个训练 token,覆盖一百一十九种语言和方言。
规模之外,更重要的是阶段。报告把预训练分成三段,之后又安排四个后训练阶段,包括冷启动微调、推理强化学习、模式融合和通用强化学习。
这不代表所有大语言模型都按同一张流程图工作。它只让一件事变得无法忽略:用户最终接触到的系统,不是把下一 token 目标原样放大以后自然掉出来的成品。
[027]
引用 [027]
支撑 151,669 词表、36T tokens、119 languages / dialects、三阶段预训练与四阶段后训练;Qwen3 只是具体实例,thinking mode 名称不证明人类式思维。
Qwen3 PDF pp. 1-4 and 9-11 §§2-4; OpenAlex metadata for report identity and date
从字符到 token,候选单位变了;从几百个实验样本到数十万亿 token,数据尺度变了;从人类受试者到带有大量参数的模型,预测者也变了。更深的一层变化,是误差开始修改参数,参数又经过后训练,被重新拉向任务、偏好和部署约束。
因此,把今天的聊天模型叫作“巨型猜字机”,既抓住了一点,也漏掉了太多。它抓住了条件预测这个共同入口;它漏掉了表示、架构、优化、规模、后训练和生成过程共同塑造系统的事实。
共同问题可以帮助我们比较,不会自动证明机制相同。预测做得好,更不会自动证明模型已经理解自己生成的文字。
[028]
引用 [028]
支撑 1951 测量与当前预训练 / 后训练实例的差异;巨型猜字机是有明确失效边界的编辑比较,不证明直接继承、机制同一或理解。
- C. E. Shannon,BSTJ 扫描 PDF
- OpenAI, GPT-4 Technical Report, 2023;本地快照为 arXiv v6, 2024-03-04
- Qwen Team, Qwen3 Technical Report,模型方一手技术报告
Shannon printed pp. 54-64; GPT-4 PDF pp. 1-2; Qwen3 PDF pp. 1-4 and 9-11
尾声:如果 Shannon 坐到今天的聊天窗口前
21:26Claude Shannon 没有留下对大语言模型的评论。我们不能替他写一段第一人称独白,也不能让一九八二年的回忆回答四十多年后才出现的问题。
能够确定的,是他会认出问题的外形。给定已经出现的符号,下一符号有多意外?上下文增加以后,概率怎样集中?预测错了,误差又被拿去做什么?
这些问题来自他真实发表的工作。它们允许我们把一九五一年的字符实验和今天的 token 预测放在同一张比较桌上,却不允许我们宣布他已经预见 Transformer、梯度下降或人类反馈强化学习。
[029]
引用 [029]
来源支持可比较的问题与当代事实,不存在 Shannon 对 LLM 的实际评论;反事实必须保持第三人称条件语气。
- C. E. Shannon,完整校订重印 PDF
- C. E. Shannon,BSTJ 扫描 PDF
- OpenAI, GPT-4 Technical Report, 2023;本地快照为 arXiv v6, 2024-03-04
- Qwen Team, Qwen3 Technical Report,模型方一手技术报告
1948 reprint pp. 1 and 6-11; 1951 printed pp. 50-64; GPT-4 pp. 1-2; Qwen3 pp. 1-4 and 9-11
从 Shannon 已经展示的方法,我们可以更有把握地推断一组追问。他会先问 token 怎样定义,概率从哪里来,误差怎样计算,样本是否覆盖了你准备下结论的文本;他会区分一个成功的工程预测器,和一套关于语义、理解或意识的理论。
这种推断不是在猜他的喜好。它来自一九四八年的主动边界:语义没有被否认,只是没有被通信模型解释。模型若在自己的边界内成功,也不会自动获得边界之外的结论。
同样,模型能写出流畅答案是一项需要解释的工程事实。把它直接叫作理解,或者因为训练目标是预测就把它直接叫作不理解,都比证据多走了一步。
[030]
引用 [030]
支撑 Shannon 方法与语义边界的强推论;关于 LLM 的具体问题仍是节目条件推论,不是历史人物原话。
- C. E. Shannon,完整校订重印 PDF
- Robert G. Gallager, Claude E. Shannon: a retrospective on his life, work, and impact
1948 reprint p. 1 Introduction; Gallager printed pp. 2692-2695 on problem choice, simplification and toy models
更弱一些的推论,只能带着“可能”。Shannon 可能会对规模感兴趣:从二十七个字符、数百个样本,到十五万级词表和数十万亿 token,同一种概率问题获得了他当时无法使用的计算条件。
他可能会把大语言模型先看作一种极强的语言来源模型或预测器,再去测量不同体裁、不同上下文里的交叉熵、校准和错误分布。他也可能把预训练与后训练拆成两项问题:前者拟合文本,后者把任务、偏好和部署条件带进系统。
这些说法之所以只能是“可能”,不是因为它们听上去不合理,而是因为 Shannon 没有真的面对过这些系统。方法上的相似,不能替代历史人物的实际判断。
[031]
引用 [031]
规模、预测器和预训练 / 后训练分层由来源支撑;Shannon 会感兴趣或会怎样研究只属于中等强度条件推论。
- C. E. Shannon,BSTJ 扫描 PDF
- OpenAI, GPT-4 Technical Report, 2023;本地快照为 arXiv v6, 2024-03-04
- Qwen Team, Qwen3 Technical Report,模型方一手技术报告
1951 printed pp. 54-64; GPT-4 pp. 1-2; Qwen3 pp. 1-4 and 9-11
一九五六年,信息论已经被带向许多领域。Shannon 专门写了一篇很短的提醒:不能只把“信息”“熵”“冗余”换进另一个学科的句子,就以为问题已经解决。跨出原模型,需要重新建立假设,再用实验检验。
这也许是他留给今天最及时的边界。把“信息”换成“智能”,把报告里的“思考模式”换成人类的思考,都不会因为名称相同就得到同一种机制。
一九三六年的 MIT,Shannon 在复杂继电器里找到开与关的关系。今天的聊天窗口,每生成一步,也要在许多 token 之间作出一次概率选择。数学让两者都可以被描述;中间近九十年的研究,让预测误差从测量进入评分、参数和预训练。
而那个没有被概率自动回答的问题仍然在场:一次选择可以被计算,不等于选择背后的意义已经被解释。
[032]
引用 [032]
支撑 Shannon 的跨域自限、开关人物回收和当前模型命名边界;最终意义判断是建立在已标注事实上的节目收束,不是 Shannon 对 LLM 的原话。
- C. E. Shannon,IEEE 原页 PDF
- Robert G. Gallager, Claude E. Shannon: a retrospective on his life, work, and impact
- OpenAI, GPT-4 Technical Report, 2023;本地快照为 arXiv v6, 2024-03-04
- Qwen Team, Qwen3 Technical Report,模型方一手技术报告
Bandwagon p. 3; Gallager pp. 2681-2682; GPT-4 pp. 1-2; Qwen3 pp. 1-4 and 9-11
独立片尾:单集识别与系列说明
24:35你刚刚收听的是《原代码》第十三期,《信息熵:Claude Shannon 与下一个字母》。
本期也是《原代码》系列《大语言模型前史》的第三期。
系列副标题是,从图灵、冯·诺依曼到 GPT-1。
这个系列关心的不是一条注定抵达今天的发明直线,而是一代代研究者怎样把关于机器与语言的大问题,拆成计算、记忆、概率、知识、学习和预测这些可以动手解决的问题。
本期追踪的是预测误差怎样从测量语言,变成评价模型、修改表示和预训练参数的入口。下一期会把其中一项动作放大:一台机器怎样根据错误,改变连接的权重。
欢迎订阅《原代码》,继续收听《大语言模型前史》的后续更新。