EP.013 / EVIDENCE

信息熵:Claude Shannon 与下一个字母证据关系

逐字稿主张、关系类型与来源之间的双向公开映射。

C-013-001

支持

Gallager 的后见同行回顾支撑人物位置和研究动作;不能据此把 differential analyzer 或 Boolean switching 写成信息论、语言模型或 LLM 的直接起源。

定位:printed pp. 2681-2682: Michigan electrical-engineering / mathematics degrees, MIT differential analyzer and Boolean switching work

C-013-002

背景

来源共同支撑论文身份与 Gallager 对 Shannon 研究方式的后见概括;正文把两者编辑为人物动作,不声称 switching research 直接导致 1948 理论。

定位:MIT DSpace metadata fields for A symbolic analysis of relay and switching circuits, 1940; Gallager printed pp. 2681-2682 and 2692-2695

C-013-003

支持

支撑通信问题环境、论文明确前驱与致谢、以及消息选择的工程表述;Nyquist / Hartley 当前正文不足,不能扩写私下影响或共同机制。

定位:Gallager printed pp. 2682-2684; 1948 corrected reprint p. 1 Introduction and p. 51 Acknowledgments; Nyquist / Hartley publication metadata

C-013-004

背景

支撑语义边界、选择概率和以二为底的信息量;请求链只解释主动缩小模型的动作,不能把软件机制与通信数学等同。

定位:reprint p. 1 Introduction and pp. 10-11 §6

C-013-005

纠正

支撑熵作为给定概率分布下平均不确定性的最小解释;正文明确排除日常混乱、意义、质量和理解等替换。

定位:reprint pp. 1 and 10-11, Introduction and §6

C-013-006

支持

支撑从等概率字符到字符 / 词转移的有限阶英文近似;样本外形不能证明意义、语法完备或现代神经语言模型已经出现。

定位:reprint pp. 6-7 §3: six English approximations over 26 letters plus space

C-013-007

背景

支撑查书生成动作;筛子类比只解释条件压窄候选,正文明确排除参数学习、长距离上下文和现代语言模型等同。

定位:reprint p. 8 §3 ending: book-based construction for second-order and related approximations

C-013-008

支持

支撑有限阶近似随阶数增长而劳动膨胀;正文把它编辑为长上下文测量压力,不声称 Shannon 当时提出神经表示或预见后续路线。

定位:reprint pp. 7-8 §3, especially the labor required for higher-order approximations

C-013-009

支持

支撑 Weaver 的问题位置、对 Shannon 通信理论的直接点名,以及统计 / 密码分析 / 上下文进入翻译议程;不证明当时已有可运行系统。

定位:PDF pp. 1-5 and 8-11, especially §§5 and 7

C-013-010

背景

支撑 micro-context 对词义歧义的研究设想;代码补全类比只解释上下文压窄候选,不能把翻译、类型系统或语义机制等同。

定位:PDF pp. 8-9 §5: micro-context and probability of selecting the intended meaning

C-013-011

纠正

支撑备忘录作为带自限的研究倡议;不能据此说 Shannon 参与机器翻译项目、密码破解已经提供完整翻译机制或系统已经运行。

定位:PDF pp. 1-11, including Weaver's repeated tentative / naive framing and the research-proposal character of the memorandum

C-013-012

支持

支撑遮住、猜测、揭示和保留前文的实验动作;正文保留 the subject 未具名边界,不把实验改写成机器训练。

定位:printed pp. 54-55 §3: first prediction experiment, revealed context and 27-symbol alphabet

C-013-013

支持

支撑多次猜测过程和 102 符号样本分布;该样本不能推广为全部英语、体裁、语言或读者的固定准确率。

定位:printed pp. 55-56, repeated-guess procedure and sample (9)

C-013-014

背景

支撑从猜中名次到熵边界的机制;搜索排名类比只解释名次不等于完整概率,不能替代论文证明或把受试者等同算法。

定位:printed pp. 54-64 §§3-6: prediction ranks, ideal predictor and entropy bounds

C-013-015

支持

支撑 N=100 的约 0.6-1.3 bits/character、约 1 bit/character、约 75 percent redundancy 及采样 / 预测者限制;不能表述为精确普遍定律。

定位:printed pp. 50-51 Introduction, pp. 57-58 Table I, and p. 64 §6

C-013-016

纠正

支撑 Mary E. Shannon / B. M. Oliver 的实验帮助、建议和理论批评,以及实验只记录人类预测;不能分配具体受试者、样本或公式作者身份。

定位:printed p. 64 Acknowledgment and pp. 54-58 experiment sections

C-013-017

支持

支撑 IBM 作者组直接从 Shannon 1951 起算及其规模化测量问题;不把整个 IBM / Jelinek 语言模型史归给五位作者。

定位:printed pp. 31-33, Abstract and Introduction; ACL metadata for authorship and publication identity

C-013-018

支持

支撑训练 / 测试规模、词三元模型、交叉熵和 1.75 上界;不能把上界说成英语熵精确值或全部统计语言模型质量。

定位:printed pp. 31-33 and following model / results sections: 583M-word training text, word trigram model, 5.96M-character Brown Corpus and 1.75 bits/character upper bound

C-013-019

背景

三个来源共同支撑误差用途变化和 n-gram 稀疏压力;这是编辑比较,不证明三个团队形成直接合作或单线引用链。

定位:Shannon printed pp. 54-64; Brown printed pp. 31-33; Bengio printed pp. 1137-1140 on n-gram dimensionality pressure

C-013-020

支持

支撑维度灾难、未见组合和分布式表示选择;不把词向量、神经语言模型或全部贡献归给单一作者。

定位:printed pp. 1137-1140, Abstract and Introduction; JMLR metadata for title and four-author identity

C-013-021

背景

支撑连续词表示、相似词泛化和神经条件概率;地图类比明确排除人类式理解、固定语义和跨模型不变坐标。

定位:printed pp. 1139-1141: distributed word representations and neural conditional next-word probability

C-013-022

支持

支撑预测损失更新表示与网络参数、以及方法 / 指标继承;论文未直接引用 Shannon,不能写成直接影响或单人发明。

定位:printed pp. 1139-1141 and 1144-1150: likelihood objective, joint parameter learning, perplexity and n-gram / Jelinek-Mercer / Brown comparisons

C-013-023

支持

支撑四位作者、问题压力和两阶段路线;GPT-1 是后见名称,不能改写论文原题或压成单作者故事。

定位:PDF pp. 1-3, Abstract and Introduction: unlabeled text, costly labeled data, two-stage generative pre-training and task adaptation

C-013-024

支持

支撑条件语言模型预训练与多任务微调;token 的最小口播解释不声称固定切分方式,也不把该论文写成当前 LLM 全部训练流程。

定位:PDF pp. 2-4 §§3-4.1: conditional language-model objective, Transformer decoder, stochastic gradient descent and supervised fine-tuning

C-013-025

背景

四阶段责任转移是有来源边界的编辑综合;论文之间不存在本文可证明的逐篇直接引用链,也不取代 Episode 020 的完整 GPT-1 谱系。

定位:Shannon printed pp. 54-64; Brown printed pp. 31-33; Bengio printed pp. 1139-1150; 2018 paper PDF pp. 1-4

C-013-026

支持

支撑 Transformer-style next-token pretraining、RLHF 和未披露范围;只代表 GPT-4 报告自述,不代表全部 LLM 或未公开机制。

定位:PDF pp. 1-2, Abstract and §2 Scope and Limitations

C-013-027

支持

支撑 151,669 词表、36T tokens、119 languages / dialects、三阶段预训练与四阶段后训练;Qwen3 只是具体实例,thinking mode 名称不证明人类式思维。

定位:Qwen3 PDF pp. 1-4 and 9-11 §§2-4; OpenAlex metadata for report identity and date

C-013-028

背景

支撑 1951 测量与当前预训练 / 后训练实例的差异;巨型猜字机是有明确失效边界的编辑比较,不证明直接继承、机制同一或理解。

定位:Shannon printed pp. 54-64; GPT-4 PDF pp. 1-2; Qwen3 PDF pp. 1-4 and 9-11

C-013-029

纠正

来源支持可比较的问题与当代事实,不存在 Shannon 对 LLM 的实际评论;反事实必须保持第三人称条件语气。

定位:1948 reprint pp. 1 and 6-11; 1951 printed pp. 50-64; GPT-4 pp. 1-2; Qwen3 pp. 1-4 and 9-11

C-013-030

背景

支撑 Shannon 方法与语义边界的强推论;关于 LLM 的具体问题仍是节目条件推论,不是历史人物原话。

定位:1948 reprint p. 1 Introduction; Gallager printed pp. 2692-2695 on problem choice, simplification and toy models

C-013-031

对照

规模、预测器和预训练 / 后训练分层由来源支撑;Shannon 会感兴趣或会怎样研究只属于中等强度条件推论。

定位:1951 printed pp. 54-64; GPT-4 pp. 1-2; Qwen3 pp. 1-4 and 9-11

C-013-032

背景

支撑 Shannon 的跨域自限、开关人物回收和当前模型命名边界;最终意义判断是建立在已标注事实上的节目收束,不是 Shannon 对 LLM 的原话。

定位:Bandwagon p. 3; Gallager pp. 2681-2682; GPT-4 pp. 1-2; Qwen3 pp. 1-4 and 9-11

全部来源

16 SOURCES

建立 Shannon 的人物位置、工程 / 数学双重训练、Boolean switching、Bell Labs / cryptography 背景,以及后见研究风格与影响评价;边界:2001 同行回顾不是 Shannon 自传;invented、genius 等评价须归给 Gallager,不替代团队与前驱证据

Robert G. Gallager / 日期未知 / original-file

固定 Shannon 的 MIT 硕士论文身份、题名、导师和机构权利说明;边界:当前只保存元数据,不使用论文机制细节;不能证明 Vannevar Bush 对信息论的直接影响

MIT DSpace / 日期未知 / original-file

固定工程问题与语义边界、离散来源、有限阶英文近似、查书生成过程、熵定义和协作致谢;边界:Reprinted with corrections,不是 1948 期刊原页字形;不能从相似动作推出现代语言模型继承

C. E. Shannon / 日期未知 / original-file

固定 Shannon 1948 引言所指 Nyquist 论文身份;边界:只有元数据和 Shannon 的明确致谢,不扩写直接影响细节

Crossref / 日期未知 / original-file

固定 Shannon 1948 引言和 1982 回忆所指 Hartley 论文的出版身份;边界:当前没有 Hartley 正文快照,不使用精确引语或把全部 Shannon 机制归给 Hartley

Crossref / 日期未知 / original-file

直接证明 Shannon 1948 理论如何在次年被 Weaver 引入机器翻译设想,并把上下文、统计、密码分析与可容忍错误连接起来;边界:Weaver 明称想法可能 naive;备忘录是研究倡议,不证明当时已有可工作的统计机器翻译系统,也不证明 Shannon 参与该项目

Warren Weaver / 日期未知 / original-file

固定逐字符预测流程、27 符号字母表、样本、猜测次数、上下界、误差与 Mary E. Shannon / B. M. Oliver 致谢;边界:正文只写 the subject,不能据此给受试者具名;实验结果绑定样本、体裁、人类预测和估计方法

C. E. Shannon / 日期未知 / original-file

直接回到 Shannon 1951 问题:用 583M-word 训练文本、word trigram model 与 5.96M-character Brown Corpus,通过 cross-entropy 给出 1.75 bits / character 上界;明确对照过去人类实验;边界:上界是该模型与样本的结果,不是英语熵精确值;不能代表全部 IBM 语言模型史或全部 Jelinek 团队贡献

Peter F. Brown 等 / 日期未知 / original-file

固定神经概率语言模型怎样同时学习词向量与条件概率,用分布式表示跨相似词组合泛化,并以 perplexity 比较 n-gram;边界:论文没有直接引用 Shannon 1948 / 1951;只能说它接续统计语言模型问题、指标与 Jelinek / Brown 路线,不能写成 Shannon 直接影响作者

Yoshua Bengio / Réjean Ducharme / Pascal Vincent / Christian Jauvin / 日期未知 / original-file

固定后来被称为 GPT-1 的两阶段路线:先以条件语言模型目标和 Transformer decoder 在连续无标签文本上学习参数,再用有标签任务微调;BooksCorpus 与 long-range context 只按论文口径使用;边界:标题没有 GPT-1;论文没有直接引用 Shannon 或 Bengio 2003,不得写成单作者或单线继承,也不代表当前 LLM 的完整后训练

Alec Radford / Karthik Narasimhan / Tim Salimans / Ilya Sutskever / 日期未知 / original-file

固定一种 2025 开放模型的具体复杂度:dense / MoE、151,669 词表、36T tokens / 119 languages and dialects、三阶段预训练,以及包含冷启动微调、reasoning RL、thinking-mode fusion、general RL 的四阶段后训练;边界:不把 Qwen3 当成全部当前 LLM;不使用模型方 benchmark 比较证明普遍优越,也不把 thinking 标签等同人类思维过程

Qwen Team / 日期未知 / original-file

Shannon 本人警告信息论不是跨领域万能钥匙,跨域应用需要假设与实验验证;边界:不能据此否认信息论在语言学、心理学或机器学习中的后来成果

C. E. Shannon / 日期未知 / original-file