C-013-001
支持Gallager 的后见同行回顾支撑人物位置和研究动作;不能据此把 differential analyzer 或 Boolean switching 写成信息论、语言模型或 LLM 的直接起源。
Gallager 的后见同行回顾支撑人物位置和研究动作;不能据此把 differential analyzer 或 Boolean switching 写成信息论、语言模型或 LLM 的直接起源。
来源共同支撑论文身份与 Gallager 对 Shannon 研究方式的后见概括;正文把两者编辑为人物动作,不声称 switching research 直接导致 1948 理论。
支撑通信问题环境、论文明确前驱与致谢、以及消息选择的工程表述;Nyquist / Hartley 当前正文不足,不能扩写私下影响或共同机制。
支撑语义边界、选择概率和以二为底的信息量;请求链只解释主动缩小模型的动作,不能把软件机制与通信数学等同。
支撑熵作为给定概率分布下平均不确定性的最小解释;正文明确排除日常混乱、意义、质量和理解等替换。
支撑从等概率字符到字符 / 词转移的有限阶英文近似;样本外形不能证明意义、语法完备或现代神经语言模型已经出现。
支撑查书生成动作;筛子类比只解释条件压窄候选,正文明确排除参数学习、长距离上下文和现代语言模型等同。
支撑有限阶近似随阶数增长而劳动膨胀;正文把它编辑为长上下文测量压力,不声称 Shannon 当时提出神经表示或预见后续路线。
支撑 Weaver 的问题位置、对 Shannon 通信理论的直接点名,以及统计 / 密码分析 / 上下文进入翻译议程;不证明当时已有可运行系统。
支撑 micro-context 对词义歧义的研究设想;代码补全类比只解释上下文压窄候选,不能把翻译、类型系统或语义机制等同。
支撑备忘录作为带自限的研究倡议;不能据此说 Shannon 参与机器翻译项目、密码破解已经提供完整翻译机制或系统已经运行。
支撑遮住、猜测、揭示和保留前文的实验动作;正文保留 the subject 未具名边界,不把实验改写成机器训练。
支撑多次猜测过程和 102 符号样本分布;该样本不能推广为全部英语、体裁、语言或读者的固定准确率。
支撑从猜中名次到熵边界的机制;搜索排名类比只解释名次不等于完整概率,不能替代论文证明或把受试者等同算法。
支撑 N=100 的约 0.6-1.3 bits/character、约 1 bit/character、约 75 percent redundancy 及采样 / 预测者限制;不能表述为精确普遍定律。
支撑 Mary E. Shannon / B. M. Oliver 的实验帮助、建议和理论批评,以及实验只记录人类预测;不能分配具体受试者、样本或公式作者身份。
支撑 IBM 作者组直接从 Shannon 1951 起算及其规模化测量问题;不把整个 IBM / Jelinek 语言模型史归给五位作者。
支撑训练 / 测试规模、词三元模型、交叉熵和 1.75 上界;不能把上界说成英语熵精确值或全部统计语言模型质量。
三个来源共同支撑误差用途变化和 n-gram 稀疏压力;这是编辑比较,不证明三个团队形成直接合作或单线引用链。
支撑维度灾难、未见组合和分布式表示选择;不把词向量、神经语言模型或全部贡献归给单一作者。
支撑连续词表示、相似词泛化和神经条件概率;地图类比明确排除人类式理解、固定语义和跨模型不变坐标。
支撑预测损失更新表示与网络参数、以及方法 / 指标继承;论文未直接引用 Shannon,不能写成直接影响或单人发明。
支撑四位作者、问题压力和两阶段路线;GPT-1 是后见名称,不能改写论文原题或压成单作者故事。
支撑条件语言模型预训练与多任务微调;token 的最小口播解释不声称固定切分方式,也不把该论文写成当前 LLM 全部训练流程。
四阶段责任转移是有来源边界的编辑综合;论文之间不存在本文可证明的逐篇直接引用链,也不取代 Episode 020 的完整 GPT-1 谱系。
支撑 Transformer-style next-token pretraining、RLHF 和未披露范围;只代表 GPT-4 报告自述,不代表全部 LLM 或未公开机制。
支撑 151,669 词表、36T tokens、119 languages / dialects、三阶段预训练与四阶段后训练;Qwen3 只是具体实例,thinking mode 名称不证明人类式思维。
支撑 1951 测量与当前预训练 / 后训练实例的差异;巨型猜字机是有明确失效边界的编辑比较,不证明直接继承、机制同一或理解。
来源支持可比较的问题与当代事实,不存在 Shannon 对 LLM 的实际评论;反事实必须保持第三人称条件语气。
支撑 Shannon 方法与语义边界的强推论;关于 LLM 的具体问题仍是节目条件推论,不是历史人物原话。
规模、预测器和预训练 / 后训练分层由来源支撑;Shannon 会感兴趣或会怎样研究只属于中等强度条件推论。
支撑 Shannon 的跨域自限、开关人物回收和当前模型命名边界;最终意义判断是建立在已标注事实上的节目收束,不是 Shannon 对 LLM 的原话。
没有符合条件的证据关系。
建立 Shannon 的人物位置、工程 / 数学双重训练、Boolean switching、Bell Labs / cryptography 背景,以及后见研究风格与影响评价;边界:2001 同行回顾不是 Shannon 自传;invented、genius 等评价须归给 Gallager,不替代团队与前驱证据
固定 Shannon 的 MIT 硕士论文身份、题名、导师和机构权利说明;边界:当前只保存元数据,不使用论文机制细节;不能证明 Vannevar Bush 对信息论的直接影响
固定工程问题与语义边界、离散来源、有限阶英文近似、查书生成过程、熵定义和协作致谢;边界:Reprinted with corrections,不是 1948 期刊原页字形;不能从相似动作推出现代语言模型继承
固定 Shannon 1948 引言所指 Nyquist 论文身份;边界:只有元数据和 Shannon 的明确致谢,不扩写直接影响细节
固定 Shannon 1948 引言和 1982 回忆所指 Hartley 论文的出版身份;边界:当前没有 Hartley 正文快照,不使用精确引语或把全部 Shannon 机制归给 Hartley
直接证明 Shannon 1948 理论如何在次年被 Weaver 引入机器翻译设想,并把上下文、统计、密码分析与可容忍错误连接起来;边界:Weaver 明称想法可能 naive;备忘录是研究倡议,不证明当时已有可工作的统计机器翻译系统,也不证明 Shannon 参与该项目
固定逐字符预测流程、27 符号字母表、样本、猜测次数、上下界、误差与 Mary E. Shannon / B. M. Oliver 致谢;边界:正文只写 the subject,不能据此给受试者具名;实验结果绑定样本、体裁、人类预测和估计方法
直接回到 Shannon 1951 问题:用 583M-word 训练文本、word trigram model 与 5.96M-character Brown Corpus,通过 cross-entropy 给出 1.75 bits / character 上界;明确对照过去人类实验;边界:上界是该模型与样本的结果,不是英语熵精确值;不能代表全部 IBM 语言模型史或全部 Jelinek 团队贡献
固定论文身份、作者组、期刊与页码;边界:不替代正文或 IBM 团队内部贡献分工
固定神经概率语言模型怎样同时学习词向量与条件概率,用分布式表示跨相似词组合泛化,并以 perplexity 比较 n-gram;边界:论文没有直接引用 Shannon 1948 / 1951;只能说它接续统计语言模型问题、指标与 Jelinek / Brown 路线,不能写成 Shannon 直接影响作者
固定论文身份、作者和摘要;边界:不替代正文或共同作者分工
固定后来被称为 GPT-1 的两阶段路线:先以条件语言模型目标和 Transformer decoder 在连续无标签文本上学习参数,再用有标签任务微调;BooksCorpus 与 long-range context 只按论文口径使用;边界:标题没有 GPT-1;论文没有直接引用 Shannon 或 Bengio 2003,不得写成单作者或单线继承,也不代表当前 LLM 的完整后训练
只固定 GPT-4 是 Transformer-style model、以文档下一 token 预测预训练并经 RLHF 后训练的自述;报告明确不披露模型规模、硬件、训练算力与数据构造细节,不能代表全部 LLM 或证明理解
固定一种 2025 开放模型的具体复杂度:dense / MoE、151,669 词表、36T tokens / 119 languages and dialects、三阶段预训练,以及包含冷启动微调、reasoning RL、thinking-mode fusion、general RL 的四阶段后训练;边界:不把 Qwen3 当成全部当前 LLM;不使用模型方 benchmark 比较证明普遍优越,也不把 thinking 标签等同人类思维过程
固定 Qwen3 报告身份、日期、作者组与公开 PDF 入口;边界:不替代正文,不独立证明模型方性能主张
Shannon 本人警告信息论不是跨领域万能钥匙,跨域应用需要假设与实验验证;边界:不能据此否认信息论在语言学、心理学或机器学习中的后来成果