EP.012 / EVIDENCE

“冯·诺依曼架构”:从 EDVAC 到大语言模型证据关系

逐字稿主张、关系类型与来源之间的双向公开映射。

C-012-001

支持

冷开场只保留计算阵列、权重、中间结果与等待,不展开内部队列和存储器名称。

定位:PDF pp. 3-5 and §4: systolic matrix unit, weight / activation paths and weight stalls

C-012-002

背景

线程池类比只解释共同依赖未到,正文立即排除服务器与芯片机制等同。

定位:PDF pp. 4-5 and §4: matrix unit waits when required input or weight data is unavailable

C-012-003

支持

保留 ENIAC 有程序控制方式的边界,剧场类比只解释换题劳动。

定位:progress report scan pp. 2-3; First Draft §§1.1-2.9 on electronic speed, organs and automatic control

C-012-004

支持

同段固定团队贡献与存储指令动作,剧本类比明确排除理解语义。

定位:progress report scan pp. 2-5; First Draft §§2.2-2.9 and §§15.1-15.6

C-012-005

背景

用程序、状态、控制与执行重述最小动作,不口播原始字母缩写或位格式。

定位:First Draft §§2.2-2.8 and §§15.1-15.6; IAS report §§1.2-1.4

C-012-006

纠正
corrects

后见名称只承担关系框架,明确拒绝单人发明和统一物理蓝图。

定位:First Draft title page and §§15.1-15.6; progress report scan pp. 2-5; IAS report title / Preface; Haigh / Priestley / Rope pp. 4-13

C-012-007

支持
supports

门锁是编辑场景,程序与数据分路只绑定具体微控制器手册。

定位:Microchip PDF p. 28, §6.3 and pp. 39-40, §§7.1-7.5; Haigh / Priestley / Rope pp. 9-13

C-012-008

背景
context

购物请求是编辑场景;明确排除巨型中央处理器和统一指令流。

定位:PDF pp. 22-24, printed pp. 2-4, §§1.1-1.3: interacting programs, thousands of nodes, network, storage and warehouse-scale design

C-012-009

纠正

组织是有边界的编辑类比,不把层级等同正式权威,也不推出管理定律。

定位:Simon scan p. 2 / printed p. 468 and scan p. 10 / printed p. 476; Barroso et al. PDF p. 22

C-012-010

背景

综合段只收束关系观察法,不声称三个尺度共享同一物理架构。

定位:Haigh / Priestley / Rope pp. 9-13; Microchip PDF p. 28; Barroso et al. pp. 22-24; Simon printed pp. 468 and 476

C-012-011

背景

投递类比统一解释数字指令、符号名字和较高层目标,并排除语言等级表。

定位:Backus et al. PDF p. 11 / printed p. 197 compares machine language, assembly program language and FORTRAN; Ritchie PDF pp. 2-3

C-012-012

背景

路线规划是有边界类比;编译器能力只绑定已表达约束,不承诺普遍最优。

定位:PDF p. 1 / printed p. 188 on project goals; PDF p. 11 / printed p. 197 on coding effort, output and translation

C-012-013

支持

开发与性能结果严格绑定早期具体机器和样例,不外推为所有高级语言。

定位:PDF p. 1 / printed p. 188 on goals and case history; PDF p. 11 / printed p. 197 on conciseness, coding time and output length

C-012-014

支持

C 只作为历史平衡案例,不获得跨场景永久性能优先权。

定位:PDF pp. 2-3 on assembler, writing ease and machine-grounded abstractions; p. 14 on efficiency, abstraction and portability

C-012-015

支持

仓库作业区解释任务分组、近处共享、同步和设备交接,并排除工人自主性。

定位:PDF p. 23, chapter 3; pp. 33-34, §§5.3-5.4; pp. 39-40, §6.2.2

C-012-016

背景

控制权与复杂度的交换是证据约束下综合,不声称显式控制必然更快。

定位:PDF pp. 23 and 33-40: heterogeneous execution, work grouping, synchronization, data transfer and memory hierarchy

C-012-017

支持

表格分块解释算法结构与机器映射分工,明确开发者仍需选择正确分块。

定位:PDF pp. 1-2, Abstract / §1 on expert kernels, portability and tile abstraction

C-012-018

纠正

语言演进收束为劳动边界移动,不建立抽象层级或普遍性能排名。

定位:FORTRAN PDF pp. 1 and 11; Ritchie PDF pp. 2-3 and 14; CUDA guide pp. 23 and 33-40; Triton PDF pp. 1-2 and 8

C-012-019

支持

工作台类比解释近处留存、命中与远处仍存在,不展开替换算法。

定位:printed pp. 270-271, Summary / Introduction and instruction / large slave-memory schemes

C-012-020

背景

明确硬件缓存、工作台和应用缓存机制不同,只保留近处复用动作。

定位:Wilkes printed pp. 270-271; Kilburn printed pp. 223-226 on automatic transfers behind a one-level view

C-012-021

支持

流水线解释沿途计算与复用,并以规则任务边界限制适用范围。

定位:printed pp. 37-40: balancing computation with I/O, rhythmic data flow through arrays and multiple computations per memory access

C-012-022

背景

综合近处留存与沿途复用,明确容量、通用性和软件复杂度代价。

定位:Wilkes printed pp. 270-271; Kung printed pp. 37-40; Hennessy / Patterson PDF pp. 6-10

C-012-023

支持

回收规则阵列、数据复用和权重等待,不口播内部部件英文名。

定位:TPU PDF pp. 3-10, especially §4; Kung printed pp. 37-40

C-012-024

背景

服务类比只保留容量与共同供给的诊断顺序,不等同具体机制。

定位:PDF §4, especially pp. 6-10: operations per weight byte, weight stalls and bandwidth / clock sensitivity by workload

C-012-025

支持

数据库执行计划类比解释计算重排与减少往返,明确算法和结果边界。

定位:PDF pp. 1-4, Abstract / Figure 1 / §2.1: IO awareness, tiling, exact attention and reduced HBM-SRAM reads / writes

C-012-026

支持

配置与会话类比均紧邻数值直接参与计算、规模和用途边界。

定位:PDF pp. 1-3: autoregressive dependency, weights / KV cache in HBM and stage-dependent memory costs

C-012-027

背景
context

三步路线是证据约束下的工程综合,不给出普遍语言或硬件性能排名。

定位:Language and AI sources at the locators recorded in C-012-V6-013 through C-012-V6-018 and C-012-V6-023 through C-012-V6-025

C-012-028

背景
context

结尾只收束三条主张,明确排除 EDVAC 到大语言模型的直接因果。

定位:First Draft §§2.2-2.8 and §§15.1-15.6; later architecture, language and AI sources at the separately bounded locators above

全部来源

18 SOURCES

固定 TPU v1 由 host 发命令、从 off-chip weight memory 取权重,systolic matrix unit 通过数据复用降低访问能耗,并有 memory-bandwidth-bound 工作负载;不能写成独立通用计算机或全部 AI 都计算受限;定位:PDF pp. 1-5,Weight FIFO / Unified Buffer、systolic matrix unit;§4 roofline

Norman P. Jouppi 等 / 日期未知 / original-file

固定 von Neumann 加入前的磁存储和 instructions / function tables 方案;同时固定他参与 logical control、提出 instruction codes、用具体问题测试并写出总结 earlier discussions 的报告;定位:scan pp. 2-6;尤见 scan p. 2 的 January 1944 disclosure 与共同 memory,p. 3 的 discussions / von Neumann 动作,p. 5 的 instructions / numbers 同样存储

J. Presper Eckert / John W. Mauchly / 日期未知 / original-file

固定标题页唯一可见作者名、合同、机构、日期,以及 CA / CC / M / I / O、memory、number / order 与 control 的文本;标题页不能证明单人贡献;定位:PDF scan title page;printed pp. 1-4, §§1.1-2.9;printed pp. 39-43, §§15.1-15.6

John von Neumann / 日期未知 / original-file

固定该微控制器用程序与数据分离的总线、从程序存储器预取指令,并把程序闪存、数据静态存储器、数据 EEPROM 与外设寄存器分区;只能证明一种具体嵌入式实现,不能推广成全部嵌入式设备都采用同一布局;定位:PDF p. 28, §6.3;pp. 39-40, §§7.1-7.5

Microchip Technology / 日期未知 / original-file

固定仓库级计算中一个互联网服务由多个程序协作、运行在数百到数千台服务器组成的集群,并由共同软硬件与管理层协同;“把数据中心当作计算机”是系统设计视角,不等于所有服务器共享一条指令流或一个中央控制器;定位:PDF pp. 22-24, printed pp. 2-4,§§1.1-1.3

Luiz Andre Barroso / Urs Holzle / Parthasarathy Ranganathan / 日期未知 / original-file

固定 hierarchy 可指由相互关联子系统构成的复杂系统,不限于正式上下级;也固定人类信息处理和同时互动能力有边界。节目只借此限制组织类比,不把公司结构写成计算机硬件或可由同一架构定律推出;定位:scan p. 2, printed p. 468;scan p. 10, printed p. 476

Herbert A. Simon / 日期未知 / original-file

固定项目目标是减少问题准备、编码与调试劳动,同时自动产生高效的 704 程序;论文报告的短代码、时间和与手工代码长度比较只属于早期样本,不能推广为所有高级语言都与手写底层代码等速;定位:PDF p. 1, printed p. 188;PDF p. 11, printed p. 197

John Backus 等 / 日期未知 / original-file

固定早期 Unix 从汇编走向更高层系统语言的开发便利、C 抽象可落到真实机器操作且可移植,以及它“足够高效以替代汇编、又足够抽象”的历史判断;不能把 C 写成无损硬件映射或永远最快的语言;定位:PDF pp. 2-3;p. 14

Dennis M. Ritchie / 日期未知 / original-file

固定编程模型向程序员暴露线程分组、共享存储与同步,并要求处理主机 / 设备分工及数据传送;统一存储可简化管理但不取消物理层级和性能差异;定位:PDF p. 23, chapter 3;pp. 33-34, §§5.3-5.4;pp. 39-40, §6.2.2

NVIDIA / 日期未知 / original-file

固定手写微内核劳动大且可移植性差,Triton 以数据块为抽象并由编译器生成图形处理器代码;论文只在列出的矩阵和卷积实验中报告与厂商库相当的性能,不能推广成自动优于所有手写程序;定位:PDF pp. 1-2, Abstract / §1;p. 8, §§6-7

Philippe Tillet / H. T. Kung / David Cox / 日期未知 / original-file

固定高速小 memory 自动保留近期从较慢 main memory 取得内容的层级思想,以及写入一致性和替换需求;不能把 32-word instruction buffer 直接等同今天全部 cache 实现;定位:printed pp. 270-271,summary、Introduction、small / large slave memory

M. V. Wilkes / 日期未知 / original-file

固定规则 processing-element array 让数据在 cell 间脉动并重复使用,以多次计算摊销一次 memory access;同时固定它针对 compute-bound、规则任务并受 I/O / memory size 约束;定位:printed pp. 37-40,尤见 Balancing computation with I/O、Systolic architectures: the basic principle

H. T. Kung / 日期未知 / original-file

固定 ILP、Dennard scaling 结束、multicore 责任转移和 domain-specific architectures 的历史判断;说明 DSA 通过并行、精度和 memory hierarchy 换取效率,不能推广为所有负载收益相同;定位:PDF pp. 6-10,End of Moore's Law and Dennard Scaling、multicore、Domain-Specific Architectures

John L. Hennessy / David A. Patterson / 日期未知 / original-file

固定生成阶段 weights 与 KV cache 的 HBM traffic、prefill / decode 差异和跨芯片 communication;论文中的 3 TB 例子绑定 500B+ model、batch 512、context 2048,不能推广为所有 LLM;定位:PDF pp. 1-5,尤见 p. 3 Memory costs 与 Expected tradeoffs and challenges

Reiner Pope 等 / 日期未知 / original-file