C-012-001
支持冷开场只保留计算阵列、权重、中间结果与等待,不展开内部队列和存储器名称。
冷开场只保留计算阵列、权重、中间结果与等待,不展开内部队列和存储器名称。
线程池类比只解释共同依赖未到,正文立即排除服务器与芯片机制等同。
保留 ENIAC 有程序控制方式的边界,剧场类比只解释换题劳动。
同段固定团队贡献与存储指令动作,剧本类比明确排除理解语义。
用程序、状态、控制与执行重述最小动作,不口播原始字母缩写或位格式。
后见名称只承担关系框架,明确拒绝单人发明和统一物理蓝图。
门锁是编辑场景,程序与数据分路只绑定具体微控制器手册。
购物请求是编辑场景;明确排除巨型中央处理器和统一指令流。
组织是有边界的编辑类比,不把层级等同正式权威,也不推出管理定律。
综合段只收束关系观察法,不声称三个尺度共享同一物理架构。
投递类比统一解释数字指令、符号名字和较高层目标,并排除语言等级表。
路线规划是有边界类比;编译器能力只绑定已表达约束,不承诺普遍最优。
开发与性能结果严格绑定早期具体机器和样例,不外推为所有高级语言。
C 只作为历史平衡案例,不获得跨场景永久性能优先权。
仓库作业区解释任务分组、近处共享、同步和设备交接,并排除工人自主性。
控制权与复杂度的交换是证据约束下综合,不声称显式控制必然更快。
表格分块解释算法结构与机器映射分工,明确开发者仍需选择正确分块。
语言演进收束为劳动边界移动,不建立抽象层级或普遍性能排名。
工作台类比解释近处留存、命中与远处仍存在,不展开替换算法。
明确硬件缓存、工作台和应用缓存机制不同,只保留近处复用动作。
流水线解释沿途计算与复用,并以规则任务边界限制适用范围。
综合近处留存与沿途复用,明确容量、通用性和软件复杂度代价。
回收规则阵列、数据复用和权重等待,不口播内部部件英文名。
服务类比只保留容量与共同供给的诊断顺序,不等同具体机制。
数据库执行计划类比解释计算重排与减少往返,明确算法和结果边界。
配置与会话类比均紧邻数值直接参与计算、规模和用途边界。
John Backus 等, The FORTRAN Automatic Coding System, 1957
Dennis M. Ritchie, The Development of the C Language, 1993
NVIDIA, CUDA C++ Programming Guide, release 12.4, 2024
Norman P. Jouppi 等, In-Datacenter Performance Analysis of a Tensor Processing Unit, 2017
Tri Dao 等, FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness, 2022
三步路线是证据约束下的工程综合,不给出普遍语言或硬件性能排名。
John von Neumann, First Draft of a Report on the EDVAC, 1945-06-30
Thomas Haigh / Mark Priestley / Crispin Rope, Reconsidering the Stored-Program Concept, 2014
John Backus 等, The FORTRAN Automatic Coding System, 1957
Dennis M. Ritchie, The Development of the C Language, 1993
NVIDIA, CUDA C++ Programming Guide, release 12.4, 2024
M. V. Wilkes, Slave Memories and Dynamic Storage Allocation, 1965
H. T. Kung, Why Systolic Architectures?, 1982
Norman P. Jouppi 等, In-Datacenter Performance Analysis of a Tensor Processing Unit, 2017
Tri Dao 等, FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness, 2022
Reiner Pope 等, Efficiently Scaling Transformer Inference, 2023
结尾只收束三条主张,明确排除 EDVAC 到大语言模型的直接因果。
没有符合条件的证据关系。
固定 TPU v1 由 host 发命令、从 off-chip weight memory 取权重,systolic matrix unit 通过数据复用降低访问能耗,并有 memory-bandwidth-bound 工作负载;不能写成独立通用计算机或全部 AI 都计算受限;定位:PDF pp. 1-5,Weight FIFO / Unified Buffer、systolic matrix unit;§4 roofline
固定 von Neumann 加入前的磁存储和 instructions / function tables 方案;同时固定他参与 logical control、提出 instruction codes、用具体问题测试并写出总结 earlier discussions 的报告;定位:scan pp. 2-6;尤见 scan p. 2 的 January 1944 disclosure 与共同 memory,p. 3 的 discussions / von Neumann 动作,p. 5 的 instructions / numbers 同样存储
固定标题页唯一可见作者名、合同、机构、日期,以及 CA / CC / M / I / O、memory、number / order 与 control 的文本;标题页不能证明单人贡献;定位:PDF scan title page;printed pp. 1-4, §§1.1-2.9;printed pp. 39-43, §§15.1-15.6
固定三人署名、general-purpose machine、数字化 orders 与 numbers 共用 memory、Control,以及 IAS design 与 EDVAC delay-line design 的差异;定位:title / Preface to First Edition;printed pp. 1-2, §§1.1-1.6;pp. 4-5, §§4.1-4.4
固定 stored program 术语晚于 First Draft、该词历史含义过载,以及 modern code / architecture / hardware 三组特征;Manchester Baby 与 EDSAC 只作横截面边界;定位:pp. 4-7, 9-13
固定该微控制器用程序与数据分离的总线、从程序存储器预取指令,并把程序闪存、数据静态存储器、数据 EEPROM 与外设寄存器分区;只能证明一种具体嵌入式实现,不能推广成全部嵌入式设备都采用同一布局;定位:PDF p. 28, §6.3;pp. 39-40, §§7.1-7.5
固定仓库级计算中一个互联网服务由多个程序协作、运行在数百到数千台服务器组成的集群,并由共同软硬件与管理层协同;“把数据中心当作计算机”是系统设计视角,不等于所有服务器共享一条指令流或一个中央控制器;定位:PDF pp. 22-24, printed pp. 2-4,§§1.1-1.3
固定 hierarchy 可指由相互关联子系统构成的复杂系统,不限于正式上下级;也固定人类信息处理和同时互动能力有边界。节目只借此限制组织类比,不把公司结构写成计算机硬件或可由同一架构定律推出;定位:scan p. 2, printed p. 468;scan p. 10, printed p. 476
固定项目目标是减少问题准备、编码与调试劳动,同时自动产生高效的 704 程序;论文报告的短代码、时间和与手工代码长度比较只属于早期样本,不能推广为所有高级语言都与手写底层代码等速;定位:PDF p. 1, printed p. 188;PDF p. 11, printed p. 197
固定早期 Unix 从汇编走向更高层系统语言的开发便利、C 抽象可落到真实机器操作且可移植,以及它“足够高效以替代汇编、又足够抽象”的历史判断;不能把 C 写成无损硬件映射或永远最快的语言;定位:PDF pp. 2-3;p. 14
固定编程模型向程序员暴露线程分组、共享存储与同步,并要求处理主机 / 设备分工及数据传送;统一存储可简化管理但不取消物理层级和性能差异;定位:PDF p. 23, chapter 3;pp. 33-34, §§5.3-5.4;pp. 39-40, §6.2.2
固定手写微内核劳动大且可移植性差,Triton 以数据块为抽象并由编译器生成图形处理器代码;论文只在列出的矩阵和卷积实验中报告与厂商库相当的性能,不能推广成自动优于所有手写程序;定位:PDF pp. 1-2, Abstract / §1;p. 8, §§6-7
固定高速小 memory 自动保留近期从较慢 main memory 取得内容的层级思想,以及写入一致性和替换需求;不能把 32-word instruction buffer 直接等同今天全部 cache 实现;定位:printed pp. 270-271,summary、Introduction、small / large slave memory
固定 Atlas 用 core store 与 drum 组成对程序员可见的 one-level store,并自动执行 block transfer;这是 virtual memory 的关键早期实现,不证明 memory hierarchy 被物理消除;定位:printed pp. 223-226,Summary、§§I-III
固定规则 processing-element array 让数据在 cell 间脉动并重复使用,以多次计算摊销一次 memory access;同时固定它针对 compute-bound、规则任务并受 I/O / memory size 约束;定位:printed pp. 37-40,尤见 Balancing computation with I/O、Systolic architectures: the basic principle
固定 ILP、Dennard scaling 结束、multicore 责任转移和 domain-specific architectures 的历史判断;说明 DSA 通过并行、精度和 memory hierarchy 换取效率,不能推广为所有负载收益相同;定位:PDF pp. 6-10,End of Moore's Law and Dennard Scaling、multicore、Domain-Specific Architectures
固定 tiling 减少 HBM 与 on-chip SRAM 之间的 reads / writes,且保持 exact attention;说明较少 FLOPs 不自动等于更短 wall-clock time,不能把算法写成新硬件架构;定位:PDF pp. 1-4,Abstract、Figure 1、§2.1
固定生成阶段 weights 与 KV cache 的 HBM traffic、prefill / decode 差异和跨芯片 communication;论文中的 3 TB 例子绑定 500B+ model、batch 512、context 2048,不能推广为所有 LLM;定位:PDF pp. 1-5,尤见 p. 3 Memory costs 与 Expected tradeoffs and challenges