配置与会话类比均紧邻数值直接参与计算、规模和用途边界。
返回逐字稿段落 model-dependenciesSOURCE / pope-transformer-inference-2023
Reiner Pope 等, Efficiently Scaling Transformer Inference, 2023
固定生成阶段 weights 与 KV cache 的 HBM traffic、prefill / decode 差异和跨芯片 communication;论文中的 3 TB 例子绑定 500B+ model、batch 512、context 2048,不能推广为所有 LLM;定位:PDF pp. 1-5,尤见 p. 3 Memory costs 与 Expected tradeoffs and challenges
权利说明
版权声明:原始页面、论文、报告和文字记录的权利归作者、出版方、机构及其他原权利人;《原代码》公开必要的证据快照用于技术评论与核查,保留原始链接。
被引用位置
结尾只收束三条主张,明确排除 EDVAC 到大语言模型的直接因果。
返回逐字稿段落 three-claims-finale