SOURCE / pope-transformer-inference-2023

Reiner Pope 等, Efficiently Scaling Transformer Inference, 2023

固定生成阶段 weights 与 KV cache 的 HBM traffic、prefill / decode 差异和跨芯片 communication;论文中的 3 TB 例子绑定 500B+ model、batch 512、context 2048,不能推广为所有 LLM;定位:PDF pp. 1-5,尤见 p. 3 Memory costs 与 Expected tradeoffs and challenges

权利说明

版权声明:原始页面、论文、报告和文字记录的权利归作者、出版方、机构及其他原权利人;《原代码》公开必要的证据快照用于技术评论与核查,保留原始链接。

被引用位置