从 KV Cache 到 AI 内存系统:大模型推理架构的演进

原作者:xieydd · 微信公众号转载页 摘要 这篇文章想回答一个看似分散、其实高度统一的问题:为什么这两年围绕大模型推理的系统创新,越来越不像是在“优化一个神经网络”,反而像是在“设计一个内存系统”? 如果把 2023 年以前的大模型工程叙事概括成“拼 FLOPS、拼 Tensor Core、拼训练吞吐”,那么 2024–2026 年的推理叙事,已经明显转向了另一条主线:KV cache、TTFT/TPOT、continuous batching、prefix …
原作者:xieydd · 微信公众号转载页 摘要 这篇文章想回答一个看似分散、其实高度统一的问题:为什么这两年围绕大模型推理的系统创新,越来越不像是在“优化一个神经网络”,反而像是在“设计一个内存系统”? 如果把 2023 年以前的大模型工程叙事概括成“拼 FLOPS、拼 Tensor Core、拼训练吞吐”,那么 2024–2026 年的推理叙事,已经明显转向了另一条主线:KV cache、TTFT/TPOT、continuous batching、prefix …