LLM 工程很快会变成容量规划问题。纸面上看似合理的模型,可能因为权重显存、KV Cache、上下文长度、batch size、量化格式和运行时开销超出目标加速器而无法部署。这个合集把早期推理规划和底层解释所需的本地工具放在一起。
可以先用 LLM / NPU 显存估算器计算权重和 KV Cache 压力,再用 FP/量化可视化器解释低精度格式如何改变可表示数值。如果工作涉及硬件寄存器、位段、时钟计划或时序说明,相关硬件工具也能接入同一个本地流程。
这些页面故意保持轻量:不上传模型名称、私有 benchmark 记录或加速器细节。它们最适合在完整压测前使用:先探索假设,把结果复制到规划笔记,再用真实运行时栈验证。
页面内容也尽量避开空泛热词,而是解释搜索用户真正关心的问题:应该先打开哪个计算器,KV Cache 为什么和权重显存不同,量化可视化如何对应部署取舍。这样的内容厚度有助于让合集成为容量讨论时会反复打开的参考页。