本地运行


        

实用指南

LLM / NPU 显存估算器

在真正跑推理、买硬件或切换量化方案之前,先粗估模型配置是否能放进目标显存或片上内存预算。

使用方法

  1. 输入参数量、权重量化精度、batch size、序列长度、层数和隐藏维度。
  2. 查看权重显存、KV Cache、总估算值和粗略计算量输出。
  3. 切换 FP16、INT8、INT4 或修改上下文长度,比较不同配置对内存的影响。
  4. 把结果复制到硬件选型记录、部署 checklist 或测试报告中。

常见场景

  • 判断 7B、13B 模型是否适合本地 NPU、移动端加速器或单卡 GPU。
  • 解释长上下文推理为什么会因为 KV Cache 快速吃掉内存。
  • 在做 benchmark 或采购内存容量前,对比 FP16、INT8、INT4 的估算差异。

本地运行说明

输入只是数字和配置假设,计算完全在当前浏览器内存中完成。工具不会上传模型名称、硬件信息或部署笔记。