不上传的推理规划辅助

大模型/推理工程工具合集

隐私优先本地工具箱。

LLM 工程很快会变成容量规划问题。纸面上看似合理的模型,可能因为权重显存、KV Cache、上下文长度、batch size、量化格式和运行时开销超出目标加速器而无法部署。这个合集把早期推理规划和底层解释所需的本地工具放在一起。

可以先用 LLM / NPU 显存估算器计算权重和 KV Cache 压力,再用 FP/量化可视化器解释低精度格式如何改变可表示数值。如果工作涉及硬件寄存器、位段、时钟计划或时序说明,相关硬件工具也能接入同一个本地流程。

这些页面故意保持轻量:不上传模型名称、私有 benchmark 记录或加速器细节。它们最适合在完整压测前使用:先探索假设,把结果复制到规划笔记,再用真实运行时栈验证。

页面内容也尽量避开空泛热词,而是解释搜索用户真正关心的问题:应该先打开哪个计算器,KV Cache 为什么和权重显存不同,量化可视化如何对应部署取舍。这样的内容厚度有助于让合集成为容量讨论时会反复打开的参考页。

本地运行

合集工具

查看更多工具

常见问题

这些工具能精确预测 serving 显存吗?

不能。它们提供规划估算,最终必须用目标运行时验证。

需要上传模型权重吗?

不需要。显存估算器只使用参数量、精度等数字假设。

量化示例和硬件完全一致吗?

它解释常见格式,具体 NPU 行为可能不同。