▲ 6GB 显存运行 64K 上下文:llama.cpp 参数与 KV Cache 调优 NNicksxs's Blog nicksxs.me 2026/05/31 在 RTX 3060 Laptop 6GB 显卡上使用 llama.cpp 运行 9B 量化模型,通过 64K 上下文、Flash Attention、KV Cache 量化和 GPU Offload 参数控制显存占用。… 讨论 登录后参与讨论 还没有评论,来说第一句吧。 Nicksxs's Blog 的其他文章 Pi Agent 1.0 的 MCP 集成源码解析:工具发现、代码编排与提示词压缩 2026/10/04 Qwen-Image 2.1 入门:从一句提示词到一张图,6GB 显存为什么也能跑 2026/09/27 Jev 深度解读与实测:只做判断的 AI,究竟快在哪里 2026/09/20 Pi Agent 源码解析(一):从调试环境到双层主循环 2026/09/13 6GB显存能跑35B MoE吗:FreeToken极限配置、性能压榨与实操教程 2026/09/05
讨论
登录后参与讨论
还没有评论,来说第一句吧。