先说清楚边界。本文只基于 deepseek-v4/DeepSeek_V4.pdf ,不补 PDF 外的传闻,也不把报告里没有展开的内容写成确定结论。 如果只用一句话概括,我会这么说:DeepSeek-V4 要解决的核心问题,不是“参数再大一点”,而是模型真的开始跑超长上下文、长链路推理和复杂工具调用时,传统 attention 的成本会先撑不住。V4 的很多改动,最后都指向同一个问题: 1M co…
先说清楚边界。本文只基于 deepseek-v4/DeepSeek_V4.pdf ,不补 PDF 外的传闻,也不把报告里没有展开的内容写成确定结论。 如果只用一句话概括,我会这么说:DeepSeek-V4 要解决的核心问题,不是“参数再大一点”,而是模型真的开始跑超长上下文、长链路推理和复杂工具调用时,传统 attention 的成本会先撑不住。V4 的很多改动,最后都指向同一个问题: 1M co…
讨论
登录后参与讨论
还没有评论,来说第一句吧。