DeepSeek-V3.2-Exp发布,稀疏注意力降低长上下文计算成本
9月29日,DeepSeek发布DeepSeek-V3.2-Exp实验模型。新版本基于V3.1-Terminus,引入DeepSeek Sparse Attention稀疏注意力机制,重点改善长上下文训练和推理效率。
传统注意力在上下文增长后会显著增加计算量。稀疏注意力尝试把资源集中到更相关的信息位置,以降低成本和延迟。官方称,V3.2-Exp在测试中与V3.1-Terminus保持相近表现。
模型已进入应用、网页和API,并开放权重、技术报告与部分GPU内核。对于研究团队,这有助于验证长文本效率优化方法;对于企业,则需要观察真实文档中的召回和事实一致性。
长上下文成本下降并不代表模型能自动理解所有输入。合同、报告和知识库任务仍应检查引用位置、遗漏率和跨段落一致性。
*本文为基于官方发布信息的中文摘要,详情以原文链接为准。