当前位置:首页 > Deepseek最新资讯 > 正文内容

DeepSeek发布最新技术论文,梁文锋是共创之一

2个月前 (02-18)Deepseek最新资讯146

2月18日,DeepSeek官方在海外社交平台X上发布了一篇纯技术论文报告,论文主要内容是关于NSA(Natively Sparse Attention,原生稀疏注意力),官方介绍这是一种用于超快速长文本训练与推理的、硬件对齐且可原生训练的稀疏注意力机制。

具体来说,NSA针对现代硬件进行了优化设计,能够加速推理过程,同时降低预训练成本,且不牺牲性能。它在通用基准测试、长文本任务和基于指令的推理中均能达到或超越全注意力模型的表现。稀疏注意力为提高效率同时保持模型能力提供了一个有前景的方向。

记者注意到,在这篇名为《原生稀疏注意力:硬件对齐且可原生训练的稀疏注意力机制》(Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention)的论文署名中,DeepSeek创始人梁文锋也作为共创在列。

在论文中,DeepSeek团队表示,业界越来越认识到长上下文建模对于下一代大型语言模型的重要性,推动这一需求的应用包括深度推理、仓库级代码生成和多轮自主代理系统。然而,随着序列长度的增加,标准注意力机制的高复杂度成为了关键的延迟瓶颈。

论文提到,理论估计表明,在使用softmax架构(一种用于多分类问题的神经网络架构)时,注意力计算占解码64k长度上下文总延迟的70%-80%,这凸显了对更高效注意力机制的迫切需求。

记者将这一论文提供给DeepSeek,并让其评价对业界的影响与意义,DeepSeek称,这一技术的核心价值在于平衡效率与性能,既降低计算成本,又保持甚至提升模型能力。对行业而言,NSA为处理长上下文任务提供了一种高效的解决方案,有助于推动更强大、更经济的语言模型的发展,尤其是在需要处理长文本的应用场景中。

NSA通过高效的长序列处理能力,使模型能够直接处理整本书籍、代码仓库或多轮对话(如千轮客服场景),扩展了大语言模型在文档分析、代码生成、复杂推理等领域的应用边界。例如,Gemini 1.5 Pro已展示长上下文潜力,NSA可进一步降低此类模型的训练与推理成本。

此外,DeepSeek提到,NSA能够降低算力门槛与部署成本。端到端稀疏训练可以减少预训练所需的计算资源(如减少A100 GPU小时数),降低企业开发大模型的资金与技术门槛。同时,可以加速推理,使长文本生成(如代码补全、故事续写)的实时性更高,适用于边缘设备或低延迟场景。

一位X用户在DeepSeek帖子下表示,“NSA 机制改变了游戏规则。超快速长上下文训练对于扩大教育领域 AI 至关重要,这与个性化学习愿景完美契合。”还有网友对此调侃“RIP Nvidia”。

自1月20日发布DeepSeek-R1并搅动AI圈以来,DeepSeek方面一直较为低调,这是这么多天以来DeepSeek唯一发布的技术动态。

“DeepSeek team is cooking! ”(DeepSeek 团队正在积极工作!)有X网友表示。

(本文来自第一财经)


“DeepSeek发布最新技术论文,梁文锋是共创之一” 的相关文章

当红炸子鸡DeepSeek,为何花心思自研存储?

当红炸子鸡DeepSeek,为何花心思自研存储?

国产大模型DeepSeek横空出世,新的技术突破正快速转化为行业价值。近日,宇视科技正式推出DeepSeek一体机系列,以“开箱即用、私有化部署、应用赋能”等特性,无缝衔接用户需求,让智能应用真正“用...

从DeepSeek看人工智能自主创新的战略价值

从DeepSeek看人工智能自主创新的战略价值

作者:彭一杰(北京大学光华管理学院研究员、人工智能研究院多智能体与社会智能中心主任)随着全球科技竞争的加剧,人工智能已成为国家竞争力的重要标志。无论是国家还是行业、个人,都在积极探索如何利用人工智能赋...

东方国信:Deepseek目前对公司业绩影响较小

东方国信:Deepseek目前对公司业绩影响较小

每经AI快讯,有投资者在投资者互动平台提问:尊敬的董秘你好,有新闻报道称东方国信幕僚智数、大模型训推平台等产品快速完成了与DeepSeek-R1系列大模型的深度集成,标志着内蒙古和林格雨新区中国移动、...

江永举办青年夜校DeepSeek办公应用培训班

江永举办青年夜校DeepSeek办公应用培训班

今日永州讯(通讯员 谢文彬)4月17日晚,江永县青年夜校在县委党校举办了一场特别的DeepSeek课程,100多名来自全县各行各业的青年踊跃参与。此次课程特别邀请到湖南科技学院人工智能系主任程文志教授...

托普云农(301556)已接入deepseek

托普云农(301556)已接入deepseek

 同花顺(300033)金融研究中心03月24日讯,有投资者向托普云农(301556)提问, 请问公司是否接入deepseek?  公司回答表示,您好!我司已接入。此次接入对公司业绩无直接影响,截止目...

深圳港集团实现DeepSeek大模型本地化部署

深圳港集团实现DeepSeek大模型本地化部署

每经AI快讯,据深圳港集团公众号消息,在全球生成式AI技术蓬勃发展的浪潮中,针对港口行业数据安全与响应效率的特殊需求,深圳港集团数字化创新中心携手盐田港资讯公司和盐田国际公司,成功实现DeepSeek...