当前位置:首页 > Deepseek最新资讯 > 正文内容

DeepSeek发布开源周首个成果 可优化英伟达GPU效率

2个月前 (02-24)Deepseek最新资讯123

新京报贝壳财经讯(记者罗亦丹)北京时间2月24日上午,DeepSeek发布了其“开源周”的第一项成果:FlashMLA(直译为快速多头潜在注意力机制)的代码。


据了解,MLA(多头潜在注意力机制)正是DeepSeek降低大模型成本使用的关键技术之一,其可以显著减少大模型训练和推理过程中的内存占用,而FlashMLA则是针对Hopper GPU(一种英伟达GPU架构)开发的高效MLA解码内核,其针对可变长度序列进行了优化,目前已投入了生产,其可以使得H800达到3000GB/s内存,实现580TFLOPS(每秒浮点运算次数)计算性能。


贝壳财经记者注意到,根据此前DeepSeek发布V3大模型时公开的技术文档,该大模型正是使用英伟达的H800芯片训练而成。


上海骊翰科技咨询有限公司发文称,FlashMLA能在不损失模型性能的前提下,将缓存体积压缩至原来的1/4,从而大幅降低显存需求。例如,原始需要存储的100GB中间结果,压缩后仅需25GB,通过开源让企业可以直接使用FlashMLA来优化自家模型。随着FlashMLA的普及,AI推理有望进入千元级硬件跑百亿模型的时代。


“DeepSeek发布开源周首个成果 可优化英伟达GPU效率” 的相关文章

山东移动DeepSeek政务场景共创沙龙成功举办

山东移动DeepSeek政务场景共创沙龙成功举办

齐鲁网·闪电新闻3月7日讯 3月7日,山东移动与华为联合举办DeepSeek政务场景共创沙龙。本次交流会以“政通智合数聚泉城 共创政务AI新场景”为主题,邀请16地市大数据局相关专家、数百名政务领域资...

什么是“具身智能”?DeepSeek和专家分别如何解读

什么是“具身智能”?DeepSeek和专家分别如何解读

过去一年,我国新质生产力发展步伐明显加快。我国在全球创新指数中的排名上升到第11位,是十年来全球创新力提升最快的经济体。而今年的《政府工作报告》,对培育壮大新兴产业、未来产业,推动传统产业改造提升,激...

“联通元景+DeepSeek” 赋能重庆12345热线智慧升级

“联通元景+DeepSeek” 赋能重庆12345热线智慧升级

在人工智能技术快速发展的背景下,中国联通积极推进数字化建设,助力重庆12345政务服务便民热线接入DeepSeek R1国产大模型,并融合中国联通元景大模型技术,实现民生诉求场景下热点问题的全维度态势...

怎么设置deepseek的快捷检索?

怎么设置deepseek的快捷检索?

怎么设置deepseek的快捷检索?要设置DeepSeek的快捷检索,您可以通过创建一个快捷指令来实现。以下是详细的步骤:下载并打开快捷指令App:在App Store中下载并安装“快捷指令”应用。创...

红松App全面接入DeepSeek“AI松小智”

红松App全面接入DeepSeek“AI松小智”

3月3日,红松宣布已全面接入深度求索(DeepSeek)人工智能大模型,并推出国内首款专为50+退休人群量身定制的智能生活助手“AI松小智”,全面升级中老年用户的兴趣文娱生活服务体验。这标志着国内首个...

当环评拥抱DeepSeek:30分钟出报告、5分钟生成准入意见 | 智能环评篇

当环评拥抱DeepSeek:30分钟出报告、5分钟生成准入意见 | 智能环评篇

让环评“拥抱”智能化手段为生态环境治理体系和治理能力现代化建设注入全新活力已成为各地开展环评改革工作的重要关注点浙江杭州30分钟自动生成环评报告表15分钟完成智能审查以往建设单位需要委托环评中介机构查...