当前位置:首页 > Deepseek最新资讯 > 正文内容

DeepSeek发布开源周首个成果 可优化英伟达GPU效率

5个月前 (02-25)Deepseek最新资讯266

新京报贝壳财经讯(记者罗亦丹)北京时间2月24日上午,DeepSeek发布了其“开源周”的第一项成果:FlashMLA(直译为快速多头潜在注意力机制)的代码。

据了解,MLA(多头潜在注意力机制)正是DeepSeek降低大模型成本使用的关键技术之一,其可以显著减少大模型训练和推理过程中的内存占用,而FlashMLA则是针对Hopper GPU(一种英伟达GPU架构)开发的高效MLA解码内核,其针对可变长度序列进行了优化,目前已投入了生产,其可以使得H800达到3000GB/s内存,实现580TFLOPS(每秒浮点运算次数)计算性能。

贝壳财经记者注意到,根据此前DeepSeek发布V3大模型时公开的技术文档,该大模型正是使用英伟达的H800芯片训练而成。

上海骊翰科技咨询有限公司发文称,FlashMLA能在不损失模型性能的前提下,将缓存体积压缩至原来的1/4,从而大幅降低显存需求。例如,原始需要存储的100GB中间结果,压缩后仅需25GB,通过开源让企业可以直接使用FlashMLA来优化自家模型。随着FlashMLA的普及,AI推理有望进入千元级硬件跑百亿模型的时代。


“DeepSeek发布开源周首个成果 可优化英伟达GPU效率” 的相关文章

DeepSeek“五一礼包”来了!新开源模型数学推理能力大提升|附实测细节

DeepSeek“五一礼包”来了!新开源模型数学推理能力大提升|附实测细节

赶在五一假期前夕,DeepSeek给我们送出一份惊喜大礼。延续一贯的开源节奏,DeepSeek在Hugging Face正式发布DeepSeek-Prover-V2,并同步上线模型卡及示例代码。此次共...

AI选股亏了!看三大模型怎么“狡辩”,DeepSeek硬刚到底

AI选股亏了!看三大模型怎么“狡辩”,DeepSeek硬刚到底

让AI去选股,会比散户强吗?昨天,A股收盘之后我们做了一个试验,让DeepSeek、豆包、同义千问分别各自选择一只看好的股票,在今天开盘买入。三大AI经过各自的分析之后,分别给出了以下三只股票:Dee...

特斯联极特DeepSeek一体机发布,加速智能体商业场景落地

特斯联极特DeepSeek一体机发布,加速智能体商业场景落地

计算成本的加速下降,令大模型持续向端侧及边缘侧落地,越来越多的企业开始尝试用大模型技术实现不同模态数据间的相互理解和转换,催生了智能体的出现。有业内人士表示,智能体或将成为人类充分利用AI的关键所在。...

时空科技:公司业务暂未涉及DeepSeek

时空科技:公司业务暂未涉及DeepSeek

  证券日报网讯 时空科技2月19日在互动平台回答投资者提问时表示,公司业务暂未涉及DeepSeek。(编辑 王雪儿)...

梅州市12345热线正式接入DeepSeek

梅州市12345热线正式接入DeepSeek

2月21日,梅州市正式将DeepSeek大模型应用于12345政务服务便民热线,以AI技术赋能民生诉求响应,此举标志着梅州政务服务向智慧化、数字化转型迈出关键一步。梅州市政务服务和数据管理局相关负责人...

腾讯再“出牌”!比DeepSeek-R1便宜3/4的深度思考大模型

腾讯再“出牌”!比DeepSeek-R1便宜3/4的深度思考大模型

在此前35天“更新”30次后,3月21日深夜,腾讯混元大模型团队正式推出了自研深度思考模型混元T1正式版。相比以往,这次深夜“上新”也是腾讯摒弃了传统及主流的纯Transformer架构,首次将混合M...