当前位置：首页 > Deepseek最新资讯 > 正文内容

梁文锋署名，DeepSeek再发论文

5个月前 (05-17)Deepseek最新资讯421

近日

DeepSeek团队发表新论文

论文以DeepSeek-V3为核心案例

披露其在AI硬件架构

与模型设计方面的关键创新

为实现具有成本效益的

大规模训练和推理提供思路

论文显示

DeepSeek创始人兼CEO梁文锋

也是参与者之一

DeepSeek论文《深入解读 DeepSeek-V3：AI 架构的扩展挑战与硬件思考》

图源：论文截图

有业内人士表示

该论文聚焦“硬件-模型”

协同创新底层逻辑

直击当前大模型训练

与推理的效率痛点

一起来看↓

揭秘DeepSeek模型设计原则

在训练大模型这条路上

可以说一直有“三大难题”

内存不够用

计算效率低

通信速度慢

而这篇论文所要解决的

正是上述的这些问题

与此前发布的V3技术报告不同

这篇论文详细阐述了DeepSeek

如何做到在硬件资源的“紧箍咒”下

通过精妙的“软硬一体”协同设计

将成本效益这笔账算好

DeepSeek在论文中提到

本文的目的不是重申

DeepSeek-V3的详细架构和算法细节

是跨越硬件架构和模型设计

采用双重视角来探索它们之间

错综复杂的相互作用

以实现具有成本效益的

大规模训练和推理

DeepSeek-V3的基本架构

图源：论文截图

具体而言

论文聚焦内存效率、成本控制、

推理速度等方面展开说明

DeepSeek模型设计原则

在内存效率方面

多头潜在注意力（MLA）技术

通过压缩键值（KV）缓存

缓存显著降低了内存消耗

FP8混合精度训练技术

将内存消耗显著降低了一半

从数据来看

相比其他模型

（如LLaMA-3、Qwen-2.5）

DeepSeek-V3的KV缓存大小

每token仅需70 KB

是传统方法的1/7到1/4

大幅降低显存压力

尤其适合长文本处理

在成本控制方面

DeepSeek开发了DeepSeek MoE架构

其两大优势包括降低训练成本

和利于个人使用和本地部署

在提高推理速度方面

DeepSeek-V3采用的是

多token预测（MTP）的方法

传统模型每次只能生成1个token

而MTP通过轻量级子模型并行

预测多个候选token

验证后选择最优结果

实验效果显示

生成速度提升1.8倍

OpenAI联合创始人

Andrej Karpathy此前赞叹

“DeepSeek-V3的出现

实现了高性能与低成本的平衡

未来或许不需要

超大规模的GPU集群了”

六大关键探索未来AI基础设施

下一代AI基础设施

将如何升级？

DeepSeek从硬件架构的角度

提出六大方向

涉及内存、互连、网络、

计算等核心领域

图源：虎嗅

整体来看，包括

“鲁棒性优先：

构建不易崩溃的训练系统”

“颠覆互连架构：

CPU-GPU直连消除节点瓶颈”

“智能网络升级：

动态路由实现低延迟”

“通信顺序‘硬件化’：

消除软件额外开销”

“网络计算融合：

硬件加速通信效率”

“内存架构重构：

从‘芯片堆叠’到‘晶圆集成’”

这些专业名词

非行家乍一看有些难懂

有业内人士“翻译”称

就是下一代AI硬件要向

算数快（低精度计算+本地细粒度量化）

传话快（直连网络+智能路由）

记性好（3D内存+近存计算）

不宕机（自愈网络）的方向改进

才能更好地应用于大模型训练

实现高效扩展

图源：网络

DeepSeek表示

这些内存中心的架构创新

旨在打破当前内存发展

滞后于模型规模扩张的瓶颈

是下一代AI系统持续迈向

“更大、更快、更稳”的关键路径之一

同时这些方案也在DeepSeek-V3

训练与推理实践中均取得了实效

为下一代高性能AI系统

构建了坚实的内存支撑基础

参考：上海证券报、财联社、量子位

撰文：雷渺鑫编辑：李飞排版：李汶键统筹：李政葳

光明网出品

更多内容欢迎扫码关注光明网数字化频道

来源：世界互联网大会

返回列表

上一篇：梁文锋署名DeepSeek新论文：公开V3大模型降本方法

下一篇：黄仁勋：DeepSeek将人工智能计算需求提升了100至1000倍

“梁文锋署名，DeepSeek再发论文” 的相关文章

北京企业登记首次接入DeepSeek

“您好，我想注册一家公司，需要什么材料？”登录北京市企业服务e窗通平台输入需求后，智能问答助手“市监小e”即刻开始了工作：“好的，请您先确认拟设立的主体类型……”经过简短沟通，小e迅速理解了办事人的需...

DeepSeek公告：DeepSeek R1网页/API不可用随后DeepSeek更新状态显示网页故障已恢复

DeepSeek于服务状态页面公告，DeepSeek R1网页/API不可用。(本文来自第一财经)3月20日午间，DeepSeek服务状态页面显示，DeepSeek R1网页/API不可用。随后，De...

翼辉信息亮相第25届上海工博会，引领工业智能化新浪潮

　　9 月 23 日至 27 日，备受工业领域瞩目的第 25 届中国国际工业博览会（以下简称“工博会”）在国家会展中心（上海）隆重开幕。作为中国工业操作系统领域的领军企业，翼辉信息以“智控...

Meta年会带火AI眼镜，DeepSeek登上国际期刊封面！寒武纪成交活跃，科创

　　今日（9月18日）重点布局国产AI产业链的科创人工智能ETF（589520）场内涨幅盘中上探1.59%，现涨1.27%，拉长时间来看，近7个交易日中，6个交易日均上涨，或呈现小碎步上涨...

长文档挑战赛：Qwen2-Plus-Latest 对阵 DeepSeek-V3，

　　一份10万字行业研究报告，两个当红大模型，一场关于长文档处理能力的终极对决——谁能以更低成本提供更优解决方案？　　作为一名金融分析师，我每周都需要处理大量的行业研究...

2025年度全球50家聪明公司榜单发布，DeepSeek、华为等中国企业入选

　　DeepSeek、宇树科技、华为deepseek、小米、比亚迪、科大讯飞等多家中国企业成功入选，展现中国创新力量！　　“聪明公司”不仅以技术驱动未来，更以商业智慧实...

梁文锋署名，DeepSeek再发论文

“梁文锋署名，DeepSeek再发论文” 的相关文章

北京企业登记首次接入DeepSeek

DeepSeek公告：DeepSeek R1网页/API不可用随后DeepSeek更新状态显示网页故障已恢复

翼辉信息亮相第25届上海工博会，引领工业智能化新浪潮

Meta年会带火AI眼镜，DeepSeek登上国际期刊封面！寒武纪成交活跃，科创

长文档挑战赛：Qwen2-Plus-Latest 对阵 DeepSeek-V3，

2025年度全球50家聪明公司榜单发布，DeepSeek、华为等中国企业入选

温馨提示：
DeepSeek爱好者为非盈利站点，所有内容均来自网络整理，不保证内容的真实性。

Powered By Z-BlogPHP. Theme by TOYEAN.

梁文锋署名，DeepSeek再发论文

“梁文锋署名，DeepSeek再发论文” 的相关文章

北京企业登记首次接入DeepSeek

DeepSeek公告：DeepSeek R1网页/API不可用 随后DeepSeek更新状态显示网页故障已恢复

翼辉信息亮相第25届上海工博会，引领工业智能化新浪潮

Meta年会带火AI眼镜，DeepSeek登上国际期刊封面！寒武纪成交活跃，科创

长文档挑战赛：Qwen2-Plus-Latest 对阵 DeepSeek-V3，

2025年度全球50家聪明公司榜单发布，DeepSeek、华为等中国企业入选

Powered By Z-BlogPHP. Theme by TOYEAN.

DeepSeek公告：DeepSeek R1网页/API不可用随后DeepSeek更新状态显示网页故障已恢复