DeepSeek V4是怎么训练出来的?73页PPT深入解析
外来客 • 2026-08-16 11:35:01
声明:本文为对公开内容的摘要整理,
未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议;
观点与版权归原作者及原平台所有。
如涉及版权问题,请联系我们,核实后立即删除。
[ 免责声明 ]
🏗️ 模型架构与核心参数
- 双模型发布:DeepSeek V4 系列包含 V4 Pro 和 V4 Flash 两个版本。V4 Pro 定位为旗舰模型,对标 GPT-5.4 和 Claude Opus 4.6;V4 Flash 定位为高性价比普及者,主打低成本与 Agent 能力。
- 参数规模:V4 Pro 总参数量达到 1.6T,采用 MoE(混合专家)架构。虽然总参数巨大,但每次推理仅激活 6 个专家及 1 个共享专家(共 7 个),从而在保持高性能的同时降低计算成本。
- 上下文长度:两个模型均支持 100 万 Token 的上下文长度,标志着超长上下文进入相对普惠时代,且推理成本显著低于同类竞品。
- 训练数据:V4 Pro 使用 33T 预训练数据,V4 Flash 使用 32T。训练前过滤了互联网中大量 AI 生成文本以防止模型坍缩,并扩充了多语言内容及高质量科技论文数据。
⚙️ 底层机制创新
- MHC 残差连接:引入 MHC 机制解决深层网络信号爆炸或发散问题。通过给每条残差连接添加“水闸”约束,确保输入信号量与输出信号量一致,使 1.6T 大模型的训练过程更加稳定平缓。
- 混合注意力机制:采用“初筛”与“细筛”交替的分层读取模式。
- 初筛:将 1024 个 Token 压缩为一块摘要,快速扫描全局走向,保留全局视野。
- 细筛:将 64 个 Token 揉成块,对块进行打分,仅精读最相关的部分。
- 效果:相比 V3.2,V4 在百万上下文下的算力节省约 80%-90%,仅需约 2% 的成本即可完成长上下文读取。
- Muon 优化器:替代传统的 AdamW。AdamW 独立调整每个参数易导致“偏科”(某些方向过度优化,某些方向停滞)。Muon 通过近似迭代(前 8 步快速逼近,后 2 步精修),将更新方向强行校正为正圆,使冷门方向获得同等探索机会,扩大模型探索范围。
🏭 基础设施与工程实践
- 自研 Infra:不依赖硬件厂商现成组件,每一层均自行编写,极致抠细节以节省每一微秒和每一字节。
- 可复现性优先:强调调试不靠玄学,确保 Bug 能精准复现。
- 硬件需求文档:向英伟达提出需求,指出部分硅基面积浪费,通信计算空间可被优化。
- 开源精神:在论文中详细披露了 6 个工程 Checklist 及 Agent 强化学习的 Infra 细节,被视为开源世界首个真正工业级的 Agent 基础设施。
📚 后训练范式变革
- 痛点解决:传统 SFT 和 RLHF 存在强化学习不稳定、多任务奖励冲突(如提升数学权重导致代码降分)以及 Reward Hacking(学生模型钻打分机制空子)等问题。
- 专家-学生蒸馏模式:
- 第一阶段(专家训练):针对数学、代码、Agent、推理等领域独立训练专科专家,强化学习仅在此阶段发生,专家间完全隔离。
- 第二阶段(蒸馏):统一的学生模型观摩并学习各专科专家的招式,不进行强化学习。
- 路由机制:利用 MoE 架构特性,学生模型根据任务类型自动对齐相应的专家(如数学任务对齐数学专家)。
- RL 角色转变:强化学习从对齐人类偏好的最终手段,转变为训练专家的中间步骤。
📊 性能评测与局限性
- 优势领域:
- 代码竞赛:CodeForce 分数达到人类选手第 23 名水平,优于 GPT-5.4 和 Gemini 3.1。
- 数学竞赛:在 Putnam 数学竞赛中达到满分水平,超越多数模型;奥数成绩仅次于 GPT-5.4。
- 写作能力:创意写作和功能性写作优于 Gemini 3.1 Pro。
- 劣势领域:
- 复杂工程任务:在终端长任务、复杂多步骤工具调用上,相比 GPT-5.5 和 Opus 4.7 有明显差距(终端任务差距约 15 个百分点)。
- 品位与模糊判断:在需要人类偏好、无明确标准答案的任务上表现较弱,排名随任务模糊度增加而滑落。
- HLE 评估:在人类最终考试(HLE)中,虽为开源最佳,但相比 Kimi K2.6 等模型仍有差距,尤其在配合工具调用时表现不佳。
- 自我认知:DeepSeek 承认存在“技术奇效但原理不明”的情况,且稀疏化压缩尚未极致,未来需进行更严格的分解实验。
💰 价格策略与市场定位
- 价格杀手:V4 Flash 价格极低,属于同类型快速模型中的最低水平;V4 Pro 价格约为顶级竞品(如 GPT-5.4)的 1%。
- 算力限制:Pro 版本因高端算力有限,目前吞吐量受限,价格相对较高,预计下半年可能降价。
- 应用场景:适合长上下文文档处理(如技术文档、客服问答)、标准化解题、代码竞赛等场景。可直接集成至 Cloud Code、OpenCode 等 AI 编程工具中。
- 免费服务:网页版目前提供免费服务,进一步降低使用门槛。
🔮 未来展望(V5 预测)
- 技术方向:更极致的稀疏化、更低延迟的架构、多轮跨小时长周期任务优化。
- 数据策略:由于高质量真实数据稀缺,V5 大概率将使用更多合成数据。
- 模态扩展:V5 大概率将是多模态模型。
- Agent 能力:重点提升 Agentic 能力,弥补当前在复杂工具调用和长链路推理上的短板。
👤 同一博主
GPT-6 Astra做3D绝了!我两天建了一座能开车的巴黎(赠300页手把手教程)
我雇了三个AI员工开发我的产品,今天正式开源!【免费使用DeepSeek V4 flash】
Claude Fable 5 发布!我用它 5 小时做了个 macOS App,已开源
我逆向了Claude Design!一句话帮你生成任何出色设计,开源后狂揽GitHub 1.6万+s
首发实测腾讯最新龙虾🦞产品:Marvis
GPT-5.5首发实测!比Claude Opus4.7强?
【首发】Claude Opus 4.7解读!细思极恐的技术报告
我蒸馏了17个大佬给我打工(开源免费)
谷歌最新模型Gemma4发布!深度解析+送42页资料
Claude Code源码泄漏,首发解读51万行代码!
🧭 类似博主
-
境外最强接码手机号|eSIM.GG 乌龟卡|🇪🇪爱沙尼亚手机号 | Telegram接码|Whats
-
从游戏商业帝国到国产单机游戏史,「GPASS回归游戏季」都会聊些什么?
-
AI晶片背後的巨人!EUV、光罩、先進封裝全掌握!獨家專訪蔡司高層!
-
【看片自由】2款免费AI同声传译:YouTube字幕实时翻译+本地离线部署!
-
别再在Excel表格间复制粘贴数据了!试试这个方法
-
和五月天阿信见了他
-
Claude Design 新手教程:制作专业文档与幻灯片
-
4 大极限实测:用代码写 3D 动画,MiniMax H3 渲染写实大片
-
最佳动态图形与动画AI:MiniMax H3
-
iOS 27现已发布!这些功能你必须尝试
0 条评论
发表评论
请先 登录 后参与讨论。