博主头像

E26:NVIDIA 彻底改变 AI 发展轨迹

外来客 • 2026-08-23 17:32:12

分享
𝕏 f
声明:本文为对公开视频内容的摘要整理, 未经本站独立核实,可能与原视频存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

(原标题:E26: NVIDIA Just Changed The Course of AI Forever)

🏗️ DGX 系统架构与演进

  • 核心定义:DGX 是 NVIDIA 的参考架构,旨在将 GPU、网络、电源等组件整合为垂直集成的软件栈,使 AI 易于使用且具备成本效益。
  • 形态演变:从十年前的单箱式 AI 超级计算机(DGX-1,8 路 GPU),演变为当前的机架级系统。
  • NVL72 架构:Vera Rubin NVL72 系统包含 72 个 GPU,通过 NVLink 连接,18 个计算托盘协同工作,表现为一个巨大的 GPU。
  • 合作伙伴生态:Dell、Supermicro、HPE 等 OEM 基于 NVIDIA 的参考设计构建系统,服务于全球数十万客户。
  • 应用差异:8 路 GPU 系统适用于标准工作负载;NVL72 适用于需要巨大内存上下文(如万亿参数模型)的复杂代理(Agentic)工作负载。

⚡ 性能提升与能效突破

  • 性能增益:从 Blackwell 到 Vera Rubin 世代,代理工作负载性能提升 35 倍,部分客户实测达到 50 倍。
  • 成本效益:性能提升意味着完成相同任务的成本降低 35 倍,或在相同成本下服务更多客户。
  • 动态电源管理:Vera Rubin 架构引入芯片级动态电源控制,解决传统数据中心因安全冗余导致的过度配置问题。
  • 能效数据:传统数据中心平均仅 60% 的电力用于有效工作,其余为热损耗或冗余;新架构旨在将有效电力利用率提升至接近 100%。
  • 实时响应:系统可自动响应公用事业公司的信号,在电网需求高时自动降低功耗,同时保持工作负载优化。

💾 存储架构与 STX 创新

  • STX 参考架构:针对代理 AI 工作负载推出的新存储参考设计,类似于十年前 DGX 对计算架构的定义。
  • 上下文存储:解决长时运行任务(如从零构建 C 编译器,耗时一周)无法将所有上下文存入 GPU 高带宽内存的问题。
  • 加速存储:通过靠近 GPU 的加速存储层,实现上下文的高速读写,支持更复杂的代理工作流。
  • Token 经济性:优化存储架构可使 Token 处理速度提升 5 倍,在相同存储硬件上完成更多工作,降低物理基础设施需求。
  • 合作伙伴集成:NetApp、Vast、DDN、HPE 等存储伙伴将其存储栈运行在 STX 架构上,企业客户直接从这些伙伴处购买解决方案。

🚀 CUDA 生态与未来展望

  • 软件兼容性:CUDA 保持应用兼容性,十年前在 DGX-1 上运行的应用可直接在当前系统上运行。
  • 持续优化:系统发布后一年内,通过软件优化(如 TensorRT-LLM 更新)通常可实现 2 倍性能提升,这与消费电子性能逐年下降的趋势相反。
  • 代理 AI 应用:重点在于安全地运行代理工作负载,例如在沙箱环境中构建软件应用。
  • 用户赋能:技术目标是让普通用户和企业能够轻松构建原本需要专业编程才能实现的自动化应用,改变日常工作方式。
  • 实际部署:NVIDIA 正在弗吉尼亚州北部建设并运行 DSX GigaScale AI 工厂,验证 24/7 满载运行的可行性。

0 条评论

发表评论

请先 登录 后参与讨论。