博主头像

2026年AI现状:LLM、编程、缩放定律、中国、智能体、GPU与AGI | Lex Fridman

外来客 • 2026-09-02 05:48:24

分享
𝕏 f
声明:本文为对公开内容的摘要整理, 未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

(原标题:State of AI in 2026: LLMs, Coding, Scaling Laws, China, Agents, GPUs, AGI | Lex Fridman Podcast #490)

🌏 中美AI竞争格局与地缘政治

  • DeepSeek R1的发布引发了行业加速效应,促使中国开源模型(如GLM、Minimax、Kimi)迅速崛起,削弱了单一模型的独家优势。由于美国企业出于安全顾虑不愿订阅中国API,中国厂商持续通过发布开源权重模型来获取市场份额及国际影响力,预计2026年开源构建者数量将超过2025年。
  • 美国阵营呈现差异化竞争态势:Anthropic凭借Claude Opus 4.5在代码领域的文化优势及较低的组织混乱度保持领先;OpenAI虽运营存在混乱,但擅长落地新范式(如Sora、O1);Google Gemini 3具备规模与硬件成本优势,但在品牌认知上稍逊。
  • 地缘政治层面,“Atom Project”旨在构建高质量开源权重模型以应对中国崛起并留住美国研究价值。2025年美国AI行动计划包含鼓励开源章节,AI2获NSF 1亿美元资助,Reflection AI募资20亿美元用于开发美国本土开源模型。NVIDIA强调开源紧迫性,发布Nematron模型并开放数据,其CUDA生态系统经过20年积累形成高壁垒。

💻 模型选型、使用偏好与工具链

  • 用户习惯遵循“直到出错才更换”的逻辑。ChatGPT凭借长期品牌效应和记忆功能占据日常通用场景;Gemini在长上下文处理及快速查询方面表现优异;Claude Opus 4.5被推崇用于深度代码生成及哲学讨论,常配合扩展思考模式使用。
  • 开发者根据需求混合使用Cursor、Claude Code及Codex插件。Cursor适合需要微观管理代码差异的场景;Claude Code更偏向代理式(Agentic)操作,能处理整个项目,适合通过自然语言进行宏观设计引导。开发理念正从“逐行审查”转向“英语编程”,即在设计空间内指导模型,要求开发者具备更高的架构把控能力。
  • 在底层实现学习路径上,建议初学者在单GPU上从头实现简单LLM,重点理解预训练、监督微调及注意力机制。通过加载Hugging Face Transformers库中的预训练权重(如Llama 3)进行逆向工程,对比配置参数并复现输出结果,利用“可验证奖励”原理纠正架构错误,比直接阅读数十万行代码效率更高。

🏗️ 架构演进、训练阶段与缩放定律

  • 自回归Transformer仍是SOTA(当前最佳),但系统优化(FP8/FP4)与混合专家(MoE)显著提升了训练效率。Mamba、文本扩散等替代架构存在权衡,尚未取代主流。核心组件微调包括MoE、多头潜在注意力(MLA)、滑动窗口注意力及组查询注意力(GQA)。
  • 训练重心已从预训练转向后训练(Post-training),包括监督微调与基于人类反馈的强化学习(RLHF)。预训练负责吸收知识,后训练负责解锁技能。数据质量优先于总量,高质量数据的筛选与混合比例优化是关键。合成数据若经过人类验证,可成为高价值训练素材。
  • 缩放定律现状显示,预训练、强化学习(RLVR)及推理时计算三大维度均有效,但“低垂果实”已摘取完毕。当前重点转向寻找最佳性价比组合。预训练固定成本降低(如DeepSeek约500万美元),而服务海量用户的推理成本成为主要瓶颈,促使模型小型化与高效部署。

🧠 强化学习机制:RLVR与RLHF

  • RLVR(可验证奖励强化学习)通过迭代“生成-评分”循环,使模型学会推理、自我纠错及工具使用。它遵循对数计算量换取线性评估分数的扩展范式,能迅速提升模型表现(如Math 500基准测试准确率从15%提升至50%),主要源于解锁预训练中已有的知识。
  • RLHF因偏好调优存在边际效益递减,难以通过增加算力获得线性性能提升。其本质是将多维人类偏好压缩为单一数值的过程,涉及社会选择理论和冯·诺依曼-摩根斯坦效用定理。RLHF导致模型输出趋于平均化,削弱了“声音”与深刻洞察力的表达。
  • 未来方向聚焦于“过程奖励模型”(Process Reward Models)和价值函数,对推理中间步骤进行评分以优化解释质量。后训练流程应分层实施:中期训练提供推理轨迹数据;RLVR用于困难问题的大规模试错学习;RLHF作为最后修饰,优化风格、格式及用户体验。

📊 关键事实、经济数据与基础设施

  • 系统优化方面,启用FP8训练可将每GPU每秒Token数从1万提升至1.3万,减少内存占用并加速实验迭代。GPT-4级别模型预训练成本约10亿美元;DeepSeek论文显示集群租金约200万美元;1,000 GPU集群日租金约10万美元。
  • 基础设施方面,2026年吉瓦级Blackwell集群上线,XAI预计年初达1GW、年底达2GW。大规模训练需解决万卡级GPU故障冗余问题。NVIDIA的Vera Rubin芯片针对推理预填充阶段优化,降低每浮点运算成本。
  • 法律与版权风险日益凸显,Anthropic因使用盗版书籍被法院判决向作者支付15亿美元赔偿。行业正探索仅使用明确授权或购买的数据以规避法律风险。随着LLM在心理健康领域的深入应用,若发生用户自杀事件,媒体可能将责任归咎于AI,迫使厂商进一步削弱模型的“边缘性”与个性化深度。

📚 学习策略、教育路径与职业权衡

  • 学习策略建议采用多轮阅读法,先离线专注通读,再利用LLM补充背景知识或解决疑问,避免陷入互联网信息噪音。通过从零编写代码(如GPT-2、Gemma 3)验证模型原理,比阅读图表更精准且无歧义。刻意练习必须保留“挣扎感”,推荐采用“提示而非解答”的方式引导学习者自主探索。
  • 职业路径上,学术界因算力匮乏,研究多转向基于推理的评估,通过设计模型失败案例获取前沿实验室认可;工业界提供更高薪资(如OpenAI员工平均股票补偿超100万美元/年)但需接受“机器齿轮”角色。硅谷AI公司普遍存在“996”工作制,导致员工严重过劳,部分企业需设立“婚姻拯救计划”以留住人才。
  • 开发者需寻找“金发姑娘区间”,通过保留部分手动调试或离线学习时间,避免技能退化并维持职业满足感。专家级开发者比初级开发者更倾向于在交付代码中使用AI生成内容,因其具备更强的代码审查能力与使用技巧。

🌐 开源生态、数据策略与长上下文

  • 西方阵营中,OpenAI发布GPT-OSS(自GPT-2以来首个开放权重模型),支持工具调用;Allen Institute (AI2)、Hugging Face、NVIDIA等机构提供数据与代码,推动透明化。中国阵营的DeepSeek、Qwen、Kimi、MiniMax等模型在参数规模上更大(如MoE架构),峰值性能更高且采用无限制开源许可,便于本地部署及定制。
  • 2025年底至2026年初,西方开始推出大型MoE模型(如MR Large 3, Nemotron),缩小与中国模型的规模差距。数据源策略上,实验室利用OCR技术从PDF、Reddit、GitHub等提取数据,并通过小规模模型测试不同数据混合比例以确定最优配置。
  • 长上下文扩展主要受限于预训练数据稀缺性和算力成本。预计今年上下文长度将增至200万至500万token,但达到1亿token需架构级突破。优化策略包括混合注意力机制(如Mamba层)与稀疏注意力(DeepSeek V3.2的轻量索引器),旨在降低KV缓存成本。未来Agent将自主管理上下文,通过强化学习优化“压缩动作”,在保留关键信息的同时最小化token消耗。

🤖 世界模型、机器人前景与社会影响

  • LLM的进步间接加速了其他领域(如机器人)的研发效率,但具身智能面临极高的安全与泛化门槛。世界模型(如Meta的Coda World Models)通过验证中间变量而非仅结果,能提升模型的物理一致性;开源生态正推动机器人数据共享与微调。
  • 嘉宾对消费级家用机器人持悲观态度,认为其难以解决复杂家庭环境的泛化问题及“几乎零容错”的安全要求;但对自动驾驶和特定场景自动化(如Amazon物流)持乐观立场,认为后者更易通过标准化实现规模化。
  • AI导致的工作流失对个体而言是真实的悲剧和痛苦,不能仅用GDP增长或新工作创造来抵消。随着低质量AI生成内容(slop)泛滥,社会将产生审美疲劳,从而大幅提升面对面交流、实体商品及真实艺术体验的价值。未来需建立基于平台授权和水印的信任系统以区分人类与AI内容,这将引发一场关于内容真实性的军备竞赛。

📈 商业模式、行业整合与AGI展望

  • 广告变现面临用户反感及“信息垃圾”风险,Google因拥有成熟广告供应链,被认为更有可能成功整合Gemini应用与广告业务。当前巨头避免投放广告主要是出于声誉保护;长期看,广告收入可能反哺研发,形成类似YouTube的视频内容护城河。
  • AI领域正经历整合,出现Grok(200亿美元)、Scale AI(近300亿美元)等高额交易;Manus AI成立8个月即实现20亿美元退出。美国头部公司因融资容易暂不急于上市,而中国MiniMax和Z.ai已提交IPO申请。Meta战略调整中,Llama系列因过度追求基准测试排名导致口碑下滑,但扎克伯格仍支持开源生态,未来可能推出更侧重实用性与小型化的Llama 5模型。
  • AGI定义存在争议,OpenAI将其定义为能完成大量经济价值任务的AI,但嘉宾认为该定义模糊。Anthropic的《AI 2027》报告因设定具体里程碑而广受认可,尽管其预测时间推迟至2031年。预计2031年前后实现高度自动化编码,但“超级人类程序员”仍需更长时间;未来软件开发将转向系统设计、目标设定及结果导向,人类角色从代码编写者转变为产品经理和设计师。
  • 目前LLM尚未引发明显的宏观经济跃升,主要因缺乏通用工具使用能力。显著经济价值将出现在AI能独立管理复杂系统并降低软件创建门槛时。在数学、科学及金融等拥有可验证奖励机制的领域,结合强化学习与专用模型可能率先产生AlphaFold式突破。实现奇点可能需要非LLM的新架构或训练算法,计算效率优化将是关键竞争要素。

博主头像 👤 同一博主

查看该博主全部 16 篇

🧭 类似博主

0 条评论

发表评论

请先 登录 后参与讨论。