博主头像

👤 同一博主

按发布时间查看该博主的全部资讯要点

查看全部博主 →
博主头像

🎬 EP150. 大型語言模型哪一家最強、AI 技術與通路誰重要、人類要擔心 AI 毀滅世界嗎? | M

🏆 大型语言模型实力排名与开源闭源之争 模型层级划分:Harry 将当前大型语言模型分为三个层级。第一层级(Tier 1)包含 OpenAI 和 Anthropic,被视为技术最强者;第二层级(Tier 2)为 Google;第三层级(Tier 3)包括 XAI 和 Meta。 Meta 排名争议:尽管 Meta 的 Llama 3.1 在纯文本处理上表现强劲,甚至可能达到第二层级水平,但 Harry 将其排在第三层级的主要原因是多模态(Multimodal)技术的落后。 多模态技术差异:OpenAI 和 Google 采用原生多模态架构,而 Meta 的 Llama 3.2 虽支持多模态,但并非原生实现,而是通过连接视觉模型与文本模型的方式运作。这种非原生做法导致信息转换过程中存在信号流失,且反应速度较慢,无法达到 OpenAI 那种即时交互的体验。 开源与闭源竞争:开源代表为 Meta 和 XAI,闭源代表为 OpenAI、Google 和 Anthropic。Harry 认为在 2024 年 10 月 OpenAI 发布 O1 模型之前,开源模型凭借算力堆叠(Scaling Law)有望追上闭源模型;但 O1 的出现引入了“测试时计算”(Test Time Compute)技术,使得竞争格局变得不明朗。 技术复制难度:Harry 认为 Google 最有可能复制 O1 的技术,因为该技术源于 AlphaGo 的搜索与强化学习原理,而 Google 在此领域积累深厚。相比之下,Meta 和 XAI 虽然资源充足,但在后训练(Post-training)和强化学习方面的核心优势不如 Google 明显。 商业影响:若模型性能差异在普通用户感知中不明显,模型将沦为通用商品(Commodity),此时拥有用户通道的公司(如微软)将更具优势;若顶级模型在特定高价值领域(如军事、科学研究)保持显著优势,则模型提供商的价值将得以维持。 🧠 O1 模型、推理能力与 Agent 趋势 O1 的技术突破:OpenAI 的 O1 模型通过引入“测试时计算”(Test Time Compute)技术,显著提升了推理能力。这与传统的预训练 Scaling Law 不同,它通过在推理阶段增加计算步骤(如思维链 Chain of Thought 和强化学习)来降低幻觉率。 推理能力的本质:Harry 认为推理能力对于 AI 成为自主代理(Agent)至关重要。高推理能力能大幅降低模型在执行多步骤任务时的错误累积概率。例如,若单步幻觉率为 5%,100 步任务的失败率极高;而 O1 通过降低单步错误率,使得长链条任务的可执行性大幅提升。 Agent 发展趋势:2025 年 AI 的一大趋势是 Agent 的普及。Agent 能够独立执行复杂任务,如预订餐厅、缴纳费用等。Harry 举例说明,Agent 可以自动查询多家餐厅的订位规则、时间,并安排打电话或网络预订,解决人类繁琐的操作流程。 人类与 AI 协作:虽然 AI 在推理和任务执行上进步迅速,但人形机器人(Humanoid Robots)的普及仍需较长时间(预计十年以上)。软件层面的 Agent 可能在五年内实现广泛应用,而硬件层面则需等待工厂自动化场景的进一步成熟。 竞争态势:Harry 预测,若其他公司无法在短期内(如 2025 年 3 月底前)推出具备同等推理能力的模型,OpenAI 将在高端应用场景中保持显著优势。然而,对于大多数日常商业应用,模型间的差异可能并不显著,用户难以通过普通对话区分不同模型。 ⚖️ AI 安全威胁与专家观点分歧 专家立场对立:AI 领域两位顶尖科学家对 AI 风险持相反观点。Jeffrey Hinton(前 Google 首席科学家,图灵奖得主)对 AI 可能带来的危险表示担忧,甚至在诺贝尔奖获奖感言中强调其风险;而 Yann LeCun(Meta 首席科学家,图灵奖得主)则认为当前 AI 智慧水平极低,甚至不如猫,无需过度恐慌。 风险类比核武:Harry 认为 AI 确实具备对全人类造成威胁的潜力,类似于核武器。虽然目前人类尚能控制 AI,但鉴于 AI 是比人类更聪明且不可解释的系统,存在“玩火”导致意外灾难(如病毒泄露、系统失控)的风险。 乐观展望:尽管存在风险,Harry 整体持乐观态度。他认为 AI 将大幅加速人类文明发展,且人类有能力像管控核武一样规范 AI。他相信 AI 毁灭世界的概率极低,更可能的结果是 AI 在科学研究(如发现新材料、蛋白质合成)中产生巨大价值,尽管不同模型在发现效率上可能存在细微差距(如 500 种 vs 485 种有效结果),但并非“能”与“不能”的绝对差异。 👓 Meta Ray-Ban 智能眼镜体验 产品评价:Harry 高度评价 Meta 与 Ray-Ban 合作的智能眼镜,认为其性价比极高(价格低于 1 万新台币),且功能实用。 核心功能: AI 交互:集成 Meta AI,支持语音唤醒,可进行翻译、识别物体等。目前支持 Llama 3.2 多模态模型,但尚未支持中文,限制了其在台湾的使用。 拍摄与音频:拍照角度接近人眼视角,适合第一人称记录;音效表现良好,支持听音乐。 续航:电池续航约 2-3 小时。 使用场景:适合双手被占用时的场景,如开车时记录路况、查看菜单翻译等。Harry 指出,Meta 内部员工对此产品评价极高,常用于查询信息或记录生活。 局限性:目前版本不支持近视镜片定制(在美国可更换),且 AI 功能对中文支持不足,期待未来版本改进。 🎙️ 科技浪 Podcast 运营心得 运营挑战:Harry 表示每周更新节目比想象中更累,需要持续研究新话题以保持内容深度。 内容策略:节目约 80% 内容聚焦 AI,其余涵盖 SpaceX、Neuralink 等科技领域。Harry 建议固定节目格式,如每周固定讨论两个主题(一个 AI 新闻,一个其他科技新闻),以平衡内容质量与创作压力。 学习收获:制作节目迫使 Harry 深入钻研技术细节,纠正了许多自以为懂但实际理解不深的概念。这种“教别人”的过程极大地提升了他的专业水平。 行业观察:Harry 认为 AI 是当下科技领域的核心热点,任何科技类 Podcast 都难以避开 AI 话题,但其他领域如自动驾驶、元宇宙等仍有值得探讨的创新点。

已显示 1 / 1 篇