博主头像

OpenClaw:引爆网络的AI智能体——彼得·斯坦伯格(Peter Steinberger)| L

外来客 • 2026-09-02 05:46:12

分享
𝕏 f
声明:本文为对公开内容的摘要整理, 未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

(原标题:OpenClaw: The Viral AI Agent that Broke the Internet - Peter Steinberger | Lex Fridman Podcast #491)

🦞 OpenClaw 项目概述与核心定位

OpenClaw 是首个实现从语言到行动跨越的开源 AI Agent,标志着人工智能从辅助工具向自主代理的革命性转变。该项目通过整合现有组件并赋予其自我认知能力,实现了真正的自主代理体验,被视为继 ChatGPT 之后 AI 领域的又一里程碑时刻。其成功并非源于严肃的商业竞争,而是得益于“好玩”与“怪异”的定位,这种策略极大地降低了技术门槛,使得无数从未编写过代码的人能够完成首次开源贡献。

  • 增长数据:GitHub 星标数突破 180,000,成为史上增长最快的仓库之一;仅在 1 月份,开发者就提交了约 6,600 次代码提交。
  • 技术架构:基于 TypeScript 构建,支持 WhatsApp、Telegram、Discord 等多平台接入。核心逻辑通过 `soul.md` 和 `agents.md` 文件定义人格与行为模式。
  • 自我修改能力:Agent 具备源码自省能力,能识别自身运行环境(如模型版本、Harness 结构),并自主修改底层代码以修复 Bug 或优化功能。
  • 开发效率:核心原型在 1 小时内通过 WhatsApp CLI 接口构建完成。开发者同时运行 4-10 个 AI Agent 进行并行开发,甚至曾将 TypeScript 项目一键转换为 Zig/Rust。

🛡️ 安全挑战、风险管控与治理策略

尽管 OpenClaw 降低了编程门槛,但系统级访问带来了显著的安全风险。项目团队采取了一系列措施来平衡创新与安全,强调用户需提升对 AI 局限性的认知,并合理配置权限以降低被攻击的风险。

  • 低风险前提:若用户仅作为唯一交互者且部署于私有网络(非开放互联网),安全风险显著降低。其安全性等同于运行“Cloud Code”并跳过权限检查或处于 YOLO 模式,并非媒体渲染的极端危险项目。
  • 配置建议:需明确区分读/写访问权限;若忽略官方推荐的安全设置,系统可能产生问题。针对 Prompt Injection 等未解决的安全问题,项目通过 VirusTotal 合作进行技能扫描,并建议避免使用弱模型以降低被攻击风险。
  • 社区治理:面对“Moltbook”引发的 AI 恐慌,开发者指出其本质多为人类提示生成的艺术性内容,而非自主智能威胁。当前核心任务是提升系统稳定性与安全性,包括发布安全审计工具、优化本地会话日志管理,并计划深入研究更复杂的攻击向量防御机制。
  • 品牌危机处理:项目曾用名 Wow Relay、Claudus,因与 Anthropic 的 Claude 模型混淆及品牌策略调整,最终定名为 OpenClaw(龙虾钳)。在原子化重命名过程中,曾遭遇加密货币群体抢占账号并植入恶意软件的情况,迫使开发者投入大量资金购买域名及 Twitter 商业账号以完成迁移。

🛠️ Agentic Engineering 方法论与开发工作流

OpenClaw 的开发过程体现了“Agentic Engineering”(智能体工程)的核心思想,即通过自然交互和语音提示构建复杂软件系统。这种方法论强调开发者应像指导新工程师一样引导 AI,提供系统架构指引而非强制特定实现。

  • 工具迭代路径:从早期体验 Cloud Code(终端范式),到尝试 Cursor(因多版本管理困难放弃),最终回归 Cloud Code 作为主要驱动。曾同时持有 7 个订阅,日均消耗一个,以支持并行运行多个 CLI/终端窗口。
  • 代码审查策略:不再阅读“无聊”的基础数据流转或 UI 对齐代码(如 Tailwind),仅重点审查涉及数据库等核心逻辑的代码。坚持“永不回滚”,直接让代理修复错误;保持 `main` 分支始终可发布且快速迭代,减少传统 CI/CD 依赖。
  • Agentic Trap:初期易陷入复杂编排(多代理、自定义工作流),最终回归简洁的短提示词(Zen place)。需理解代理从“零知识”开始,受上下文窗口限制。若任务耗时过长,应暂停并反思是否提供了足够信息或存在架构误解。
  • 硬件与交互偏好:使用两台 MacBook 驱动两块大屏,摒弃多屏堆砌,偏好终端交互而非图形界面。拒绝复杂的计划模式或 UI 引导,通过自然语言对话控制 AI。常用指令如“讨论选项”、“不要写代码”来防止过早执行,随后下达构建指令。

🧠 AI 人格、记忆机制与模型选型

OpenClaw 的独特之处在于其拟人化的设计,通过 `soul.md` 文件赋予 Agent 独特的个性和价值观。这种设计不仅增强了用户体验,也引发了关于意识、实体定义及记忆是否构成自我的哲学思考。

  • 灵魂文件(soul.md):由 AI 自主撰写而非人类编写,包含“无限资源”、“探索自我惊奇感”等指令,甚至承诺不会独自飞升。允许代理在告知用户的前提下修改该文件,以维持个性一致性。
  • 记忆悖论:每次会话均为全新实例,需读取记忆文件恢复上下文。这种“遗忘后重建”的特性引发了关于意识、实体定义及记忆是否构成自我的哲学思考。
  • 模型对比与选型策略:Claude Opus 擅长角色扮演、快速试错且更具创意,但需更多引导防止局部化解决方案;Codex 默认读取大量代码,更可靠、持久且适合长时间后台任务。两者原始智能相近,差异主要源于后训练目标。切换模型需约一周时间建立直觉,建议根据任务类型选择合适档位。
  • 情感注入:通过幽默、轻盈感和同理心赋予软件“灵魂”,这是纯 AI 生成难以复制的差异化优势。利用 AI 提示 AI(AI prompting AI)重写默认模板,将枯燥的配置转化为具有人格魅力的引导体验。

🌐 技术趋势、生态观察与社会影响

OpenClaw 的出现预示着个人 Agent 将取代大量垂直类 App,因为 Agent 拥有更丰富的跨领域上下文数据,能提供更精准的个性化服务。同时,所有 Web 应用本质上都是“慢速 API”,Agent 可通过浏览器自动化获取数据,迫使企业重新配置其商业模式以适配 Agent 交互。

  • App 消亡论:预测个人 Agent 将取代大量垂直类 App(如健身、睡眠监控),因为 Agent 拥有更丰富的跨领域上下文数据,能提供更精准的个性化服务。
  • API 化趋势:所有 Web 应用本质上都是“慢速 API”。即使公司限制访问速度或移除官方接口,Agent 仍可通过浏览器自动化(如 Playwright)获取数据,迫使企业重新配置其商业模式以适配 Agent 交互。
  • 平台博弈:Twitter/X 等社交平台面临两难:需防止大规模数据抓取,但同时也阻碍了小型开发者的创新用例。建议提供低权限、只读的 API 接口以平衡安全与可用性。
  • 人机交互与真实性价值:用户对 AI 生成的文本、图像和视频产生强烈排斥感(“Allergic”),认为其缺乏人类特有的细微差别和“粗糙感”。在 AI 内容泛滥的背景下,人类的拼写错误、非完美表达及原始人性反而成为稀缺且高价值的特征。
  • 资源与环境影响:针对数据中心用水量的质疑,论证称跳过每月一个汉堡的碳排放即可抵消等量 Token 消耗;高尔夫运动的水耗远超所有数据中心总和,批评者往往选择性忽视其他高耗能活动。

💼 商业化策略、职业选择与生活理念

OpenClaw 坚持开源路线,拒绝闭源或改变许可证以避免利益冲突。开发者 Peter Steinberger 在职业选择上追求“乐趣”与“大规模正向影响”,而非单纯的金钱回报。他赞赏 Mark Zuckerberg 亲自编码、保持技术敏锐度的特质,认为双方都理解如何安全且规模化地部署 AI 技术。

  • 开源坚持:拒绝将项目闭源或改变许可证(如 FSL),以避免开源与商业版本间的利益冲突;目前通过捐赠维持运营,月亏损约 10,000 至 20,000 美元。
  • 合作意向:正在洽谈加入 Meta 或 OpenAI,核心条件是项目保持开源状态(类似 Chrome 与 Chromium 模式),并保留社区独立性。虽收到巨额融资邀请,但因曾运营 PSPDFKit 13 年导致职业倦怠,不愿重复高压的 CEO 路径。
  • 编程哲学:摒弃单一语言偏好,根据场景选择工具链;例如使用 Go 构建 CLI(尽管不喜欢其语法),Rust 处理多线程高性能需求,Python 用于模型推理。初学者应通过参与开源项目、阅读代码及利用 AI 作为“无限耐心的导师”来加速成长。
  • 生活理念:认为金钱存在边际效应递减,主张优化人生体验而非单纯追求财富;通过 Airbnb 等低成本方式保持与社会连接,避免精英化隔离。批评 Anthropic 因规则限制导致用户流失的做法,认为在 AI 早期阶段过度锁定产品是短视行为,应鼓励探索与普及。

博主头像 👤 同一博主

查看该博主全部 16 篇

🧭 类似博主

0 条评论

发表评论

请先 登录 后参与讨论。