DeepSeek竟然也遭遇斩杀线 | Qwen3.8-Flash Next | GLM-5.3-Fl
外来客 • 2026-08-28 10:32:50
声明:本文为对公开视频内容的摘要整理,
未经本站独立核实,可能与原视频存在出入,不代表本站立场、观点或建议;
观点与版权归原作者及原平台所有。
如涉及版权问题,请联系我们,核实后立即删除。
[ 免责声明 ]
📉 市场动态与价格战背景
- DeepSeek V4 Flash 于 8 月 17 日实施峰谷分时计费,闲时输入价格上涨约 57%,输出价格上涨约 136%,高峰时段输出价格接近旧价格的 4.7 倍。
- 涨价导致 DeepSeek 在 OpenCode 平台的日 Token 量从 18 万亿峰值跌至一半以下,空出的近 10 万亿日需求被匿名模型“OxAlpha”承接。
- 8 月 26 日晚,智谱揭晓 OxAlpha 身份为 GLM-5.3 Flash,阿里同日发布 Qwen3.8 Flash,两家几乎同时推出带“Flash”后缀的低成本模型。
- 匿名测试期间,OxAlpha 在 6 天内累计处理 44 万亿 Token,OpenRouter 过去 7 天调用量达 23.2%(2 万亿 Token),位列第一,且全部由国产芯片集群承载。
🏗️ Qwen3.8 Flash 架构与性能
- 该模型为多模态 MoE 架构,总参数 125B,每 Token 激活 6B,支持 26 万至 100 万 Token 上下文。
- 引入自研 QSA(吸收注意力)算法,通过块级重要性估计降低索引成本,在 100 万 Token 设定下预填充和解码阶段分别实现最高 7.6 倍和 4.9 倍加速。
- 采用门控残差连接,将单一残差流扩展为四条并行分支,动态决定信息读写路径,提升深层信号传递效率。
- 引入 N-gram 嵌入,增加 51B 参数但不增加每 Token 计算量,参数可存放于主机内存,通过预取与计算重叠降低显存占用。
- 训练使用 MioA 优化器,训练开销仅为前代 Qwen3.7 Plus 的约 1/9,激活参数为其 1/3,但在 Deep3 1.1 等基准上得分更高(58.7 分 vs 16.5 分)。
- 定价为每百万 Token 输入 0.8 元,输出 2.7 元,约为 Qwen3.8 Max 的 1/10,低于 DeepSeek 调价后价格。
🚀 GLM-5.3 Flash 架构与性能
- 总参数 320B,激活 18B,层数从 92 层减至 45 层,是 GLM-5 系列首个原生多模态模型。
- 采用吸收注意力与线性注意力混合架构,引入 Index Pool 压缩索引器缓存,注意力计算量降低 3.01 倍,KV 缓存大小降低 4.44 倍。
- 在 Artificial Analysis 综合智能指数中得分 57 分,与 Claude Opus 4.8 持平;编程表现与 Opus 4.8 相当。
- 定价为 GLM-5.3 的 1%,Opus 4.8 的 1%,强调“同样的智力,1% 的价格”。
- 原生多模态重点在于视觉编码,支持前端开发、游戏开发等场景,能自主判断何时观察并利用视觉反馈指导行动。
- 案例显示该模型在 Blender 中自主运行 16 小时,搭建约 400 平方米的专业主厨自宅和测试厨房。
💻 国产芯片与推理效率
- 智谱首次在大规模流量中使用国产芯片集群提供服务,通过自研高带宽互联网络连接。
- 在 SGLang 基础上构建专用推理引擎,采用激进的内存优化、节点内张量并行和混合缓存量化技术。
- 推理引擎构建由 GLM-5.3 驱动的 InfraAgent 加速,协助开发算子、诊断瓶颈,端到端服务性能提升 3 倍。
- 硬件效率和单 Token 成本达到与主流 NVIDIA GPU 相当的水平。
- 2026 年超大规模云厂商推理资本开支首次超过训练开支,核心矛盾转为内存带宽与通信延迟。
💰 成本竞争与行业趋势
- DeepSeek 在缓存命中价格上仍具优势,闲时约 0.007 美元/百万 Token,高峰约 0.014 美元。
- GLM-5.3 Flash 五折后缓存输入价格约 0.015 美元,Qwen 与 GLM 在新输入输出占比高时更具价格优势。
- 2025 年 1 月 DeepSeek R1 发布曾导致 NVIDIA 单日暴跌 17%,但 2026 年 4 月 V4 发布后 NVIDIA 收涨 4.3%,表明更便宜的模型可能激发更多推理需求。
- 竞争核心从提升智能水平转变为用最低成本交付足够强的智能,架构优化成为压低成本的关键。
👤 同一博主
AI颠覆世界的速度比想象中慢 | 萨姆·奥特曼 | OpenAI | 通用人工智能 | GPT |
AI时代结账页面将消失 | Stripe Will Gaybrick | AI agent | 人工
OpenAI自研芯片力压英伟达 | Jalapeño | 英伟达Blackwell | Vera R
前Uber CEO八年蛰伏欲重构工业AI | Travis Kalanick | Industria
大语言模型并非终局 | Rich Sutton | 强化学习 | 大语言模型 | 持续学习 | 合成
Cerebras CS-4:性能翻倍 | WSE-3晶圆级引擎 | AI推理芯片 | 内存带宽 |
硅谷口水战,AI十年内能治愈所有疾病么?| Dario Amodei | 癌症治疗 | AI药物研发
英伟达的新护城河 | 黄仁勋 | OpenAI | 人工智能 | AI算力 | 数据中心 | GPU
Cursor推出代码托管平台Origin | GitHub | AI编程 | AI Agent |
智能的基石与未来 | 李飞飞 | 安德鲁·休伯曼 | ImageNet | 计算机视觉 | 空间智能
🧭 类似博主
0 条评论
发表评论
请先 登录 后参与讨论。