博主头像

阿里除夕开源千问3.5,原生多模态,全网第一手实测

外来客 • 2026-08-19 23:02:33

分享
𝕏 f
声明:本文为对公开视频内容的摘要整理, 未经本站独立核实,可能与原视频存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

📢 核心观点

  • 阿里在除夕当天开源了新一代多模态大模型千问3.5,主打极致稀疏的MoE架构与原生多模态能力。
  • 该模型在编程速度、视觉智能体操作、长视频理解及3D代码生成方面表现突出,性能与千问3基座持平但吞吐量提升显著。
  • 千问3.5支持201种语言,坚持开源全尺寸模型,采用Apache协议,API价格极具竞争力。

📊 关键事实与论据

  • 架构参数:开源版本为397B A17B,总参数量3970亿,激活参数仅170亿,属于极致稀疏MoE架构。
  • 多模态突破:支持原生多模态,在文本和视觉混合数据上联合学习,不依赖编码器,可实现像素级精确定位。
  • 编程效率:在256K长上下文下,解码吞吐量激增19倍;实测中26.1秒完成Agent代码编写,速度极快。
  • Agent能力:通过视觉识别自动化操作电脑,如删除回收站文件、使用VSCode提交代码至GitHub,任务执行精准且无报错。
  • 视频理解:能理解长达两小时的视频,精准定位事故时间(1分14秒)及足球比赛开球时间(1分59秒),并识别地点(南非德班)。
  • 代码生成:使用Three.js复刻金门大桥3D模型,交付770行代码,效果媲美一线大模型;还能用HTML复刻坦克大战游戏。
  • 语言支持:支持语言数量从119种跃升至201种。
  • 成本优势:阿里云百炼平台每百万token输入低至0.8元,是GPT-5.2的1/15,Gemini 3 Pro的1/18。

💡 结论

  • 千问3.5凭借原生多模态和高效推理,在视觉智能体和复杂任务自动化方面展现出强大潜力。
  • 其开源策略和低廉的API成本,使其成为开发者部署本地模型或调用云端服务的优选方案。
  • 模型在保持高性能的同时,显著提升了推理速度,适合对实时性和多模态交互有高要求的应用场景。

博主头像 👤 同一博主

查看该博主全部 51 篇

🧭 类似博主

0 条评论

发表评论

请先 登录 后参与讨论。