博主头像

[首发测试]独立NPU+24GB专用推理内存,零刻SEi14迷你主机AI性能实测:独立NPU算力卡性

外来客 • 2026-08-16 11:49:34

分享
𝕏 f
声明:本文为对公开视频内容的摘要整理, 未经本站独立核实,可能与原视频存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

📋 核心观点

  • 零刻 SEi14 搭载独立 NPU 算力卡,实现本地 AI 推理与日常办公并行,CPU 和系统内存占用极低。
  • 该方案性能仅次于 AMD AI Max 395,但价格约为其一半,适合家用或小型团队在有限预算下获取本地 AI 算力。
  • 独立 NPU 与专用推理内存构成第二套计算资源,解决了传统 X86 方案跑大模型时系统资源被占满、无法处理其他任务的问题。

📊 关键事实与论据

  • 硬件配置:Intel Ultra 9 185H 处理器,32GB 内存,1TB 硬盘;外挂 NPU 算力卡拥有 24GB 专用推理内存(3 颗 8GB LPDDR5 颗粒),带宽 153.6GB/s,算力 160 TOPS / 100 TFLOPS。
  • 性能测试
  • Qwen 3.5 9B 模型:约 18.19 Token/s。
  • DeepSeek R1 8B 模型:约 19.45 Token/s。
  • Qwen 3 8B 模型:约 16.4 Token/s。
  • 连续运行近 1 小时,NPU 最高温度约 50 度,整机功耗约 60W,NPU 功耗约 15W。
  • 散热与噪音:距离 30 厘米处噪音约 31 分贝,接近环境噪音;停止运行后 NPU 温度在 50 秒内从近 50 度降至 36 度左右。
  • 软件生态:内置 Llama.app 及 NPU 推理架构,支持 OpenCloud 调用;官网提供模型下载、驱动安装及多模型路由模式教程。
  • 兼容性注意:OpenCloud 建议使用内置 V2026.6.11 版本,避免使用最新 7.1-2 版本(存在 VLLM 本地模型调用 Bug);切换模型时建议添加参数以自动卸载旧模型,防止推理内存不足。

💡 结论与建议

  • 适用人群:追求本地 AI 隐私安全、希望摆脱 Token 费用焦虑、且预算有限的个人用户或小型团队。
  • 优势总结:双计算资源各司其职,AI 任务交给 NPU,日常任务由 CPU 处理,互不干扰;散热优秀,静音效果佳。
  • 操作建议
  • 初始化时需右键授权运行 Llama 及 NPU 驱动。
  • 多模型切换时,若未设置自动卸载参数,需手动卸载旧模型后再加载新模型。
  • 遇到模型加载失败,需检查推理框架、NPU 固件及驱动的兼容性并更新。
  • 利用 OpenCloud 可实现办公自动化,如数据汇总、文件整理及简单代码编写与调试。

博主头像 👤 同一博主

🧭 类似博主

0 条评论

发表评论

请先 登录 后参与讨论。