Qwen3.8-Flash-Next正式开源发布 本地部署教程

Qwen3.8-Flash-Next正式开源发布 本地部署教程

Qwen3.8-Flash-Next 原生支持 262K Token 上下文,通过 YaRN 扩展后最高可达到 100 万 Token,并且在编码、Agent、办公和多模态任务上展现出了非常强的性能,本地部署也可玩.

Qwen3.8-Flash-Next 的本地运行能力相当惊人。有人使用单张 RTX 4090 24GB 跑出了约 21 Token/s 的解码速度,也有人通过 CPU Offload 在 RTX 3090 24GB 上运行,并完成长时间的自主 Agent 任务;在 Apple Silicon 平台上,它同样可以借助 MLX 等方案运行。此外,Qwen3.8-Flash-Next 在代码生成、Three.js、游戏开发以及自主编程 Agent 等场景中的表现也非常亮眼

本地部署:

一、Qwen3.8-Flash-Next 开源模型

Qwen3.8-Flash-Next 开源模型已经发布在国外开源社区,而且不同尺寸的GGUF格式的量化模型已经同步公布,现在我们可以通过下方的链接来进行下载获取最新模型。

1、Huggingface下载:【点击前往

2、国内网盘下载:【点击前往

3、备用高速下载:【点击前往

二、下载最新版 Llama.cpp

   llama.cpp是在本地或云端,以最小的设置和最先进的性能,在各种硬件上实现 LLM(和 VLM)推理。

  • 纯 C/C++ 实现,没有任何依赖项
  • 苹果芯片是一流产品——通过 ARM NEON、Accelerate 和 Metal 框架进行了优化。
  • 支持 x86 架构的 AVX、AVX2、AVX512 和 AMX 指令集
  • 对 RISC-V 架构的 RVV、ZVFH、ZFH、ZICBOP 和 ZIHINTPAUSE 支持
  • 支持 1.5 位、2 位、3 位、4 位、5 位、6 位和 8 位整数量化,以加快推理速度并减少内存占用。
  • 用于在 NVIDIA GPU 上运行 LLM 的自定义 CUDA 内核(通过 HIP 支持 AMD GPU,通过 MUSA 支持 Moore Threads GPU)
  • Vulkan 和 SYCL 后端支持
  • CPU+GPU混合推理,可部分加速大于总显存容量的模型。

llama.cpp 最新版下载方式:

1、Github社区: 【点击前往

2、网盘下载 :【点击前往

下载后将其解压出来,并在根目录下创建新的文件夹 models,然后在第一步下载的模型文件,多个分卷的gguf格式的文件,都放入llama.cpp 根目录下的models 文件夹下,以备接下来使用。

三、一键启动脚本:

1、国内网盘:【点击下载

2、国外网盘:【点击下载

将一键启动脚本解压后放入llama.cpp的根目录,双击打开启动即可,启动后你会看到下方这个界面

Qwen3.8-Flash-Next正式开源发布 本地部署教程

然后在浏览器上打开本地访问地址:http://127.0.0.1:8080 就可以正常启动并加载模型了

Qwen3.8-Flash-Next正式开源发布 本地部署教程

虽然我的显存明显不够,但是脚本是通过mmap 从硬盘边读边跑模型的,速度还算可以,居然可以跑到 12t/s 左右,这确实有点出乎意料!为了降低硬件的负担,并减少等待时间,我在脚本里关闭了模型的思考模式

Qwen3.8-Flash-Next正式开源发布 本地部署教程

原创文章,作者:AI下载网站,如若转载,请注明出处:https://www.qidm.com/Ai/33

(0)
AI下载网站AI下载网站
SpaceXAI正式发布 Grok 4.6 安装教程 支持免费试用
上一篇 2026年8月21日 下午10:50
2026 AI初学者 九步学习路径图
下一篇 2026年8月29日 下午2:51

相关推荐

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注