千问3.8 Flash Next开源模型本地部署视频教程

文章摘要:千问3.8 Flash Next是阿里巴巴最新开源的多模态MOE混合架构大模型,拥有1250亿总参数但每个token仅激活60亿,原生支持26.2万上下文(可扩展至百万token)。最令人震惊的是,它支持CPU统一内存配置,低显存用户可用硬盘补充,成功在24G显存+2T硬盘环境跑出10 token/s的速度。本文提供完整的本地部署教程:从GGUF量化模型下载(三个分卷)、llama.cpp配置到一键启动脚本运行,全程手把手教学。

Qwen3.8-Flash-Next开源模型视频教程

实测展示了跑酷游戏生成(一次性完成)、与Gemini 3.5 Flash/GPT 4.5 Pro/Claude 3.5 Sonnet的多维度对比,以及MacBook Pro 60GB内存运行效果。在3D建模、光照渲染、Agent任务等场景中,千问3.8 Flash Next均表现出色,是当前本地可运行的顶级开源模型之一。

一、开篇:千问3.8 Flash Next正式开源

啊,大家好,这里是零度解说。就在昨天,千问3.8 Flash Next正式开源发布,1250亿参数的AI大模型,现在居然可以在本地电脑上进行部署运行。它是一个多模态的MOE混合架构模型,每个token实际只激活60亿参数,是千问最新的下一代架构,也就是千问四。它原生支持26.2万上下文,扩展以后甚至可以达到百万token。

更夸张的是,低显存用户可以用硬盘来凑,甚至有人用3090 MacBook Pro来进行运行。而它真正厉害的地方,还不只是能跑,无论是代码推理能力,它的Agent性能都非常强悍。比如把它跟Claude 3.5 Sonnet还有GPT 4.5放在一起盲测,都达到了意想不到的效果。

那么问题来了,一个1250亿参数的开源模型,到底能跑出什么效果?今天我们就直接通过一系列真实案例,带您看看这个千问3.8 Flash Next模型到底有多离谱。

目前它的GGUF格式的模型已经同步发布,多个量化版已经同步发布在Hugging Face开源社区。因为千问3.8 Flash Next模型,它支持CPU统一内存配置,以实现接近虚拟内存的速度。也就意味着内存不够,我们可以用硬盘来凑。

二、第一步:下载模型文件

接下来我们进行本地安装部署。在开始之前,首先我们去下载最新开源的千问3.8 Flash Next模型。到时候跟我一样打开零度博客上这篇文章,链接会放在视频下方。打开以后往下拉,上面有我们所需的全部资料。

首先第一步,我们先把这个千问3.8 Flash Next模型给down下来。我们点前往打开它,来进行下载一下。好,打开以后,它里面有多个量化模型,到时候你可以根据自己显存或硬盘大小来进行选择,比如就选择Q4版本。这里面有三个模型文件,我们给down下来,我们给它放桌面上。

好,下载好以后,那么第二个,全部都给它放到桌面上。最近好多人问这个下载器啊,这是一款IDM多线程下载器,下载大文件、大模型,速度超快。好,下载好第二个模型分卷以后,那先返回去来下载第三个模型分卷,同样给它放到桌面上。点击下载。等一下,我们稍等一会儿,它现在速度可以跑到将近每秒一百兆左右了,几乎已经跑满Hugging Face的下载速度了。

Qwen3.8-Flash-Next开源模型本地部署流程示意图

三、第二步:下载llama.cpp与一键启动脚本

好,下载好模型文件以后,那先重新返回到刚才帖子下,来执行第二步,就来获取一下最新版本的llama.cpp这款开源项目,我们点前往,点击下载一下。我们需要用它来加载模型。然后打开以后,那么点击下方最新版本。目前最新版本是b1.3。那么打开它,点击下载一下。

打开以后,然后再往下拉,来获取对应版本。比如第一个是MacOS版本,还有Linux和Windows版本。到时候根据情况去选择就可以了。比如我这里选择Windows版本,因为我是N卡的,所以就选择CUDA版本。但如果你是A卡的话,那你就选择Vulkan版本。这里选择CUDA 13版本。这里需要注意一下是这两个文件都要下载。前面这个主程序,后面是显卡驱动文件,这两个都要下载。我给它下载下来。比如先给它下载,给它放到桌面上,点下载。好,下载好第一个文件以后,那把驱动文件给它down下来,同样给它放到桌面上。

好,下载好以后,那就给关闭掉。那现在给解压出来。然后第二个压缩包,全部给解压出来。好,解压好以后,然后把这两个给删掉。先把这llama.cpp主程序,我们给重命名一下。我们就给它重命名为llama.cpp。好,重命名好以后,然后把这个驱动文件给它放进去,放到这个llama.cpp根目录下,拖上去就可以了。

好,放入好以后,先打开它。现在我们需要在根目录下来创建一个新的文件夹。我们需要新建一个models文件夹。好,新建好以后,先打开它。把我们刚才下载好的这个模型文件给它放进来。这三个模型文件都可以放进去就可以了。

四、第三步:启动llama.cpp并实测

好,放入好以后,现在重新返回到刚才帖子下,来执行第三步,就来获取一下这个一键启动脚本。我们给down下来。好,下载好以后,这里面参数你可以自由调整。尤其上面这个模型,如果你下载的模型跟我不一样的话,那么应该把这模型名称改成自己的。因为我当前模型名称是这个,也就是“千问3.8 Flash Next GGUF Q4_K_M”这个分卷,然后后面跟上分卷一、二、三,它就会加载这三个分卷模型。然后其他参数的话,你可以自由调整。

现在我们试一下。然后把这个启动脚本给它放进去,放到llama.cpp根目录下。放了以后,我们先打开它。点击打开,然后它开始加载模型的,我们稍等一会儿。好,大家看到这个链接的话,那说明它已经启动成功了。那我们打开试一下,打开这地址,打开浏览器,然后打开这个地址来试一下。哎,可以啊,没问题啊,它现在也成功了。目前加载模型的话是千问3.8 Flash Next的GGUF Q4量化版,没问题。

那我们先试一下,看行不行啊。首先我输入说你好,请自我介绍一下。输入好以后,直接发送一下,看一下能不能跑得动啊。我当前显存是24G的,内存的话是64G的,但我硬盘比较大,是2T的,绝对是没问题的。因为目前它是跑在我们硬盘上的。来看一下它速度,目前可以跑将近每秒10个token左右。

那现在我跑一个任务,比如现在我让它帮我编写一个跑酷游戏,试一下效果,发送一下。好,这样的话它就开始了,我们稍等一会儿。当前速度的话同样是每秒将近11个token左右,这个过程可能需要几分钟到几十分钟。

那现在来看一下我当前硬件占用,我当前内存是64G的,几乎已经跑满了,占用率百分之九十左右。然后CPU的话,占用率大概是百分之七十左右。那现在不开显存,几乎已经占满了,24G的显存几乎已经跑了将近百分之九十五左右了。因为当前是通过MMAP让模型权重跑在这个硬盘上的,所以虽然模型权重超过了我们显存,但它仍然可以跑。

等它完成以后,来试一下效果,看一下能否正常运行啊。我们点开始奔跑。哎呦,这的,哎,没吃到。这个积分系统没问题吧?哎,我怎么都吃不到的?哎,不,越来越快了。哎呦,哦,撞死了,我靠!再来一次啊。它越来越快了!我靠,我靠,你们越来越快了!哎,撞死了,行行行,可以的,没问题啊。这个游戏是可以正常运行的,这个代码它一次性搞定,还是非常不错的。

Qwen3.8-Flash-Next与国内外顶尖模型对比

五、更多实测与对比

不得不说啊,这个千问3.8 Flash Next的表现确实很强。现在本地AI模型发展的太快了,过去只能靠云端API的能力,现如今在家就能跑,模型更强,推理更快。可以说现在正是玩本地AI的黄金时期。

比如这个千问3.8 Flash Next,一个提示,让他自己做了一个完整的射击游戏。重点是整个过程没有继续提示,也没有盯着它看,它完全是自己截图检查游戏结果,然后发现哪里不对就自己修改,甚至连光影都自己调好了。整个过程跑了将近五个小时,读取了七千万个缓冲token,最终输出token数量将近是四十三万个,最终做出游戏效果非常不错。

在MacBook Pro上也可以运行。它是在60GB内存的Mac上运行的一比特的千问3.8 Flash Next模型,速度可以达到将近每秒30个token左右。它运行了一个八分钟的代理循环,包括六次网络搜索、三次API调用和五个来源表格,都可以一次性搞定。

现在看一下最新开源的千问3.8 Flash Next和这个Gemini 3.5 Flash进行对比。在相同提示之下,相同的数据解释任务,两者分别生成了一个可以完整操控的飞行游戏。很明显,千问3.8 Flash Next模型生成效果确实更好。

同时把它跟这个Opus 4.5进行对比。同样提示:用鼠标拖拽做一个可控的3D风扇模型,白色背景,保证模型清晰可见。这个测试其实挺难的,因为它不只是写代码,还得同时搞定3D建模、动画、镜头交互,还有整体视觉效果。虽然千问3.8 Flash Next它是一个1250亿参数的混合架构模型,但是每个token实际上只激活60亿参数。大家看一下两者生成效果,几乎是没有太大的差距。

同时拿它跟之前发布的千问3.8 27B模型进行对比,在使用相同的Q8量化版模型下,同时关闭了推理。千问3.8 27B模型它专注技术方面,在计算物理、行星几何、月球轨道等方面设计会更加精准。但千问3.8 Flash Next模型,它更专注于体验方面。它可以生成更好的光照和对比度,还有像是大气光晕、电影化结构,以及有策略的叠加层,同时更能精准地遵循相机指令。所以在视觉效果上,明显Flash Next模型更胜一筹。

同学们,再来看这个对比。上面分别是Claude 3.5 Sonnet、GPT 4.5 Pro、GLM 5.3 Flash,还有千问3.8 Flash Next。如果我没告诉你答案,你能猜出是哪个模型生成的吗?

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

本站所有资源版权均属于原作者所有,这里所提供资源均只能用于参考学习用,请勿直接商用。若由于商用引起版权纠纷,一切责任均由使用者承担。更多说明请参考 VIP介绍。

最常见的情况是下载不完整: 可对比下载完压缩包的与网盘上的容量,若小于网盘提示的容量则是这个原因。这是浏览器下载的bug,建议用百度网盘软件或迅雷下载。 若排除这种情况,可在对应资源底部留言,或联络我们。

对于会员专享、整站源码、程序插件、网站模板、网页模版等类型的素材,文章内用于介绍的图片通常并不包含在对应可供下载素材包内。这些相关商业图片需另外购买,且本站不负责(也没有办法)找到出处。 同样地一些字体文件也是这种情况,但部分素材会在素材包内有一份字体下载链接清单。

如果您已经成功付款但是网站没有弹出成功提示,请联系站长提供付款信息为您处理

源码素材属于虚拟商品,具有可复制性,可传播性,一旦授予,不接受任何形式的退款、换货要求。请您在购买获取之前确认好 是您所需要的资源