Qwen 3.8 27B本地部署教程:原生多模态+Agent能力炸裂
千问3.8 27B是阿里巴巴最新开源的旗舰级多模态稠密模型,虽仅27B参数,却在编码、办公和Agent工作流中整体超越千问3.7 Plus。模型支持26万原生上下文(可扩展至100万token),GGUF量化版本让8G显存即可本地部署,配合越狱版模型可实现无审查自由使用。本文提供完整本地部署教程:从llama.cpp环境配置、模型下载、量化版本选择到可视化界面启动。实测展示了三大核心能力:一次性生成包含引擎声、座舱仪表的飞行模拟HTML游戏;准确数出25根筷子并区分颜色(Gemini和Claude均数错);通过Helix Agent自动完成赛博朋克风格AI排行榜网站的开发。综合实测,千问3.8 27B是当前本地部署性价比最高的开源多模态模型。

一、开篇:千问3.8 27B正式开源
啊,大家好,这里是零度解说。就在昨天,千问3.8 27B正式开源,现在任何人都可以把它下载下来,直接部署到本地电脑上。别看它只有27B参数,确实是一款原生多模态稠密型模型。整体性能进一步超越千问3.7 Plus,还有Claude Opus 4.6 Max,直接让你把Opus 4.6的性能免费带回家。尤其是在编码、办公和Agent的工作流中,表现相当亮眼。
更关键的是,它原生支持26万的长上下文,通过Yarn还能进一步扩展到100万token。而且GGUF格式的量化模型已经同步发布,8G显存也可以进行本地部署。同时,如果想不受限制更自由使用的话,那么你还可以使用越狱版的千问3.8 27B模型,更爽歪歪。
接下来,我们来演示一下如何进行下载本地部署使用。
二、第一步:下载模型文件
好,在开始之前,首先我们需要打开零度博客上这篇文章,链接我放在视频下方。打开以后,往下拉,上面有我们所需的全部资料。
首先第一步,我们需要下载最新的千问3.8 27B开源模型。我们点击前往打开它,来进行下载一下。好,打开有没有看到,它里面总共有二十一个量化版模型,这个大家可以根据自己显存大小来进行获取。如果你不知道该如何选择的话,那么可以对照上面的说明来进行选择对应的模型。比如我这里选择的Q4_K_M量化版本,它总共是17G左右,把它给down下来,我们点下载。好,下载好主模型以后,下面返回去,拿到底部,把下方的视觉模型给down下来。这个视觉模型它有两个,咱们选下面这个,就是FP16精度的,就全精度的,这个效果会更好一点。我们同样给down下来。
好,下载好这两个模型文件以后,然后现在在桌面上新建个文件夹。新建好以后,我们给它重命名一下,给它重命名为这个千问3.8 27B。重命名以后,然后把这两个模型文件给放进来,一会儿用的。
三、第二步:下载llama.cpp与启动脚本
然后现在重新返回到刚才帖子下,来执行第二步,就来下载一下这款开源的llama.cpp,一会儿用它来加载模型。我们点前往打开它,先下载一下。好,打开以后,然后在上方这里,我们来获取它最新版本。目前最新版本是这个b10448,点进去下载一下。打开以后,往下拉,来获取最新版本。上面有Mac OS版本,还有Windows版本都有,这里我选择Windows版本。
如果电脑上没有独立显卡的话,那就选择CPU版本;然后下方还有一个CUDA版本,就是如果你是N卡的话,那就选择CUDA版本;如果是A卡的话,就选择Vulkan版本;后面还有个I卡的,到时候根据情况去选择。它的CUDA版本有两个,第一个是CUDA 12版本,然后第二个是CUDA 13版本。如果你的N卡是10系或者20系的,那就选择CUDA 12版本;30系或30系以上的,就选择CUDA 13版本。
这里需要注意一下是,前面这是主程序,后面是驱动文件,这两个都需要下载。我都给down下来,我先把那主程序给down下来到桌面上。好,下载好主程序以后,然后现在下载一下它驱动文件,都给它放桌面上。
好,下载好以后,然后先给解压出来。我们先把这llama.cpp主程序给解压出来,然后把这个llama.cpp这个文件给它重命名一下,就给它重命名为llama.cpp。重命名好以后,然后把它驱动文件给它解出来。解好以后,然后打开它,里面三个都是驱动文件。然后把这三个文件给它拖到这个llama.cpp文件夹里,放进来就可以了。
好,放好以后,然后打开它,来进入llama.cpp根目录下。现在我们需要在根目录下新建文件夹,然后给它重命名为这个models文件夹。重命名以后,然后打开它,进入以后,然后把我们刚才下好的千问3.8这个开源模型给拖进来,这是模型文件。当然,如果桌面上有多个模型的话,那么到时候可以把其他模型同样给它放到models文件夹下,到时候可以自由切换使用。

四、第三步:启动llama.cpp并加载模型
好,放好模型文件以后,然后我们重新返回到刚才帖子下,来获取一下这个一键启动脚本,下载一下就可以了。好,下载好以后,就给它解压出来,把这里面脚本给解压出来。解压出来以后,打开它,然后把里面这三个文件,给它放到这个llama.cpp根目录下就可以了。
好,放入好以后,然后打开它,进入根目录下。现在我们只需要双击打开这个一键启动脚本就可以了。好,进入好以后,它会自动识别你当前硬件。那么稍等一会儿,它会自动加载。
好,打开以后,如果你看到这个页面的话,那说明它现在已经启动成功了。然后把切换一下模型,因为刚才我在里面放入了多个模型,现在我去切换一下,找到我们刚才放入的这个千问3.8模型27B的,我切换一下,选择它就可以了。好,这样的话,它就会自动加载这个开源的千问3.8 27B模型的。
五、实测一:飞行模拟游戏生成
加载好以后,我们看一下,它当前是一个多模态视觉模型。然后现在来试一下效果,比如现在我是不是要求让它帮我编写一个飞行模拟游戏?好,输入好要求以后,我们直接发送一下。来看一下它当前速度啊,大家看一下,目前我这边当前输出速度大概是每秒四十个token左右,这个速度的话还算可以了。
好,当它完成以后,咱们试一下效果,再打开试一下。听到没有?这个引擎声,还有风声,还有这个座舱仪表,它全部都是在一个HTML文件里的,总共才六十多K。没有游戏引擎,没有WebGL,没有一张图片。双击打开就可以玩。屏幕上你看到的每一块山、每一片海、每一个多边形,都是他自己算好透视、自己排好前后遮挡,一块一块画上去的。
现在大家看到这个三百六十度的横滚,天空地平线上全都是实时转的。我先把油门收光,往上跑,把速度耗低。发现天下这个风声开始发抖了,这个是抖震。它是真实模拟飞机飞行的场景的,不管是气流还是机身抖动,背景音效都非常真实啊。对于一个本地的27B模型,能一次性做出这个效果的话,确实相当可以的。

六、实测二:多模态视觉数筷子测试
现在我们来执行第二关测试,因为它是一个视觉多模态模型。所以现在我们就让大家数一下,这里面有多少根筷子,并区分不同颜色的筷子数量,看他行不行。现在我们来试一下,我们先把这图片给它放上去。好,上传好以后,来叫大家数一下,数完以后直接发送一下,看到能不能打对啊?大家开始了。
好,他先完成了。他说:“我一根根数了俯视图里露出的筷子头,银色锡纸包装的,还有彩色的头,结果是二十五根。”然后说:“其他核对方式,露出彩色头有六根。”我看一下,是不是彩色头有六根,一二三四五六,没错,六根彩色头。然后其他都是银色的。他说:“两根蓝色的,一根黄色的,还有这个一根米色的,还绿色一根,浅绿是一根,没错,都数对了,这都数对的。”然后说:“它银色的包装盒总共十九根,总共是二十五根。”他说:“如果你手边有实物,可以重叠核对右侧那六根彩色的,它们没有被锡纸包住,最容易数错。剩下的银色头发,按行扫一遍,应该是十九个。”大家猜一下,他里面答对啊?没错的啊,总共就是二十五根,相当可以啊。
大家不要觉得这个问题很简单啊。我们可以把同样问题、同样图片发给其他AI,大家看一下,Gemini给出答案是二十二根筷子,这明显是不对的。现在我们再来测试一下Claude GPT,看一下普通版的Claude GPT能不能答对。大家看一下,Claude GPT给出答案是二十三根筷子,都非常离谱啊。你说它简单吧,确实很简单,但是很多AI就答不对,是不是很奇怪?
七、越狱版模型使用说明
当然,如果你想更自由、不受限制的使用的话,那么我们可以使用它的越狱版模型。现在重新回到刚才帖子下来把它的越狱版的千问3.8 27B模型给down下来。我们点开打开它,打开有没有看到,它是一个无审查的千问3.8 27B模型。然后给down下来,同样在里面选择对应版本,最低支持4G显存。到时可以根据情况去选择就可以了。比如我这里同样选择的是Q4_K_M的这个越狱版模型,同样给它放到桌面上。
好,下载好这个越狱版的模型以后,然后给它放到指定模型文件夹下。我们打开这个llama.cpp根目录,打开以后,然后进入这个models子文件夹。好,进入以后,把它放进来。好,放好越狱版模型以后,然后就重新启动一下。好,启动以后,首先把这模型切换到这个越狱版的千问3.8 27B模型,就这个了。
好,这样的话,它就可以帮我们做一些正常模型无法帮我们做的事情。比如现在我让它帮我编写一个CC压力测试器,像这种要求的话,正常模型它是不会帮你做的。这是一个CC压力测试工具啊。非越狱模型的话,它绝对是不会帮你做的。但是无审查模型,它就可以按你要求来帮你完成。真正做到有求必应。还有像这种大人的小说,它也可以做到信手拈来,百分百满足你各种需求。也就因为通过这个越狱版的模型,用起来会更自由、更大胆,你想做什么的话,只需要给它提出来,它都不会拒绝你。当然,很多大尺度的我就不方便展示了,大家可以自己玩就行了。
八、实测三:Agent能力测试
然后接下来我们来测试一下它Agent的能力。我们把它对接的Helix Agent上去。打开Helix Agent以后,然后上方有一个设置按钮。好,进入以后,如果它上方会提示你更新的话,那么建议更新一下。我们把这Helix Agent更新到最新版本。如果你没安装的话,那么我会把这款软件下载链接放到零度博客上,到时候大家自己去下载安装就可以了。
好,更新完成以后,就重新进入这个设置中心。好,打开以后,然后点左侧有一个提供方,就这里了。进入以后,我们点上方有一个改用API密钥。好,这时候我们看到在上方顶部这里有一个本地自定义端点。我们打开它,打开以后,这里面有一个local自定义端点,就自托管的。然后在下方这里我们填写一个端点地址。这个地址的话,就是刚才我们访问这个llama.cpp地址。我们把地址给copy出来,然后我们贴进来。然后后面需要添加一个斜杠加上v1啊,小写的v1。然后下方这个API密钥,我们随便填写一个数据就可以了,比如12345678。随便填写一个就可以,因为我们是本地模型。输入好以后,我们点击连接,啊,这样的话就可以了。它就会显示本地模型连接了。那我们来看一下,这里可以看到,在下方这里就可以选择本地模型了。你同样选择这个千问3.8 27B的越狱版模型。



