Muse Glimmer 30B开源模型本地部署Agent工具调用视频教程
Meta最新开源的Muse Glimmer 30B模型,是一款专为Agent工作流、工具调用和多步骤任务执行优化的开源大模型。虽然只有300亿参数,但其MCP Atlas工具调用能力达到75.5分,明显超越千问3.2-72B(62.5分);深度搜索问答评分74.6分,性能表现极为出色。社区已提供GGUF量化版本,最低约10G显存即可本地部署,配合投机加速技术,输出速度可达每秒90 token,比无加速状态提升一倍以上。

本文提供了完整的Windows本地部署教程,涵盖llama.cpp配置、量化模型下载、投机加速开启等步骤。实测演示了Agent自动整理下载文件夹(130个文件,7大类智能分类)、根据图片生成跑酷游戏HTML代码等场景。在相同提示词下与DeepSeek V4 Flash 2840亿参数模型的对比中,Muse Glimmer 30B输出质量难分伯仲,证明其极高的性价比,是本地部署Agent场景的最佳选择。
一、开篇:Agent工具调用能力最强的30B开源模型
啊,大家好,这里是零度解说。如果你最近在找一款适合本地部署,而且Agent的工具调用能力都很强的开源模型,那么Meta昨天刚刚发布的Muse Glimmer 30B模型千万别错过,因为它是目前在30B级别里Agent的工具调用能力极强的开源模型。
它不是一款单纯用来聊天、写代码的普通大模型,而是它从一开始就是针对Agent的工作流、工具调用、多步骤任务和自主执行进行优化的。而且最关键的是,它只有300亿参数。但是在实际测试中,它的MCP Atlas,也就是工具调用能力达到了75.5分,明显超过了千问3.2-72B的62.5分。而且在Deep社区QA,也就是深度搜索和问答方面,它的评分达到了74.6分。
也就是说,如果你关注的不是单纯的聊天能力,而是让AI自己调用工具、执行代码、完成复杂任务,那么这个模型肯定是你的首选。
更重要的是,社区它已经提供了这个GGUF量化版本,最低量化版的模型甚至只有10G左右,也就意味着,哪怕你只有8到10G左右的显存,都能进行本地部署运行。而且在投机加速的帮助下,它的输出速度可以提升两倍以上。
然后,接下来我们就来说一下如何进行本地部署,并实测一下,看看它的表现到底如何。
二、第一步:下载模型文件与llama.cpp
在开始之前,首先我们需要打开零度博客上这篇文章,这个链接会放到视频下方。打开以后再往下拉,上面有我们所需的全部资料。
首先第一步,我们现在下载这个最新开源的30B模型,我们点开它。打开以后,这个是它GGUF格式的量化版本,到时大家可以根据显存大小进行选择。有30多G的,有20多G的,也有十几G的都有。如果需要满血版本的话,那就选择BF16精度的。最后就选择Q4量化版本,它大小是将近15.9G左右,然后先给它down下来,点击下载,给它下载到本地。
好,下载好以后,然后先返回来。然后我们需要下载它的投机加速模型,就这个了,到这也给它down下来就行了。下载好以后,再返回来,需要把它多模态模型给down下来,就这个mmprog开头的,给down下来。
好,下载好这三个模型文件以后,然后我们在桌面上新建一个文件夹。好,新建好以后,我们改重命名一下,重命名为这个Muse Glimmer 30B。好,重命名好以后,然后把三个模型文件给放进来。好,这样的话,这个模型文件我们下载好了。
然后先返回到刚才帖子下,来获取最新版本的llama.cpp。用它来加载模型是最方便的,我们点开先下载一下。好,打开以后,我们在上方这里,我们选它最新版本。最新版本是b10362,然后点开它,来先下载一下。打开以后,往下拉,在下方这里来选对应版本。上方有Mac OS版本,还有Linux、Android、Windows,这我们选择Windows版本,因为电脑是Windows系统啊。然后在下方这里,它有多个版本选择。第一个是纯CPU解码的,如果电脑上没有独立显卡的话,那就选CPU的。然后下方还有这CUDA版本,如果是10系显卡或者20系显卡,那就选择CUDA 12;30系以上的话,就选择CUDA 13版本。大家如果也是A卡的话,那就选择Vulkan版本。如果也是I卡的话,就选择SYCL。因为我是N卡,所以就选择CUDA版本,我就选择CUDA 13。
这里需要注意的是,这CUDA版本的话,前面这是主程序,后面是它的驱动,这两个压缩包都需要给它down下来。如果嫌麻烦的话,那么可以在Linux上下载一键装包,里面已经配置好环境的。

三、第二步:配置llama.cpp与启动脚本
好,下载好以后,然后先把这llama.cpp的主程序解压出来,我就给它放到桌面上了。然后把名字给它重命名为llama.cpp。好,重命名好以后,再把它CUDA驱动解压出来。解压好以后,大家看一下,里面有三个这个驱动文件。然后把这三个驱动文件给它放到这个llama.cpp这个根目录下,给它放进来就可以了。
好,放入好以后,我们先打开它,来进入到根目录下。然后在根目录下新建一个文件夹。新建好以后,重命名下给它命名为models。好,重命名好以后,我们打开它,打开以后,然后把我们刚才在第一步下载好的模型文件给它放进来,就是文件夹,就这个Muse Glimmer 30B这个文件夹里面放了我刚才下载好的这三个模型文件。
好,放入好以后,然后我们返回到刚才帖子下,来获取这个一键启动脚本。我们点开它,来下载一下。好,下载好以后,然后给它解压出来。解压出来以后打开它,来进入根目录下,总共有这三个文件。然后把这四个文件给它放到这个llama.cpp根目录下,给它放进来,放到刚才这个llama.cpp这个文件夹里面。
好,放好以后,我们打开看一下,在根目录下就可以看到这个启动脚本了。现在我们直接双击打开这个启动脚本就可以了。我们打开它,好,打开以后可以看到它就会出现这个一键启动脚本了。
它会自动识别你当前显卡、显存、还有内存以及核心大小。其中,因为它上方会提示:发现一个模型,目前在这个根目录下有一个模型,就刚才我们放入的Muse Glimmer 30B模型。它是一个多模态加速模型。如果你当前电脑支持这个投机加速的话,那么它上方会显示,检测到支持投机加速模型。开启以后,它的输出速度可以快两到三倍。
然后上方有三个选项:第一个是支持多模型切换的,但是它不开加速的;第二个是单模型,支持投机加速的;第三个是单模型不支持加速的。咱们选第二个,我们开启加速试一下。后面我再对比一下,不开加速模型的话,它的输出速度是多少。我们先开加速,打开它。然后它让我们选择需要启动模型,因为当前我们里面只有一个模型,所以咱们选第一个就可以了,输入1就可以了。好,这样的话它会自动开始启动。
四、实测一:代码生成速度对比(投机加速VS无加速)
好,启动以后它会自动打开这个页面,它上方会识别出当前这个模型,就Muse Glimmer 30B模型,目前是开启加速的。然后我们来试一下,它当前的速度是多少。
“帮我编写一个Flappy Bird的游戏啊!”你们看一下它当前速度是多少啊?目前的输出大概是每秒将近90个token左右,这个是加速以后的速度。它立马就搞定了。那看效果,点击打开。游戏是没问题的,一次搞定。
那现在我们来测试一下,在没有开启投机加速情况下,它的输出速度是多少?看看开启和不开启有什么区别啊。我们现在同样要求来试一下。来看一下,大家看一下,在没有开启这个加速情况下,它的输出速度只有45 token左右,将近慢了一半啊。那下面看一下这个没有加速的情况下生成的这个游戏啊,跟之前有没有区别?说句实在话,这个没有加速的生成效果,还不如之前这个加速的效果啊。
所以接下来我们就拿这个加速模型来进行测试啊。我们选择加速来启动一下。

五、实测二:Agent工具调用——整理下载文件夹
然后接下来我们就测试一下它的Agent的工具调用能力。比如我们用到Open WebUI来试一下效果。如果你的Open WebUI不是最新版本的话,那么建议更新一下。当然如果你没安装的话,那么可以自己去安装一下。它是可以在电脑上进行可视化的安装的。它的下载链接我昨天已放到零度博客上,到时候大家可以自己去获取。
好,安装好以后,然后现在打开它。打开以后,等一会儿,它会自动加载一下。加载完成以后,那这边下方有一个“我没有API Key”,打开它。好,进入以后,我们看到它里面有一个“本地对接接口”。然后现在我们选择它。选择以后,现在我们需要在下方这里填写对接的API地址。这个API地址的话,就是刚才我们启动的llama.cpp的访问地址,但后面我们需要跟上这个斜杠加上v1,这就是它的这个API地址。我们来贴进来。然后下方这个API key,因为我们是本地部署的,这个API key你可以随便填写一个,比如说12345678。这个API key的话,可以随便填写都可以。咱们点击连接一下,看行不行?哎,可以的。然后下方看一下,它上方显示已经成功连接了。这个时候我们就可以看到,它就会在这里显示我们当前这个对接的模型。
接下来就是测一下效果啊。这个Open WebUI是第一次安装以后,它默认是英文的。我们可以把这个语言切换到中文上去。你上方有一个这个设置按钮,打开它。打开以后,在上方这里找这个样式设置,就可以看到这个切换语言了,有中文简体啊,还有繁体都有,到时候根据情况选择。切换好以后,然后在下方这里可以切换不同的这个主题模式,比如说暗黑模式都可以。
然后先来测试一下效果。比如现在我让他帮我整理一下我当前的下载目录,因为这个目录下文件非常多,乱七八糟都有。然后让他帮我整理一下。现在我直接输入要求,就让他帮我整理一下下载文件夹,先看看里面都有什么,然后按你觉得合理的方式进行分类,把方案告诉我,我确定以后再动手。那么点击发送一下,看看怎么做的。
好,这样子就开始了。他现在开始查看我当前这个下载目录了,这个速度还是可以的。目前它就默认开启了深度思考模式的。但如果你不需要深度思考模式的话,你可以在设置这里把这个深度思考模式给关闭掉。哎,他看到了,它总共有130个文件,占了总共是1.3T左右。然后它根据文件类型来进行分类了。它整理以后,总共可以分七个大类:第一个是视频素材(video),然后第二个是图片,第三个是TXT的文件、日志,还有这个文本、可执行文件、还有压缩包。
他说:“如果确认这个方案可以执行的话,我就可以开始创建目录并移动文件了。”那现在我们输入确认,看看能不能搞定啊。可以了,他开始创建任务了。然后第二个是开始移动文件了,他先移动的视频啊。那第三个是日志,还有图片,移动一些TXT文件,整理文档,生成整理报告。
大家看一下,他立马就搞定了。然后我们打开下载目录来看一下,看一下里面有没有改变。哎,看一下,他就帮我全部整理好了,图片在一块,还有video都在里面啊。这个video的话,他做的细分啊,全部自动帮我们搞好了。也就意味着他的Agent的工具调用能力非常可以。
六、实测三:多模态能力——根据图片生成游戏
然后接着嘛,测试他多模态能力,比如现在他根据一张图片来编写一个跑酷游戏。好,我们要求发送一下,看他能不能制作完成。他通过HTML加RTM5来制作这个游戏的,开始分析图片风格并规划游戏结构了。中间出现了一些错误,他也能自行修复。他现在已经完成了。我们打开这个文件就可以了。在这个下载目录啊,打开下载目录看一下,就这里啊,大家看一下。哎,在它制作好以后呢,我们试下效果,看行不行。
哎,怎么这么小啊?这个,嘿嘿,太小了。看一下,可以的。哎哟,哦,掉下去了,呵呵呵,没问题啊,这个游戏可以正常玩耍,可以正常运行。哎哟,撞死了,这好,死了,扎心了。哎哎哎哎哎。哎,可以啊!哎呦,哎呦呦呦,哎呦呦,我掉死了。哈哈,那你算了算了算了,不玩了。
七、更多能力展示与对比
当然,它的功能远不止这些。比如网上有人通过Q4的量化版,仅用14G内存就成功调用了一百多个工具,Muse Glimmer 30B模型进行了五分钟不间断的完整仓库bug搜寻,包括bug重现、修复、测试以及提交PR等等,整个过程都是他自动完成的,相当稳定。
同时呢,Muse Glimmer 30B模型和DeepSeek V4 Flash最新的0731模型进行对比,在使用相同的提示词下,让他们分别生成魔法灯塔,大家觉得哪个效果更好一点?上面是由DeepSeek V4 Flash 0731模型生成的效果,那下方是由Muse Glimmer 30B模型生成的。说句实在话,确实难分高低。但是DeepSeek的V4 Flash模型,它是2840亿参数量,而Muse Glimmer 30B只有300亿参数,两者相差九倍的参数量,能达到这个效果已经非常可以了。
从Reddit的一些用户的反应,我们可以窥探出一二。他是这么说的:“使用一天以后,我觉得可以肯定地说,在某些使用场景下,Muse Glimmer 30B终于超过了千问3.2-72B模型。”下面的很多用户也给出相同的正面回答。



