Qwen3.8 27B模型深度评测:本地运行达到Opus级别智能
Qwen 3.8是阿里巴巴最新开源的多模态大语言模型系列,其中270亿参数版本尤其引人注目。尽管参数规模仅为27B,但该模型在基准测试中整体表现超越Qwen 3.7 Plus,在编码、Agent任务和办公工作流方面尤其突出。模型支持262K原生上下文窗口(可扩展至100万token),原生多模态能力使其能够理解图像、图表等视觉输入。性能方面,该模型在RTX 5090上可达206 token/秒,在DGX Spark上约38 token/秒。本文通过使命召唤僵尸3D游戏生成、前端UI克隆、macOS界面复制、SVG绘画、GTA游戏克隆等丰富实测案例,全方位展示了该模型的强大能力。作者评价其为“迄今为止最令人印象深刻的本地模型”,建议拥有足够硬件的用户立即尝试。

一、开篇:令人震惊的本地AI体验
你在这里看到这个了吗?我正在RTX 4090上使用无槽动态4位量化运行Qwen 3.8 270亿参数模型,结果确实令我震惊。我几乎可以在本地免费运行Opus级别的智能。这可能是我见过的最好的本地AI模型,在看完今天的视频后,我强烈建议您尝试一下。
这是一个Agentic编码模型,具有一些疯狂的功能,它将帮助您解决很多问题。正如阿里巴巴团队承诺的那样,Qwen 3.8系列的开放权重终于发布了,这里包括270亿参数模型。
二、核心规格与性能概述
这是一个非常有趣的模型更新,因为这是一个原生的多模态Dense模型,尽管只有270亿个参数,它声称整体性能优于Qwen 3.7 Plus,同时在现实世界的编码、Agent任务和办公工作流程方面表现尤为出色。
老实说,您实际上已经在本地获得了Opus 4.6级别的智能,这简直是疯了。您还可以获得262K原生上下文窗口,可通过Yarn扩展到100万个token。因为它是在Apache 2.0许可证下发布的,所以您实际上可以下载它、在本地运行它、对其进行微调并在其之上进行构建。
阿里巴巴还发布了更大的Qwen 3.8 2.4万亿参数模型,这是他们的最大级别开放权重模型。所以无论您是想尝试一些实用的东西在本地使用270亿参数模型,还是想围绕2.4万亿参数MoE模型构建一个更大的Agent系统,Qwen 3.8开放权重系列已正式发布,如果您有硬件条件,您应该安装它。
三、基准测试表现
在我看来,这绝对是大多数人应该能够接触到的最佳本地模型。现在来看基准测试分数,这是一个特别令人印象深刻的模型。当您查看基准测试时,这是一个紧凑的270亿参数Dense模型,实际上在几乎每个类别中的整体表现都优于Qwen 3.7 Plus。它在编码方面也相当有口碑,在现实世界的编码、Agent工作流程和办公生产力任务中都取得了优异的成绩。
四、多模态与上下文能力
更有趣的是,它不仅仅是一个文本模型。它本身是多模态的,意味着它能够理解并对图像进行推理。所以您可以给它提供截图、图表,您甚至可以让它基于视觉输入实现UI布局,您还可以与文本一起使用其他视觉输入。
因此,您可以将其与262K原生上下文窗口(可扩展至100万token)结合起来,您基本上得到了一个可以编码、推理、分析视觉信息并处理超长文档的模型,同时仍然足够小,可以在本地实际运行。

五、性能表现与成本对比
正如我在开头提到的,这个270亿参数模型在本地免费为您提供Opus 4.6级别的编码智能。在相同的3GS Atlantis提示下,Qwen实际上生成了更强的整体场景、更好的寺庙生成、更强的焦点和更多的细节,提供了更多视觉深度。而Opus通过其API需要付费,而且速度也慢一些。所以您可以清楚地看到,这实际上会给您带来更好的结果。
这是为您提供开放权重、本地推理和前沿级编码性能而无需按提示付费的模型。有趣的是,据报道该模型在使用NVFP4和DSpark系统的单个RTX 5090上可以达到约206 token/秒,在DGX Spark上甚至约38 token/秒。所以我们得到了一个相对较小的模型,不仅非常擅长Agent规划和长期任务,而且可以在本地以真正令人印象深刻的速度运行。
六、如何本地运行
如果您确实想自己运行Qwen 3.8 270亿参数模型,它实际上出乎意料地易于使用。对于大多数人,我建议使用4位版本,这可以将模型大小降至约17GB。
如果您想知道如何实际运行它,您应该看看World of AI基准测试工具和Bob Quantum平台。在这里您可以指定您的硬件、您的计算机具有的所有不同规格,如系统RAM、CPU核心以及目标上下文。然后一旦指定完成,您将能够看到哪个模型最适合您。
在这种情况下,Qwen 3.8 270亿参数模型最适合我的需求,原因显然是它在质量、速度和效率方面的综合表现。如果我要在这里搜索Qwen 3.8,让我展示一下您应该使用哪种量化大小。在我的情况下最好的是使用Q5,但您显然可以降到Q4,您仍然会得到与使用Q8类似的结果。在这两种情况下可能会有一些差异,但大多数时候您都会得到很好的结果。
但总的来说,这意味着您可以使用良好的游戏GPU甚至在某些笔记本电脑或Apple Silicon Mac上运行它,只要有足够的统一内存。如果内存较少,还有更小的版本可以尝试。我相信在Hugging Face上还有低至9GB的版本,不过您会牺牲一些质量,所以请记住这一点。
七、本地运行实测
为了这个视频,我目前在具有24GB VRAM的RTX 4090上本地运行Qwen 3.8 27B的4位版本,整个模型完全适合我的GPU。我正在使用无槽动态4位量化,并通过Open WebUI在本地运行所有内容,所以不涉及任何API,我不需要按提示支付任何费用,所有这些都是免费完成的。
如果您们想要实际运行自己的基准测试,看看这个模型的实际表现,您可以使用World of AI基准测试和编码工具将其与您自己的端点连接起来。我会在下面的描述中留下链接,这也是一个相当不错的Harness工具,所以您将能够获得一些好的结果,并且您可以使用很多很酷的功能,从中获得很多收益。
如果您想在其他所有人之前获得最佳AI工具、工作流和发布信息,请加入我的免费新闻通讯,链接在下面的描述中,完全免费。
现在,如果您看一下,这就是模型在我的计算机上的实际速度。如果您打开了多个应用程序,显然它会慢一些,这实际上取决于您拥有的可用内存。所以在这种情况下,它仍然很慢,因为我打开了很多应用程序和标签页,但尽管如此,它的表现还是相当不错的。
我已在多个不同的基准测试中进行了测试,所以让我们直接深入了解一下。
八、3D游戏生成测试:使命召唤僵尸模式
首先,我想实际做一件我昨天用GLM 5.3做过的事情,那就是在3GS中创建一个使命召唤僵尸游戏。这是我提供的简单提示,让我展示一下它输出的结果。
这就是我得到的结果,它实际上能够输出这样的质量,真是太疯狂了。您有功能组件,但事实上它能够输出这种质量,简直太疯狂了。您有不同的武器,您有所有不同波次的僵尸向您涌来。
我相信您甚至可以打开不同的地方,所以您会看到在3DS中输出了一个小动画,我相信这就是僵尸应该出来的地方。但您可以解锁不同的区域,我相信您还可以获得不同的特殊能力,比如Juggernaut,这是我认为他们在游戏中有的功能。我实际上从未玩过僵尸模式,但我以前经常玩战区。好吧,我想我可以直接过渡到第二轮,但是是的,这相当不错。一个270亿参数模型能够输出这种质量,您有氛围感,您有不同种类的机制,我相信您甚至可以购买不同种类的武器。
这是您可以拾取不同补给品的地方,您可以拾取弹药,这真的很酷,它能够添加这么多深度,尽管这是一个270亿参数模型。我知道我会一直这么说,但我真的很震惊这是这个模型输出的内容。
实际上,您甚至可以购买一个神秘盒子,我相信这是实际游戏中的一个功能,我想它只是给了我一把新枪,这很酷。看起来像是一把霰弹枪。让我继续购买另一个,因为我不喜欢这个。这家伙从哪来的?
但您甚至有像Instant Kill这样的能力,所以您看到所有那些僵尸都消失了。所以这就是您可以从这个模型中期望的质量。这实际上非常酷。这是MP5。

九、前端开发能力测试
当我们看过Qwen 3.8 Max时,我们看到了模型在视觉深度方面取得了多么令人难以置信的巨大飞跃,就提供一些相当不错的前端设计而言,这实际上已经延续到了Qwen 3.8 27B。您可以看到,通过几个不同的前端,模型能够生成一些很不错的设计。我甚至会展示我生成的几个,但您可以看到它比之前来自Qwen 3.6的270亿参数模型有了实质性的提升,它能够输出一些相当漂亮的前端,尽管模型大小有限。
我真的很喜欢它所提供的创造力。您知道我在所有不同模型测试中使用的著名提示之一就是NVIDIA GPU灯光页面,这就是它在输出这个灯光页面方面实际上做得相当不错的地方,它试图真正获得那种3D设计。显然,您会看到整个登录页面中都在展示光泽,这是它不应该做的,应该只显示在GPU上。所以您会注意到其中一些小问题,但无论如何,它能够输出一些不错的生成,不同的滚动触发、不同的动画、不同种类的排版。
事实上它能够输出这种脚手架是一个很好的开始,显然您绝对可以在其基础上进行构建,加入自己的输入。这是我生成的另一个登录页面。您可以清楚地看出有一个大错误——页面中间的实际空白区域——但无论如何,就其结构化程度而言,其他一切似乎都相当不错。
我甚至生成了另一个,本应展示向下滚动时的数字进度,这似乎实际上并未固定。但无论如何,没有它的话它确实做得不错。
十、macOS克隆与iOS界面复制
这是我要求它生成的macOS克隆,尽管只有这样一个相对较小的上下文窗口——在这种情况下,它可以根据我拥有的内容有32K上下文窗口——尽管如此,我还是能够获得这些不错的生成,即使有前端。
这是它复制新Tahoe iOS更新的地方,您可以看到即使在天气小部件上也有轻微的动画。您甚至还有时钟。您有实际的时间表已归因于这个小部件,当我悬停时甚至还有小动画被突出显示。
现在,并非一切都很实用。很多很酷的东西,比如菜单栏似乎是可以的,但某些东西比如音乐播放器、电池、顶部栏,这些东西似乎都不起作用,无法通过Finder打开任何东西,我猜这是由于上下文窗口的限制。但无论如何,它确实编码出了很多不同的独立应用程序,这很好,并且它尝试为每个应用程序创建SVG图标。哦,您甚至还可以更改背景,这显然很好,我相信深色模式甚至也可以工作。哇,那也很棒。
十一、多模态能力:Airbnb网站克隆
现在,由于这个模型也是多模态的,它能够实际处理视觉输入,我们要做的是请求它克隆这个Airbnb网站。我们将发送这个请求来实际编码出所有内容。出现了一个小错误,因为我不得不更改格式,但现在看起来它已经开始编码了,您现在可以看到它在输出代码方面的速度有多快。
这就是输出结果。让我展示一下它的样子。所以有几件事情本来可以更好。它实际上应该编码出SVG,但显然我认为上下文是限制性的,所以我需要进行另一次迭代来改进它。但无论如何,它抓住了主要结构,这很好,它有主要的顶部栏以及徽标。所以总的来说,它确实做得不错。但让我们看看我是否可以通过提示来调整它。
好的,这是第二次迭代。这是第一个,这是第二个。徽标消失了,顶部栏也消失了。我不知道为什么,但我猜它编码出了这些单独的图标,然后将图像编码为SVG。这可能是迄今为止最糟糕的一代,但也许是因为我的提示。但无论如何,我想您可以说它在SVG方面做得不错。
十二、SVG绘画与城市景观生成
现在,就像我们所知道的,Qwen 3.8 Max在Web开发方面做得非常出色,这已经延续到了这个新的270亿参数模型,因为您可以看到,通过这些迷你游戏,它能够输出一些高质量的结果。
令人惊讶的是,它在SVG方面实际上相当不错。这是我要求它用SVG创建一幅画,显然一切看起来纹理都很好。但我唯一可以看到应该有所改进的是在正确的区域实际显示某些对象。房子应该在海岸线上,然后是桥——我不知道这是什么,我相信这是一座桥——应该放置在更好的地方。所以还有一些小事,但总体而言,这一代的视觉深度绝对是杰出的。
然后是纽约市的模拟,这一切都是在SVG中完成的。您马上会注意到一件事:您有一艘该死的船在飞,这不应该发生,显然它应该在水里。但除此之外,其他一切就其能够输出的内容而言似乎都相当不错。甚至汽车都有车头灯,这是一个大多数模型实际上最终不会生成的视觉细节。就连天空塔——所有这些塔都有用于飞机安全的红灯,显然,白天到黑夜的过渡是完美的。所以这本身就是一个很棒的生成。
十三、3D模型生成与模拟
接下来,它被要求创建一个产品的3D模型,在这种情况下,我猜它确实做到了大部分正确。但在某些视图中,它实际上并没有显示所有元素,这可能是唯一的缺点。但除此之外,它试图创造一只鞋子,您可以看到有很多小错误可以改进。但其他一切似乎都很实用,而且它的显示相当不错。
这里也是另一个较差的生成,这可能是异常值之一。这是我告诉它生成一个F1连续漂移甜甜圈,这是一个模拟,展示了模型在输出SVG方面的表现。从某些角度看,这辆车显然看起来不错,汽车在漂移时排放的尾烟确实很棒。但除此之外,3D环境场景与我们在其他模型中看到的相比并不出色。所以我可能会给这个评分为2/10。
十四、水族馆模拟与等距房间
然而,当我们看到它输出的这个水族馆模拟时,我们立刻又回来了,因为这是所有不同实体都包含在这个环境中的情况。通常发生的情况是所有这些鱼最终都离开了鱼缸,这是我们在DeepSeek V4 Flash中看到的情况,甚至Gemini模型在那个提示上也失败了,但您不能真的对Gemini有什么期望。但无论如何,这是一个看起来相当不错的生成,显然期望每条鱼有更多的纹理。但不管怎样,我们从这里得到了一些不错的输出。
接下来,我要求它创建这个3GS等距房间,这就是它在照明和视觉深度方面不错的地方。这里有一个大错误,就是我们在床上直接生成了这块木板。但除此之外,其他一切似乎都生成得相当不错。您有一盏漂亮的小灯,桌子旁边还有一株植物。您甚至还有一只很酷的小猫,我相信那是一只猫,是在这块地毯上生成的。所以在3D方面,它做得不错。
十五、GTA克隆游戏
这实际上很酷。这就是这个模型实际创建的地方——一个完整的GTA克隆。您可以实际射击人,您可以偷车。这实际上很酷,因为您甚至有音效,警察实际上在追您,您可以根据实际犯下的罪行获得通缉星级。您可以看到汽车确实爆炸了。
这个用户根据发送的提示在创建3D环境方面做得非常出色,一切似乎都像真实游戏一样运作。所以我真的很喜欢它最终在这个特定生成中所做的事情。
十六、总体评价与最终建议
但总的来说,我对这个模型的两分钱是,这可能是我迄今为止测试过的最令人印象深刻的本地模型。不是可能,而是因为它给了我接近Opus 4.6级别的智能,很多情况下甚至给我提供了4.8级别的智能。它显然并没有试图在所有方面击败前沿模型,但事实上,这个模型能够在我自己的硬件上运行并为我提供编码、Agent推理、视觉和指令跟随的水平,这是我在任何其他本地模型中都没有见过的,这简直太疯狂了。
所以如果您确实有硬件,我强烈建议您尝试一下。您可以使用World of AI工具来帮助您更好地理解,并获取我用来测试这些模型的所有提示,但这是一个很好的方式让您了解您实际上可以运行哪个模型。我会在下面的描述中留下链接。
请确保您看一下,也请看一下World of AI,抱歉,Universe of AI——我们的第二个频道,加入我们的新闻通讯,加入我们的Discord,在Twitter上关注我。最后,请确保您们订阅并打开通知铃铛,点赞这个视频,并观看我们之前的视频,以便您了解最新的AI新闻。
带着这样的想法,大家度过美好的一天,传播正能量,我很快就会见到你们。Peace out!



