LINUX SB 快照站

本地部署Qwen3.8 27B模型教程 17GB显存可跑

原帖: linux.sb/topic/13371 · 共 9 楼 · 标题快照 2026-08-17 20:15:10

楼主
发帖 2026-08-17 16:22:58 · 快照 2026-08-17 20:15:10

Workbuddy一键部署本地Qwen3.8 27B模型强强联合 单卡17GB显存可跑,这样部署,既能用Skill,又能用Qwen 3.8

千呼万唤试出来,Qwen3.8 27B在8月14日凌晨发布,Qwen3.8 27B把旗舰模型的能力塞进了你的电脑里,在量化后的模型Q4量化可以在一张4090的显卡上跑起来,大约需要17GB显存,我本地部署后,结合workbuddy的强大本地模型能力支持,实现了大模型自由。Qwen3.8 27B是一个原生多模态,原生支持图像和视频理解,涵盖 STEM 图表、文档乃至长达数小时的视频,编程能力直接UP提升,在代码编写、专业工作、科研和长周期智能体任务方面实现全面改进,大大超越了同期的Qwen3.6 27B模型。
较Qwen3.6-27B,新模型在编程和办公场景的性能大幅提升,表现甚至超越了Qwen3.7-Plus;同时,模型还新增了 reasoning_effort 功能,根据任务难度控制思考深度,更省资源。Qwen3.8-27B也拥有Qwen3.8系列模型的共性,可以端到端完成复杂任务,直接交付经得起检验的可靠成果。
ollama下载地址:链接:https://pan.quark.cn/s/9af9aaf07274

如果你是5090 32G显存 可以参考这个方案,更快https://github.com/MiaAI-Lab/Qwen3.8-27B-NVFP4-RTX-5090
上下文支持26万token,yarn技术后可以拉到100万!!!!模型自带思考模式,支持推理模型三档,线性注意力,剩显存,跑长文本快,能干大部分本地工作,接下来看怎么用!!!
先看下自己的显卡是否满足要求
图片描述
图片描述

1:下载本地的ollama
安装完成只需要全程下一步即可,安装完成后打开

图片描述
然后选中后输入一个:测试qwen3.8,就可以实现自动下载,下载大概需要10几分钟,耐心等候
本地下载完成后进行自动测试,通过后,就可以修改配置了,点击setting
这里选择打开
图片描述
来到workbuddy
下载链接:https://www.workbuddy.cn/events/invite?inviteCode=phbximw18dth
图片描述
这里选择自定义模型
图片描述
选择配置ollama
图片描述
输入模型名称
千万注意这里高级设置一个都不要打开
图片描述
开始测试 一点要点击新任务
选择工作空间
图片描述
如果你不想要使用workbuddy,也可以单独下载https://github.com/ggml-org/llama.cpp/releases
来本地使用
图片描述

实际测试下来,GLM5.2给我写了个bug,但是一样的提示词,让他给我改UI,就是改不好,结果让Qwen 3.8 27B 给我改好了

关于SGlang 本地部署更快的方案,我本地不能部署,因为作者指出是SGlang需要linux环境,我没有为他部署虚拟机,大家可以试试
图片描述

最后由 kkget 编辑于 2026-08-17 18:10
#1
发帖 2026-08-17 16:47:53 · 快照 2026-08-17 20:15:10

速度咋样? 每秒出多少token?

#2
发帖 2026-08-17 16:57:47 · 快照 2026-08-17 20:15:10

这个取决于显存了,目前我跑的是50–60 tok/s

#3
发帖 2026-08-17 16:58:48 · 快照 2026-08-17 20:15:10

不用非要搭配workbuddy,我主要是为了在workbuddy中使用方便,llama app 打开也挺好用的,还更快

#4
发帖 2026-08-17 17:28:08 · 快照 2026-08-17 20:15:10

4070Ti 16G可以吗?

#5
发帖 2026-08-17 17:36:21 · 快照 2026-08-17 20:15:10

16G有下载Q3KM,有一定的精度损失

#6
发帖 2026-08-17 23:55:30 · 快照 2026-08-17 23:58:02

点赞,可惜现在没卡部署

#7
发帖 2026-08-18 00:27:54 · 快照 2026-08-18 00:29:32

插眼,等我能买起显卡了就试试