Qwen3.8-27B 下周开源:16GB 显存就能跑,稠密架构比 Max 更适合本地
xdm准备好你们的显卡或mac了吗
我 7800xt 又行了
理论上来说,27B模型在某些方面是打不过百B大模型的,因为接触到的东西有限,除非模型能在百B参数下觉醒自学习能力
重点是这么低的参数,27b,能跑一个很不错的多模态llm,也挺惊人了
理论上也不是不行
我倒是觉得这说明了智力压缩远远没到上限
qwen3.6 27B的水平大约是deepseek v4 flash preview,其实还有可以继续压缩的可能,因为我记得确实有一个几乎无损的压缩dense模型在小显存下运行的办法,能够让qwen 3.6 27B在8GB vram下运行,不过这个技术在MoE下有路由爆炸的问题。
是什么来着,想不起来了
牺牲速度的一种做法,但压缩资源更到位
好像是AQLM
(Additive Quantization for Language Models)
属于一种极低比特向量量化
这类方法不是简单把 FP16量化到INT4,而是把权重矩阵拆成很多小块,用码本表示。理论上可以做到2bit~3bit/parameter甚至更低,同时精度接近 FP16。
属于是一种用计算资源换vram的方式,但是对于端侧来说首先是得能跑的起来,其次才是计算资源的问题
理论上用TurboFieldfare。8G显卡也能跑![]()
m5pro 64g跑27b4bit,decode速度17tks,风扇很吵,基本不可用。
4060ti 16g,要加上内存才能跑。
本地想玩好这东西,32g的n卡才合适。非ultra和m5max级的mac、aimax、dgx的带宽都不够。
本地大显存低带宽设备最适合的就是moe,35b-a3b跑个6/8bit,也别指望它变成跑长任务,处理下图文就行了。
以上还不算长上下文的情况。3.6的4bit量化本地特别容易思考死循环,不知道3.8怎么样。
跑量化吗 那很吃力了
别折腾了。。。256k的上下文缓存就要多大。。。16G。。。转不动
