27B就可跑开源多模态,疯了已经,是不是在过两年,16G的显存就能媲美现在的ds flash

Qwen3.8-27B 下周开源:16GB 显存就能跑,稠密架构比 Max 更适合本地

1 个赞

xdm准备好你们的显卡或mac了吗

我 7800xt 又行了

理论上来说,27B模型在某些方面是打不过百B大模型的,因为接触到的东西有限,除非模型能在百B参数下觉醒自学习能力

重点是这么低的参数,27b,能跑一个很不错的多模态llm,也挺惊人了

理论上也不是不行

我倒是觉得这说明了智力压缩远远没到上限

qwen3.6 27B的水平大约是deepseek v4 flash preview,其实还有可以继续压缩的可能,因为我记得确实有一个几乎无损的压缩dense模型在小显存下运行的办法,能够让qwen 3.6 27B在8GB vram下运行,不过这个技术在MoE下有路由爆炸的问题。

是什么来着,想不起来了

1 个赞

牺牲速度的一种做法,但压缩资源更到位

好像是AQLM

(Additive Quantization for Language Models)

属于一种极低比特向量量化

这类方法不是简单把 FP16量化到INT4,而是把权重矩阵拆成很多小块,用码本表示。理论上可以做到2bit~3bit/parameter甚至更低,同时精度接近 FP16

属于是一种用计算资源换vram的方式,但是对于端侧来说首先是得能跑的起来,其次才是计算资源的问题

理论上用TurboFieldfare。8G显卡也能跑:grinning_face:

m5pro 64g跑27b4bit,decode速度17tks,风扇很吵,基本不可用。
4060ti 16g,要加上内存才能跑。
本地想玩好这东西,32g的n卡才合适。非ultra和m5max级的mac、aimax、dgx的带宽都不够。
本地大显存低带宽设备最适合的就是moe,35b-a3b跑个6/8bit,也别指望它变成跑长任务,处理下图文就行了。
以上还不算长上下文的情况。3.6的4bit量化本地特别容易思考死循环,不知道3.8怎么样。

1 个赞

跑量化吗 那很吃力了

别折腾了。。。256k的上下文缓存就要多大。。。16G。。。转不动