关于“模型即芯片”等AI推理加速领域的头部创新,以及它们对Qwen 27B模型的支持情况,我整理了以下信息。
头部创新公司及加速效果
这个领域的玩家们选择了不同的技术路线,主要可以分为“硬连线”派和“软件优先”派。
-
Taalas (“硬连线”派的极致代表)
- 核心技术:将特定模型的权重和结构物理固化(硬连线) 在芯片的晶体管层面。芯片即模型,模型即芯片,用灵活性换取极致效率。
- 代表产品:HC1。
- 加速效果:运行Llama 3.1 8B模型时,速度可达 17,000 tokens/秒。是英伟达B200的48倍,成本仅为传统GPU方案的1/20,功耗为1/10。
- 应用场景:适合模型架构固定、追求极致速度和成本的垂直领域。
-
Groq (“软件优先”的SRAM路线)
- 核心技术:依靠强大的编译器在软件层面进行精确调度,硬件上使用大容量片上SRAM替代HBM,消除数据搬运瓶颈。
- 代表产品:LPU (Language Processing Unit)。
- 加速效果:运行Llama 2 70B模型时,速度达 300 tokens/秒,是H100集群的10倍;单批次推理可超 1600 tokens/秒。
- 应用场景:适合需要低延迟、高吞吐的实时交互应用,如语音助手、AI Agent等。
-
Etched (Transformer专用芯片)
- 核心技术:专为Transformer架构设计的ASIC芯片。
- 代表产品:Sohu。
- 加速效果:宣称运行Llama 70B模型时,吞吐量可超 500,000 tokens/秒。性能是英伟达H100的20倍,芯片利用率可突破90%(普通GPU仅约30%)。
- 应用场景:针对Transformer模型的高吞吐量推理。
-
Cerebras (晶圆级芯片)
- 核心技术:用整片晶圆制造一个超大芯片,消除芯片间互连瓶颈。
- 代表产品:WSE-3。
- 加速效果:运行1万亿参数模型速度达 981 tokens/秒;运行Llama 4 Maverick(400B)速度达 2,500 tokens/秒。
- 应用场景:适合对吞吐量和低延迟有极高要求的大模型推理,尤其是批量推理和实时对话。
-
SambaNova (可重构数据流架构)
- 核心技术:采用可重构数据流单元(RDU),通过数据流方式计算,减少数据搬移。
- 代表产品:SN40L, SN50。
- 加速效果:SN50运行MiniMax模型,短文本任务达 850 tokens/秒。通过投机解码技术,可实现6倍的推理速度提升。
- 应用场景:适合需要高吞吐和低延迟的大模型推理,尤其是长文本。
-
Tenstorrent (RISC-V架构)
- 核心技术:基于RISC-V架构的AI加速器,强调可扩展性和开放性。
- 代表产品:Blackhole, Wormhole。
- 加速效果:Galaxy Blackhole集群在Kimi等模型推理中,性能达传统GPU的3-4倍。
- 应用场景:灵活的AI推理和训练任务。
能否用于Qwen 3.8 27B模型?
关于Qwen 27B模型的支持情况,目前信息如下:
-
Taalas (硬连线路线):已有相关计划。 有报道称,Taalas正计划将Qwen 27B模型“蚀刻”进芯片。如果实现,预估速度可达 10,000 tokens/秒。但需注意,这类信息通常代表公司的产品路线图,并非已商用的产品,具体实现和性能有待验证。
-
Groq (软件优先路线):已明确支持。 Groq的推理平台已明确宣布支持Qwen 3.6 27B模型,并且是性能标杆。根据第三方基准测试,其在Groq平台上的平均输出速度约为 211 tokens/秒,甚至有数据显示可达 479.4 tokens/秒。
-
其他公司:
- Etched、Cerebras、SambaNova:目前没有公开信息表明它们已宣布或计划支持Qwen 27B模型。这些公司通常专注于与Meta(Llama)等主流模型的合作与优化。
- Tenstorrent:在其学术评估中提及了Qwen-7B模型,但未提及27B版本。
总结
AI推理加速芯片领域正呈现出多元化的技术路线:
- “硬连线”派(如Taalas):追求极致性能和能效,但牺牲了灵活性,适合模型固化的场景。
- “软件/架构创新”派(如Groq、Etched、Cerebras、SambaNova等):在保持一定灵活性的同时,通过架构创新(如SRAM、专用化、晶圆级集成等)大幅提升推理速度。
Qwen 27B模型:
- 如果追求极致的、颠覆性的速度,并且愿意等待和接受其“一模型一芯片”的限制,Taalas的路线值得关注。
- 如果希望立即使用,且看重成熟的平台和可用性,那么Groq是当前明确且可行的选择。