Qwen 3.8 27B已于2026年8月14日正式发布。四天后,首套GGUF格式模型ShapeLearn-Lite问世,其特点是优化预算更低、检查项更少且等待时间更短。目前,完整的ShapeLearn模型已就绪,并与原始Lite版本及竞争性量化模型进行了全面的基准测试对比。

测试结果显示,ShapeLearn-Lite表现良好,而完整的ShapeLearn模型性能更优,进一步推高了质量与速度的性能前沿。

llama.cpp 快速入门指南

每个GGUF文件均包含MTP草稿头。DFlash2则使用独立的1.1 GB草稿模型。以下命令基于GPU-5配置,用户可根据发布版替换其他模型标签。

MTP(嵌入式草稿):支持图像输入。

llama-server \
  -hf byteshape/Qwen3.8-27B-GGUF:Qwen3.8-27B-IQ4_XS-3.84bpw \
  --mmproj-auto \
  --spec-type draft-mtp --spec-draft-n-max 3

DFlash2(外部草稿):速度最快选项,仅支持文本。需llama.cpp b10658或更高版本。

llama-server \
  -hf byteshape/Qwen3.8-27B-GGUF:Qwen3.8-27B-IQ4_XS-3.84bpw \
  -hfd incoai/Qwen3.8-27B-DFlash2-GGUF:Q4_K_M \
  --spec-type draft-dflash --spec-draft-n-max 7 \
  --no-mmproj

核心结论摘要

  • 性能前沿拓展:完整的ShapeLearn模型在六项GPU对比中均位于质量-速度前沿,表现优于Lite版本。
  • 选型建议:GPU-5为首选推荐配置,其聚合基准分数达到BF16的99.63%。若对上下文长度有更高需求或显存受限,GPU-4极具竞争力:体积更小(11.0 GB vs 13.1 GB),速度更快,且达到BF16的98.72%。
  • Lite版本表现:ShapeLearn-Lite的实际表现优于其KLD排名暗示的水平。在与Unsloth Dynamic v3的对比中,六款Lite模型中有三款位于前沿。
  • 投机解码加速:MTP和DFlash2均提升了所有被测模型和GPU的吞吐量。DFlash2通常更快,但需更多内存且不支持图像输入;MTP则更适合显存紧张或多模态场景。

完整ShapeLearn重塑性能前沿

此次发布的完整ShapeLearn运行版本显示,较大模型产生更高的聚合分数,较小模型提供更高的吞吐量。这一排序在所有测试的六款GPU上保持一致。由于是稠密模型,内存传输成为瓶颈,较低的BPW(每权重比特数)比在MoE模型中更能直接转化为更高的TPS(每秒Token数)。

对比对象包括AtomicChat、Bartowski、ISTA-DASLab和Unsloth Dynamic v3。所有五款ShapeLearn模型均保持在测得的前沿位置,其中GPU-5实现了最高聚合分数。

不同显存配置的实测数据

96 GB (RTX Pro 6000):GPU-5以90.4 tok/s的速度达到BF16基线的99.63%,是默认首选。

32 GB (RTX 5090):GPU-5达到93.7 tok/s。若需更长上下文或更高TPS,可选GPU-4

24 GB (RTX 4090/3090):两款显卡均能容纳所有五款ShapeLearn模型。GPU-5在RTX 4090上达到59.2 tok/s,在RTX 3090上达到45.8 tok/s。切换到GPU-4会使吞吐量降低约7.5%,但聚合分数从98.72%提升至99.63%,因此GPU-5仍为默认选择。

16 GB (RTX 4080/5060 Ti):在显存预算紧张时,需为上下文留出空间。GPU-5在RTX 4080上达到45.7 tok/s,在RTX 5060 Ti上达到29.1 tok/s。若模型、KV缓存和运行时缓冲区超出内存预算,GPU-4以更小尺寸提供近99%的BF16性能且速度更快,是极具竞争力的替代方案。

回顾ShapeLearn-Lite:KLD并非性能唯一标尺

ShapeLearn-Lite旨在快速将Qwen 3.8 27B部署至12-24 GB GPU。尽管Unsloth Dynamic v3部分模型的KLD(KL散度)低于Lite,但KLD仅衡量量化模型与BF16参考之间的分布差异,并不自动等同于任务性能。

测试显示,Unsloth的UD-IQ3_S KLD虽比同尺寸最小Lite模型低约20%,但其聚合基准分数却更低(BF16的95.55% vs 97.33%)。这表明保真度排名不等于任务性能排名。在Lite与Unsloth的对比中,三款最小的Lite模型仍位于性能前沿。

投机解码:MTP与DFlash2的权衡

MTP(3个草稿Token)和DFlash2(7个草稿Token)均提升了吞吐量。DFlash2通常更快,达到基线NTP吞吐量的1.34-2.10倍,而MTP为1.28-1.66倍。

内存方面,嵌入式MTP仅增加约250 MB模型大小,而4-bit DFlash2草稿模型需额外约1.1 GB显存。此外,llama.cpp中的DFlash2目前不支持图像输入。因此,追求最大纯文本吞吐量且内存允许时选DFlash2;显存紧张或需多模态支持时选MTP。

基准测试方法

评估涵盖指令和思考基准测试,包括GSM8K、IFEval、MMLU、LiveCodeBench V6*、Multi-IF、ACEBench、Multiple HumanEval和BFCL V4*。量化模型分数由相应BF16模型分数归一化,总分为平均值。所有评估均在llama.cpp b10430上运行,采用Qwen推荐的采样参数。

综上,ShapeLearn-Lite完成了其快速部署的使命,而完整ShapeLearn进一步优化了质量-速度权衡。GPU-5为首选推荐,GPU-4为显存受限时的优质备选。KLD是有用的诊断工具,但基准测试才是衡量任务性能的最终标尺。