
Qwen 3.8 27B已于2026年8月14日正式发布。四天后,首套GGUF格式模型ShapeLearn-Lite问世,其特点是优化预算更低、检查项更少且等待时间更短。目前,完整的ShapeLearn模型已就绪,并与原始Lite版本及竞争性量化模型进行了全面的基准测试对比。
测试结果显示,ShapeLearn-Lite表现良好,而完整的ShapeLearn模型性能更优,进一步推高了质量与速度的性能前沿。
llama.cpp 快速入门指南
每个GGUF文件均包含MTP草稿头。DFlash2则使用独立的1.1 GB草稿模型。以下命令基于GPU-5配置,用户可根据发布版替换其他模型标签。
MTP(嵌入式草稿):支持图像输入。
llama-server \
-hf byteshape/Qwen3.8-27B-GGUF:Qwen3.8-27B-IQ4_XS-3.84bpw \
--mmproj-auto \
--spec-type draft-mtp --spec-draft-n-max 3DFlash2(外部草稿):速度最快选项,仅支持文本。需llama.cpp b10658或更高版本。
llama-server \
-hf byteshape/Qwen3.8-27B-GGUF:Qwen3.8-27B-IQ4_XS-3.84bpw \
-hfd incoai/Qwen3.8-27B-DFlash2-GGUF:Q4_K_M \
--spec-type draft-dflash --spec-draft-n-max 7 \
--no-mmproj核心结论摘要
- 性能前沿拓展:完整的ShapeLearn模型在六项GPU对比中均位于质量-速度前沿,表现优于Lite版本。
- 选型建议:
GPU-5为首选推荐配置,其聚合基准分数达到BF16的99.63%。若对上下文长度有更高需求或显存受限,GPU-4极具竞争力:体积更小(11.0 GB vs 13.1 GB),速度更快,且达到BF16的98.72%。 - Lite版本表现:ShapeLearn-Lite的实际表现优于其KLD排名暗示的水平。在与Unsloth Dynamic v3的对比中,六款Lite模型中有三款位于前沿。
- 投机解码加速:MTP和DFlash2均提升了所有被测模型和GPU的吞吐量。DFlash2通常更快,但需更多内存且不支持图像输入;MTP则更适合显存紧张或多模态场景。
完整ShapeLearn重塑性能前沿
此次发布的完整ShapeLearn运行版本显示,较大模型产生更高的聚合分数,较小模型提供更高的吞吐量。这一排序在所有测试的六款GPU上保持一致。由于是稠密模型,内存传输成为瓶颈,较低的BPW(每权重比特数)比在MoE模型中更能直接转化为更高的TPS(每秒Token数)。
对比对象包括AtomicChat、Bartowski、ISTA-DASLab和Unsloth Dynamic v3。所有五款ShapeLearn模型均保持在测得的前沿位置,其中GPU-5实现了最高聚合分数。
不同显存配置的实测数据
96 GB (RTX Pro 6000):GPU-5以90.4 tok/s的速度达到BF16基线的99.63%,是默认首选。
32 GB (RTX 5090):GPU-5达到93.7 tok/s。若需更长上下文或更高TPS,可选GPU-4。
24 GB (RTX 4090/3090):两款显卡均能容纳所有五款ShapeLearn模型。GPU-5在RTX 4090上达到59.2 tok/s,在RTX 3090上达到45.8 tok/s。切换到GPU-4会使吞吐量降低约7.5%,但聚合分数从98.72%提升至99.63%,因此GPU-5仍为默认选择。
16 GB (RTX 4080/5060 Ti):在显存预算紧张时,需为上下文留出空间。GPU-5在RTX 4080上达到45.7 tok/s,在RTX 5060 Ti上达到29.1 tok/s。若模型、KV缓存和运行时缓冲区超出内存预算,GPU-4以更小尺寸提供近99%的BF16性能且速度更快,是极具竞争力的替代方案。
回顾ShapeLearn-Lite:KLD并非性能唯一标尺
ShapeLearn-Lite旨在快速将Qwen 3.8 27B部署至12-24 GB GPU。尽管Unsloth Dynamic v3部分模型的KLD(KL散度)低于Lite,但KLD仅衡量量化模型与BF16参考之间的分布差异,并不自动等同于任务性能。
测试显示,Unsloth的UD-IQ3_S KLD虽比同尺寸最小Lite模型低约20%,但其聚合基准分数却更低(BF16的95.55% vs 97.33%)。这表明保真度排名不等于任务性能排名。在Lite与Unsloth的对比中,三款最小的Lite模型仍位于性能前沿。
投机解码:MTP与DFlash2的权衡
MTP(3个草稿Token)和DFlash2(7个草稿Token)均提升了吞吐量。DFlash2通常更快,达到基线NTP吞吐量的1.34-2.10倍,而MTP为1.28-1.66倍。
内存方面,嵌入式MTP仅增加约250 MB模型大小,而4-bit DFlash2草稿模型需额外约1.1 GB显存。此外,llama.cpp中的DFlash2目前不支持图像输入。因此,追求最大纯文本吞吐量且内存允许时选DFlash2;显存紧张或需多模态支持时选MTP。
基准测试方法
评估涵盖指令和思考基准测试,包括GSM8K、IFEval、MMLU、LiveCodeBench V6*、Multi-IF、ACEBench、Multiple HumanEval和BFCL V4*。量化模型分数由相应BF16模型分数归一化,总分为平均值。所有评估均在llama.cpp b10430上运行,采用Qwen推荐的采样参数。
综上,ShapeLearn-Lite完成了其快速部署的使命,而完整ShapeLearn进一步优化了质量-速度权衡。GPU-5为首选推荐,GPU-4为显存受限时的优质备选。KLD是有用的诊断工具,但基准测试才是衡量任务性能的最终标尺。