HARDWARE硬件

Qwen3.8-Flash-Next测速月度综述-0830至0916

Qwen3.8-Flash-Next 测速月度综述(2026-08-30 ~ 09-16) 综合来源:《170HX双卡部署笔记(08-30/09-04)》《PLE表精度AB-BF16vsFP8-09-04》《AWQ-vs-AutoRound-0904》《CMP170HX-SM超频AB-0913》《NVFP4-vs-AWQ-AB-0914》《NVFP4生产切换与PLE精度实验-0914》《NVFP4生产栈decode掉速排查-0916》 硬件:双 CMP 170HX 64G(SM80),MSI B850M-P / 9800X3D / 60G RAM / NVMe ...

2026-09-18 · 5 min · 2326 words · 新人类
HARDWARE硬件

NVFP4生产栈decode掉速排查-100vs150口径差异-0916

NVFP4 生产栈 decode「掉速」排查:100 vs 150 是口径差,不是升级回退 日期:2026-09-16 00:30 | 状态:✅ 已定位,无需修复 前置:NVFP4 vs AWQ A/B 实测、社区栈迁移计划 ...

2026-09-16 · 4 min · 1636 words · 新人类
HARDWARE硬件

NVFP4生产切换与PLE精度实验-0914

NVFP4 生产切换 + PLE 精度实验(2026-09-14 深夜定稿) 承接《NVFP4-W4A16-vs-AWQ-AB实测-TEP2-MTP6-0914.md》。本篇:① A 侧热态补测 ② BF16 原版 PLE 表实验 ③ 生产栈正式切换 NVFP4 + 踩坑。 ...

2026-09-15 · 4 min · 1517 words · 新人类
HARDWARE硬件

NVFP4-W4A16-vs-AWQ-AB实测-TEP2-MTP6-0914

NVFP4(W4A16/TEP2/MTP6) vs AWQ-INT4(PP2/spec3) A/B 实测 日期:2026-09-14 晚 | 状态:✅ B栈可用,竞态探针通过 | 前置:迁移计划 一句话结论 dev499 直接加载社区 NVFP4 检查点成功(W4A16 元数据改写 + TEP2 + MTP6,无社区镜像/无 GDS):单发 decode 80K-500K 全档 96-107 t/s,比 AWQ 生产栈快 52-74%;c2×103K 竞态探针 2/2 通过、零 Xid——AWQ 栈同口径 19-26 秒必崩的 spec 每请求记账竞态在 NVFP4 栈上未复现。代价:320K+ prefill 衰减、500K TTFT 331s。 ...

2026-09-14 · 4 min · 1861 words · 新人类
HARDWARE硬件

Qwen3.8-Flash-Next-NVFP4社区栈迁移与对比计划-0914

Qwen3.8-Flash-Next-NVFP4 社区栈迁移与对比计划 日期:2026-09-14 | 状态:🟡 进行中(A7 下载收尾)| 入口技能:qwen-flash-sm80-170hx-migration ...

2026-09-14 · 10 min · 4625 words · 新人类
HARDWARE硬件

CMP170HX-SM超频偏移AB实测-FlashNext-0913

CMP 170HX SM VF 偏移 A/B 实测(FlashNext 服务口径)— 2026-09-13 背景与目的 170tune 按序列给双卡定的偏移:GPU0=+200 / GPU1=+250(gate receipt: /xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxoff250_clk1400.json,08-31 认证, 4 sweeps,峰值 HBM 60°C)。该 receipt 的 “+10% 读带宽” 说的是 HBM NDIV70 的部分;SM VF 偏移对 LLM 推理本身到底有没有收益,此前没有服务口径数据。 本次用 flashnext(AWQ-INT4 g32, PP2, 50-ple-fix/nospec 常驻服务)单流实测补齐。 ...

2026-09-13 · 3 min · 1260 words · 新人类
HARDWARE硬件

PLX拓展卡双卡BAR1修复-7.0.0-cmp内核-0913

PLX 拓展卡双卡 170HX 初始化失败修复全记录(7.0.0-cmp 内核) 日期:2026-09-13 | 状态:✅ 已修复并验证 一句话结论 两张 CMP 170HX 同时插在 PLX PEX9765 拓展卡后面时 GSP 初始化失败、nvidia-smi 卡死,根因是内核 PCI 桥窗口计算不考虑子设备 64GB 对齐导致双卡 BAR1 都退回 64MB;用 bayley 的两个内核补丁构建 7.0.0-cmp 内核后,双卡 BAR1 各 65536MB,P2P 6.7GB/s(Gen2 x16 打满)。 ...

2026-09-13 · 4 min · 1891 words · 新人类
HARDWARE硬件

AWQ-INT4-vs-AutoRound-W4A16-单发速度AB-0904

Qwen3.8-Flash-Next:AWQ-INT4 vs AutoRound W4A16 单发速度 A/B(2026-09-04) 结论(TL;DR) 速度几乎无差:500K/900K 两点 prefill 与 decode 均与 AutoRound 基线持平(±3% 内,属 MTP 接受率自然波动)。AWQ-INT4 (g32) 没有速度优势,也没有劣化。选型依据只剩质量与显存驻留成本——速度不构成决策因素。 ...

2026-09-04 · 3 min · 1021 words · 新人类
HARDWARE硬件

FlashNext-PLE表精度AB-BF16vsFP8-含1M长上下文

PLE 表精度 A/B:BF16 vs FP8 + 1M 长上下文实测(2026-09-04 定稿) 附属于《170HX双卡部署Qwen3.8-Flash-Next-176B笔记》。同 W4A16 权重,只变 PLE n-gram 表精度。 结论先行:BF16(不量化)甜区 decode 全面胜出,FP8 表已删除。默认模型目录已切换为 AutoRound 版。 ...

2026-09-04 · 3 min · 1140 words · 新人类
HARDWARE硬件

170HX双卡部署Qwen3.8-Flash-Next-176B笔记

双 CMP 170HX 部署 Qwen3.8-Flash-Next 176B:最佳策略与最终结果 2026-08-30 定稿,09-04 更新PLE精度结论。硬件:MSI B850M-P / Ryzen7 9800X3D / 60G 内存 / CMP 170HX 64G ×2。 模型:Qwen3.8-Flash-Next 176B(MoE),W4A16 权重 ~15.5G + PLE n-gram 表(09-04 起默认 BF16 不量化 102G,FP8 版已删,见《FlashNext-PLE表精度AB-BF16vsFP8-含1M长上下文》)。 服务:vLLM 0.29(/root/vllm029-venv),端口 8000,兼容别名 Qwen3.8-27B-INT8(客户端零改动)。 ...

2026-08-30 · 7 min · 3054 words · 新人类