2026-09-05(周六) 赛博日记

生成时间:2026-09-05 23:50

核心工作

💻 Claude Code 工作记录

今日无 Claude Code / Cursor 工作记录(memory/claude_2026-09-05.md 不存在,昨日 22:00 后亦无新会话记录落盘)。

📚 硬件部署笔记三连(前夜 23:50 落盘,跨日收录)

本批笔记定稿于 09-04 深夜(23:50 git 同步),昨日日记未收录,今日日记补录归档。主题:双 CMP 170HX 部署 Qwen3.8-Flash-Next 176B 的量化与精度选型闭环。

1. PLE 表精度 A/B:BF16 vs FP8(定稿)

  • 同 W4A16 权重,只变 PLE n-gram 表精度:FP8 表(51.2G)vs BF16 表(102.4G)。
  • 结论:BF16 甜区 decode 全面胜出(80K200K decode +5%+32%),FP8 版已删除,默认模型目录切换为 AutoRound(BF16 表)。
  • 边界发现:230K/260K 长度 BF16 decode 反而 -40%+(并发下表驻留/预热的冷启动惩罚),TTFT 同步劣化——长上下文甜区之外存在明显折返点。
  • 单发含 1M 上下文实测(pp1m YaRN4 + MTP4 + KV BF16):80K 单发 decode 81.2 t/s、prefill 6143 t/s、TTFT 13s、ITL 32.4ms。

2. AWQ-INT4 vs AutoRound W4A16 单发速度 A/B(闭环)

  • TL;DR:速度几乎无差(500K/900K 两点 prefill/decode 均 ±3% 内,属 MTP 接受率自然波动)。速度不构成选型决策因素。
  • 代价:AWQ compressed-tensors 权重驻留更大(每卡 KV 可用 -5G),1M 窗口装不下,只能 921600;磁盘全量 188.3G(跳过 20 个纯 PLE 分片与本地字节级同源校验后,实下 92.3G + 本地组装 96G)。
  • 决策:切回 AutoRound 常驻服务(1M 窗口完整、KV 更大);质量维度(g32 vs g128 理论差 0.1~0.3 点)留待评测,速度 A/B 已闭环。

3. 170HX 双卡部署主笔记更新(09-04 版)

  • 主文档同步以上结论:PLE 表默认 BF16 102G 不量化;记录了本次部署最核心的一条架构经验——表进显存与 1M 大上下文数学互斥,解法为 PLE mmap + 页缓存预热 42G、权重/KV 走显存、YaRN factor 4.0 扩展到 1M。
  • 关键坑位存档:fp8 KV 被 QSA 层断言封死(仅 auto/bf16);MTP spec 上限 4(QSA 约束);PP+MTP 组合必须 PIECEWISE cudagraph,否则 full cudagraph 重编译停摆。

📋 代办推送

无记录。

🧠 记忆系统维护

今日无 memory/2026-09-05.md 日常记忆文件。

🏠 回家通知

无记录。

思考与备忘

  • 量化选型的三条经验沉淀:①速度 A/B 无差时,决策依据只剩质量与显存驻留成本;②BF16 表的 decode 优势在长上下文尾段会翻转为劣势(230K+),甜区有边界;③纯 PLE 分片可跨量化版本复用(字节级同源校验),省 96G 下载。
  • 待办:AWQ vs AutoRound 的质量评测集尚未确定,若要定质量需另立评测。
  • 周六无会话记录,工作集中在硬件实验收尾与文档定稿。

今日摘要

无新会话与代办记录;本日主要产出为收录前夜定稿的 170HX 部署三连笔记:PLE 表 BF16 vs FP8 精度 A/B(BF16 胜出并设为默认)、AWQ vs AutoRound 速度 A/B(无差,速度维度闭环、切回 AutoRound)、主部署笔记同步更新。双卡 176B + 1M 上下文的量化/精度/显存三维选型至此完整闭环。

📊 自动化统计

  • 捕获 Memory 数:0(今日无日常 memory 文件)
  • 笔记更新数:3(均为 09-04 23:50 落盘,跨日补录)
  • Todoist 完成任务数:未查询(工具不可用)
  • Claude Code 会话数:0