2026年8月30日 赛博日记
生成时间:2026-08-30 23:50 (Asia/Shanghai)
核心工作
📚 智能收藏回顾
- 《Eight Patches to Pipeline Parallel》vLLM 实测笔记(01:48 更新,来源 Claude Artifact)
- 在 3× CMP 170HX(PCIe Gen2 x4、无 NVLink)上让 vLLM 以 PP3 + MTP + PLE offload 跑 512 专家 MoE 模型,修复了 8 个上游真实缺陷
- 颠覆性结论:慢速互联正是 PP 获胜的原因——prefill 比 expert-parallel 快 5.2×(32k prompt),decode 快 1.5×,KV cache 池近乎免费翻 4 倍
- 核心洞察:DEP 每层每 token 都要 all-to-all(48 次跨卡往返全走 PCIe),PP 专家路由永不离开 GPU、每 forward 仅 2 次跨 stage 通信。互联成本应驱动并行策略选择,而不只是决定可行性
- 缺陷 8 最硬核:MTP speculative decoding 在 PP 下各 rank collective 数量不一致 → desync → 任意配置都救不了的 segfault,最终 apply 上游 PR #46994(12 文件 +401/−18)解决
- 三个值得记住的弯路:① vLLM 存在
gpu_model_runner.py与gpu/model_runner.py两处同名逻辑,改错文件浪费数轮;②--block-size 1600只是掩盖 dtype 不匹配的治标方案(病态 3.27MB block 还引发 segfault);③ 此前把 DEP 当可行选项的框架性判断被实测整个翻转 - 正确修法:
--mamba-ssm-cache-dtype float32让各 stage dtype 与模型 config 声明一致
🧠 记忆系统维护
- 05:00 cron 报告:笔记仓库自动整理脚本
tidy-notes-repo.sh仍不存在,连续第 2 天失败 - 已向用户提出三个选项:补写脚本 / 移除 cron / 并入心跳
思考与备忘
- “改错文件"弯路的教训值得沉淀:traceback 里写着正确文件名,但读漏了——遇到同名函数/多模块并存的大型代码库时,先用 grep 确认活跃调用路径再动手
- 假修复的识别信号:某个参数改动清掉了目标报错,但引发了新类型的崩溃(block 尺寸病态 → segfault),说明真正的问题在更深处(dtype 不一致)
- 待办:
tidy-notes-repo.sh的去留问题仍未拍板
今日摘要
技术含量很高的一天:核心是 vLLM 流水线并行的深度实战——8 个上游缺陷的修复过程本身就是一份分布式系统调试教科书,从 surface 报错(PLE offload 拒绝 PP)一路挖到根因(rank 间 dtype 与 collective 数量不一致)。最重要的收获是方法论层面的:实测推翻纸面判断,互联拓扑决定并行策略。另外笔记仓库整理 cron 连续第 2 天失败,需要尽快决策。
📊 自动化统计
- 捕获 Memory 数:1(2026-08-30.md,2 条记录)
- Claude 记忆文件:不存在(claude_2026-08-30.md)
- 笔记更新数:1(八补丁流水线并行实测笔记)
- Todoist 完成任务数:未统计(本次运行环境无 Todoist 工具权限)
- Claude Code 会话数:0(无工作记录文件)