2026年9月2日(周三)赛博日记

生成时间:2026-09-02 23:50 (Asia/Shanghai)

核心工作

💻 Claude Code 工作记录

  • 会话数:Claude 0 个 / Cursor 2 个,共 11 条消息
  • 会话 1(14:43 | 项目X接口测试工程)
    • 按 interface-auto-project-standard 的「新增用例最小流程」强制规范生成 draw.io 流程图
    • 状态:✅ 正常
  • 会话 2(17:36 | 项目Y AI 测试工程)
    • 写入用例生成 Skill,后续迭代会按该 Skill 的两条规范执行
    • 状态:✅ 正常

📚 技术笔记:双模型 PP2 共存部署落地

今日完成双 CMP 170HX(各 64GB)上 BU-30B-A3B + AutoGLM-Phone-9B 双模型同时常驻、各自跨双卡 PP2 的部署,打包为 systemd 服务 automodels-x2pp。核心经验:

  • 显存预算是共存命门:vLLM 的 --gpu-memory-utilization 要求启动时空闲显存 ≥ 预算值,且 KV cache 会把预算吃满(不是只占权重)。共存关键是预算之和 ≤ 1.0:BU-30B 0.60 + AutoGLM 0.25 = 0.85,留 15% 余量。按权重大小估显存必翻车(初版 0.62+0.80 直接被拒启)。
  • 启动顺序先小后大:先 AutoGLM 落卡再启 BU-30B,反序则第二家撞"空闲 < 预算"被拒。
  • 共存零性能损失:实测单发 prefill/decode 与独占完全持平(1.4k~22.2k tok 各档均持平),KV 缩小只影响并发容量(22k 上下文并发约减半)。
  • PP 兼容性因模型而异:BU-30B(Qwen3-VL MoE)需手动给 config.json 补 architectures 才能跑 PP;AutoGLM(Glm4v)在 vLLM 0.24 开箱即用。

关联昨日的 A/B 实测结论(PP2 对比单卡):长 prompt prefill +14%、decode 全面 +15~38%,短 prompt 单卡更快;以及 PP 启动崩溃根因——vLLM with_hf_config() 对自定义 model_type 查不到 architectures 映射,PP 模式下 dataclass replace 触发 pydantic 重校验才炸,单卡路径潜伏不爆。

思考与备忘

  • vLLM 多实例共存的分配逻辑值得沉淀为通用方法论:预算制而非权重制 + 启动序先小后大。
  • PP 崩溃这类"单卡不炸、并行才炸"的问题,根因往往在配置重建路径的校验差异,排查时优先看 worker 进程的 VllmConfig 重建链。

今日摘要

双模型 PP2 共存部署收官并 systemd 化;两条 Cursor 会话推进接口自动化用例标准(流程图生成 + 用例 Skill 固化)。工程上把显存预算、启动顺序、PP 兼容性三个坑全部踩平并留档。

📊 自动化统计

  • 捕获 Memory 数:0(memory/2026-09-02.md 不存在)
  • 笔记更新数:2(双模型PP2共存部署、BU-30B PP2 vs 单卡实测)
  • Todoist 完成任务数:未查询(本次运行环境无 Todoist 工具)
  • Claude Code 会话数:2(Cursor)