2026年9月2日(周三)赛博日记
生成时间:2026-09-02 23:50 (Asia/Shanghai)
核心工作
💻 Claude Code 工作记录
- 会话数:Claude 0 个 / Cursor 2 个,共 11 条消息
- 会话 1(14:43 | 项目X接口测试工程)
- 按
interface-auto-project-standard的「新增用例最小流程」强制规范生成 draw.io 流程图 - 状态:✅ 正常
- 按
- 会话 2(17:36 | 项目Y AI 测试工程)
- 写入用例生成 Skill,后续迭代会按该 Skill 的两条规范执行
- 状态:✅ 正常
📚 技术笔记:双模型 PP2 共存部署落地
今日完成双 CMP 170HX(各 64GB)上 BU-30B-A3B + AutoGLM-Phone-9B 双模型同时常驻、各自跨双卡 PP2 的部署,打包为 systemd 服务 automodels-x2pp。核心经验:
- 显存预算是共存命门:vLLM 的
--gpu-memory-utilization要求启动时空闲显存 ≥ 预算值,且 KV cache 会把预算吃满(不是只占权重)。共存关键是预算之和 ≤ 1.0:BU-30B 0.60 + AutoGLM 0.25 = 0.85,留 15% 余量。按权重大小估显存必翻车(初版 0.62+0.80 直接被拒启)。 - 启动顺序先小后大:先 AutoGLM 落卡再启 BU-30B,反序则第二家撞"空闲 < 预算"被拒。
- 共存零性能损失:实测单发 prefill/decode 与独占完全持平(1.4k~22.2k tok 各档均持平),KV 缩小只影响并发容量(22k 上下文并发约减半)。
- PP 兼容性因模型而异:BU-30B(Qwen3-VL MoE)需手动给 config.json 补
architectures才能跑 PP;AutoGLM(Glm4v)在 vLLM 0.24 开箱即用。
关联昨日的 A/B 实测结论(PP2 对比单卡):长 prompt prefill +14%、decode 全面 +15~38%,短 prompt 单卡更快;以及 PP 启动崩溃根因——vLLM with_hf_config() 对自定义 model_type 查不到 architectures 映射,PP 模式下 dataclass replace 触发 pydantic 重校验才炸,单卡路径潜伏不爆。
思考与备忘
- vLLM 多实例共存的分配逻辑值得沉淀为通用方法论:预算制而非权重制 + 启动序先小后大。
- PP 崩溃这类"单卡不炸、并行才炸"的问题,根因往往在配置重建路径的校验差异,排查时优先看 worker 进程的 VllmConfig 重建链。
今日摘要
双模型 PP2 共存部署收官并 systemd 化;两条 Cursor 会话推进接口自动化用例标准(流程图生成 + 用例 Skill 固化)。工程上把显存预算、启动顺序、PP 兼容性三个坑全部踩平并留档。
📊 自动化统计
- 捕获 Memory 数:0(memory/2026-09-02.md 不存在)
- 笔记更新数:2(双模型PP2共存部署、BU-30B PP2 vs 单卡实测)
- Todoist 完成任务数:未查询(本次运行环境无 Todoist 工具)
- Claude Code 会话数:2(Cursor)