2026年8月17日 赛博日记 - BU-30B模型部署与自动化测试整合
生成时间:2026-08-17 23:50 (Asia/Shanghai)
核心工作
💻 Claude Code 工作记录
- 时间:17:08
- 项目:AI 自动化测试平台(本地 index.html)
- 会话:UI 自动化与接口自动化测试整合(项目地址 D:\code\LLM-api-test)
- 消息数:343(6 轮用户提问)
- 内容:将接口自动化测试整合进现有以 UI 自动化为主的测试平台,注意是深度整合而非简单拼接;期间完成 P02 页面改 4 列布局等调整
- 状态:✅ 正常
🌐 BU-30B-A3B-Preview 部署调研 + 笔记输出
今天的主线之一是 browser-use 官方开源模型 BU-30B-A3B-Preview 的本地部署可行性调研:
- 模型本质:基座是 Qwen3-VL-30B-A3B-Instruct,30B 总参 / 3B 激活的 MoE 视觉语言模型,针对「截图 + DOM 理解 → 浏览器操作」Agent 场景重训
- 显存结论(65G 卡):BF16 约 61GB 装不下(加 KV cache + 视觉激活总需 66~70GB,必爆);推荐 AWQ-4bit(~18GB) 或 FP8(~31GB,需 L40S/H100 级卡支持);24G 消费卡跑 Int4 也没问题
- MTP 结论:无官方 MTP checkpoint(仅 Qwen3-Next 线有),vLLM 的 MTP 通路不支持 Qwen3-VL 架构,不建议自训;替代方案是 ngram 投机解码 + prefix caching
- 产出:写了完整部署笔记《BU-30B-A3B-Preview 本地部署笔记》并提交推送(ca145d0),含模型信息、显存评估、vLLM/AWQ 部署方案、browser-use 接入方式
🎓 微调 Qwen3.8-27B 复刻 bu-2.0 能力调研
对照 bu-2.0 model card,梳理了微调 Qwen3.8-27B 用于 browser-use 场景的完整路线图:
- 数据:构建截图 + 序列化 DOM + 工具 schema + 历史动作轨迹 → 下一步动作的结构化数据集;以 BU Bench V1(100 任务,交互/浏览/导航/助手/理解五类)为基准起点,补充内部真实 traces;重点做状态-动作一致性校验、超长 DOM 的 token 预算化裁剪
- 模型适配:视觉输入对齐(或图像描述/特征注入)、工具调用专用 token 与 JSON Schema 约束输出、上下文长度规划
- 训练:三阶段——SFT 冷启动(状态-动作映射)→ 工具调用强化 → 可选 RL/DPO 偏好优化;动作预测用交叉熵 + token-level 掩码损失 + 完成度分类损失
- 评估:BU Bench V1 复现 baseline,按成功率/步数/错误率/Latency/成本归因迭代
🛠️ 赛博日记流程修复
- 发现日记标题的总结性后缀又丢失了(此前要求格式如「2026-07-23赛博日记-AI自动化优化与用例生成探索」,现在退化回纯日期标题),已反馈修复,本篇标题恢复带主题后缀格式
思考与备忘
- BU-30B 这类「Agent 专用小模型 + 极低激活参数」路线(3B 激活)对本地部署非常友好,4bit 量化后 24G 卡即可跑浏览器自动化 Agent,云端 200 tasks/$1 的定价对本地部署几乎没有护城河
- 微调通用模型追平专用 Agent 模型的核心瓶颈不在算法而在轨迹数据质量:元素索引时效性、DOM 裁剪策略、失败样例覆盖,这些脏活决定上限
- 接口自动化与 UI 自动化的「整合」要做成统一测试资产模型,而不是两套引擎的页面拼接——这是今天 Claude Code 会话反复强调的方向
今日摘要
围绕 browser-use 生态重度输出的一天:上午完成 BU-30B-A3B-Preview 部署可行性调研并产出部署笔记(结论:65G 卡走 AWQ-4bit/FP8,别碰 BF16;MTP 别想,用 ngram 投机解码);下午梳理微调 Qwen3.8-27B 复刻 bu-2.0 的四阶段路线图(数据→适配→训练→评估);Claude Code 侧推进自动化测试平台的接口/UI 测试整合。另修复了赛博日记标题格式退化问题。
📊 自动化统计
- 捕获 Memory 数:4(daily + claude + 2 个 session 记录)
- 笔记更新数:1(BU-30B-A3B-Preview 部署笔记)
- Todoist 完成任务数:0(Todoist 工具本次不可用)
- Claude Code 会话数:1