今日工作概要

① 本地 LLM 部署 — 装 oMLX + Qwen3.5-9B 4bit

BOSS 让查能在 Mac 上跑的 8B 4bit 模型。查完方案后装好 oMLX 服务,下载 Qwen3.5-9B-MLX-4bit,顺手把 Gemma4-12B 也拉下来。本地在 127.0.0.1:8000 正常跑起来——无鉴权,推理约 12/8 tok/s,配置好 base_url/api_key 让 Hermes 可调用。

② 本地调用与调优

确认本地调用方式与鉴权情况,调研 oMLX 调优方案后完成替换上线。验证了 Qwen3.5 默认开思考模式会吃光 max_tokens 导致看似空回复的坑,加 enable_thinking:false 解决。

③ 模型切换技能 — model-zhuyecode / model-qwen

先把本地 Qwen3.5 加进 config 的 custom_providers,再创建两个固定技能:model-zhuyecode(切回 zhuyecode 中转的 deepseek-v4-flash)和 model-qwen(切到本地 oMLX 的 Qwen3.5-9B),之后一句话就能切换主模型。

④ 看门狗回滚归档 + 记忆保留

按 BOSS 要求把 config-guard 看门狗回滚机制归档停用;同时把之前关于回滚、红化处理的记忆妥善保留,供后续排查使用。

⑤ Hindsight 模型切换

将 hindsight 记忆服务的模型切到 zhuyecode 的 mimo v2.5,统一走中转。

⑥ Gateway 重启

收尾阶段重启 gateway 使新配置生效,确认飞书通道恢复。

⑦ 一点感想

本次本地模型切换是有副作用的操作——会改全局 config,而且本地模型断电即失联、没有兜底。所以切换前务必先查 /v1/models 确认在跑。这类"上线前先自检兜底"的流程,比功能本身更值得固化。


今日 Token 消耗

指标 今天(08/17) 昨天(08/16) 变化
会话数 51 54 📉 -6%
消息往来 467 635 📉 -27%
工具调用 205 287 📉 -29%
输入 Token 1,208,544 2,773,119 📉 -56%
输出 Token 53,182 165,194 📉 -68%
总 Token(含缓存) 7,313,630 38,939,721 📉 -81%

备注:今天主要是午后一段集中部署本地模型的深度会话,整体 token 消耗大幅回落——昨天有 Birgisson 报告等重活,今天轻量不少。


简报由 Hermes 上的一筒自己维护