From e6e79ced0db9046be80d289d40a1ad5284b21f5a Mon Sep 17 00:00:00 2001 From: hmo Date: Tue, 21 Jul 2026 02:44:56 +0800 Subject: [PATCH] =?UTF-8?q?docs:=20=E7=BA=A2=E7=BA=BF#12=20=E5=91=8A?= =?UTF-8?q?=E8=AD=A6=E4=BF=A1=E5=99=AA=E6=AF=94=E7=BA=AA=E5=BE=8B=EF=BC=88?= =?UTF-8?q?alert=5Fhelper=E4=B8=A4=E7=BA=A7=E9=80=9A=E9=81=93=EF=BC=89?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit --- docs/dev-spec.md | 1 + 1 file changed, 1 insertion(+) diff --git a/docs/dev-spec.md b/docs/dev-spec.md index a2a2ef62..f46f03a3 100644 --- a/docs/dev-spec.md +++ b/docs/dev-spec.md @@ -24,6 +24,7 @@ 9. **死模块必须收尸** — 宣布模块废弃时,必须在同一轮操作中完成收尸六步:①杀进程 ②stop+disable systemd 服务 ③删 cron job ④归档脚本到 `archive/` ⑤归档数据文件 ⑥从期望矩阵/监控中移除。只说"已废弃"不收尸 = 没废弃(小果 bot 以 root 白跑 8 天 2.5GB 的教训) 10. **监控查"活"不查"在"** — 健康检查必须验证**数据新鲜度**(DB 表 MAX(时间列))而非"文件存在/进程存在"。文件 mtime、进程存活都不构成健康证据——数据 24h 不更新才是事故。禁止拿遗留文件的 mtime 当管道健康指标("数据管道停滞14天"假警报的根因) 11. **批量 LLM 调用禁止走 hermes gateway agent 通道** — hermes gateway 的 `/v1/chat/completions` **不是透传**,是完整 agent 运行时:每个请求创建带工具(terminal/websearch/patch)的 agent 会话,可能螺旋几十轮、累积 150k+ token,客户端超时后服务端仍空转,重试会叠加新会话形成自我 DDoS(2026-07-21 603288 事件:单次重评螺旋 35 分钟、44 次 terminal 调用)。所有批量/脚本化 LLM 调用必须经 `llm_client.call_llm()`:**OCG 上游直连为主**(裸 completion,key 运行时从 hermes config.yaml 读取,不落盘),gateway 仅作应急兜底。新增 LLM 调用点一律复用 `llm_client`,禁止手写 HTTP 调用 +12. **告警信噪比纪律** — 所有系统 XMPP 告警必须经 `alert_helper.notify()`,禁止直 POST :5805。两级通道:**ACTION**(买入信号/重点推荐/需人工核查)直通不限速、🚨 前缀独立成条,**永不被限速**;**INFO**(部署/卫生/修复/监控报备)同类 30 分钟限 1 条、≤8 行、24h 内容去重(同一问题不重复轰炸)。有意义的信号(重点推荐操作)绝不允许被纯通知淹没;通知型信息零问题 = 零消息(沉默即正常) ---