Cell 运维监控
Hypervisor 快照、per-Cell 统计、Provider 延迟、崩溃日志、Run 追踪、证据链和健康检查端点。
健康检查
基础健康
GET /health
返回 Hypervisor 生命周期状态:starting | ready | draining。无需认证。
Prometheus 指标
GET /metrics
公开或需 admin token(取决于部署配置)。
Hypervisor 级监控
Hypervisor 快照
GET /admin/observe/snapshot
返回全局状态摘要:Cell 数量、温度分布、活跃 Run 数、降级 secret 台账等。
{
"cells_total": 12,
"cells_hot": 3,
"cells_warm": 5,
"cells_cool": 2,
"cells_cold": 2,
"active_runs": 7,
"degraded_secrets": {},
"started_at": "2026-09-15T00:00:00Z",
"lifecycle_state": "ready"
}
per-Cell 统计
GET /admin/observe/per-cell-stats?cell=dept-legal&cell=dept-audit
可指定 Cell 子集或省略参数获取全部。
Provider 延迟统计
GET /admin/observe/provider-latency
各 Provider 的 P50/P95/P99 延迟和错误率。
崩溃日志
GET /admin/observe/crash-log
引擎级崩溃事件列表(与 {DataDir}/crashes/ 目录对应)。
Cell 级监控
Cell 运行时统计
GET /cells/{cellID}/observe/stats
返回 Cell 当前状态、活跃 Run 数、温度、运行时间等。
Token 用量查询
GET /cells/{cellID}/observe/token-usage?group_by=model,day&from=2026-09-01&to=2026-09-15
支持 GroupBy(model / agent / session / day / tag:actor)+ Tags / Model / Session / From / To 多维过滤。
Token 用量聚合
GET /cells/{cellID}/observe/token-summary
返回汇总摘要。
按 Agent/Day 聚合
GET /cells/{cellID}/observe/token-usage/aggregate?agent=assistant&group_by=day&days=7
Run 追踪
Run 列表
GET /cells/{cellID}/observe/runs?agent=assistant&limit=20&offset=0
Actor 过滤:?actor= 仅对 admin token 生效,非 admin 自动取 Principal.Actor(INV-OBS-08)。
Run 详情
GET /cells/{cellID}/observe/runs/{runID}
别人的 Run 与不存在的 Run 同返空(不给 Run ID 探针)。
Run 工具调用追踪
GET /cells/{cellID}/observe/runs/{runID}/tools
证据链
GET /cells/{cellID}/observe/evidence
Accept: application/jsonl
以 JSONL 流返回证据链。注意:此端点抬到 cell:admin 作用域(INV-OBS-09),不按 actor 过滤——证据链是逐 Run hash chain,切片后缺环无法校验。
审计
GET /cells/{cellID}/audit/export?format=jsonl&from=2026-09-01&to=2026-09-15
GET /cells/{cellID}/audit/summary
同样抬到 cell:admin(INV-OBS-09)。
Cell 温度观察
| 温度 | 含义 | 激活成本 |
|---|---|---|
| Hot | 有活跃 Run | 0 |
| Warm | goroutine/DB 在 | 0 |
| Cool | 磁盘保留,无 goroutine | 100-500ms |
| Cold | Stopped | 1-3s |
Cool 态首请求自动 WarmUp;Cold 态返回 503 + Retry-After: 5 + 异步唤醒。
日志文件
| 文件 | 内容 |
|---|---|
{DataDir}/logs/wesgine-stderr.log | fd 2 落盘,含 panic 栈(INV-CRASH-STDERR-01) |
| journal / stdout | 业务日志镜像(Info+) |
排障第一步:始终先看 wesgine-stderr.log,不是 journal。
相关文档
- Provider 故障排查 →
provider-troubleshooting.md - 不变量索引 →
invariant-index.md - 数据韧性 →
data-model.md