InfraGuard 运行维护:巡检、故障与恢复

检查资产、批次、Agent 与采集链路,明确凭据轮换、备份升级和主机改动的独立恢复责任。

Linux监控告警自动化

值班范围与当前验证状态

本页是依据 2026-09-08 源码审阅整理的巡检与恢复要求,未执行部署、故障注入或恢复演练。适用于已通过安全整改和试点验收的环境;若凭据保护、SSH 身份校验或端点访问控制仍未完成,应停在隔离研究阶段。

值班交接应区分平台自身故障、被管主机异常、远程任务失败和外部监控问题。InfraGuard 不负责自动修复所有异常,也没有据本次源码审阅验证完整审计链路。

日常巡检与资产一致性

检查登录和关键页面、后端错误、数据库连接与容量、近期任务失败及 Agent 上报时间。抽样对照资产分组、标签与实际主机清单;记录长期未上报节点的维护状态,不能仅凭平台在线标记决定业务是否健康。

扫描任务需要核对批准网段、执行时段、发现数量与资产差异。未分组扫描资产具有特殊清理行为,交接时说明相关记录的归档方式。导出与日志应脱敏保存,不能把包含资产信息的文件投放到公开知识库。

常见故障的排查顺序

  • 页面不可用:先区分静态资源路径、API 代理、后端进程和数据库错误,避免重复启动多个后端造成混淆。
  • Agent 没有新指标:确认节点身份、服务地址、上报间隔、网络与响应状态,保留最近成功时间;不要通过向公网开放端口绕过故障。
  • SD 目标缺失:核对主机是否在线、是否分组及标签是否符合预期,再查采集端端口和访问控制。
  • 任务失败:定位具体批次、模板、账号与主机结果,先查网络和认证,再查脚本适用性;不要全量重试掩盖部分成功。
  • 数据库写入失败:停止继续导入或扩大扫描,核对容量、权限与错误日志,避免把重试变成重复资产。

配置、凭据与执行权限变更

变更前保存配置、数据库备份与当前有效账号清单。轮换凭据需先验证新连接,再安排旧凭据吊销;已有会话与正在运行的任务应单独核验,不假定修改记录后会自动终止。

脚本模板改动必须产生可追溯版本,记录受影响目标与回退方法。没有源码支持证据时,不宣称存在完整细粒度审批或定时编排;相关责任应由既有变更平台承担。不要在任务输出中打印秘密,也不要将秘密值作为故障排查附件。

备份、升级与恢复停止条件

备份应覆盖数据库、配置、模板和版本信息,并在独立环境验证恢复可读性。资产数据库和被管主机是两类对象:恢复平台数据库不会回退已经执行到主机上的脚本。针对写入型任务需要另行恢复主机配置或业务数据。

升级先冻结高风险任务,记录后端、前端和 Agent 的构建标识,在副本环境验证兼容与数据库变化。出现登录失效、资产映射变化、任务结果不可追踪或新旧版本不兼容时停止推广。不要仅替换旧二进制就假定可以回滚数据库结构,也不要删除任务记录来让页面恢复“干净”。

验收记录与关联资料

故障记录包含开始时间、影响主机、最后可信状态、操作人、采取动作和恢复证据。恢复后复查登录、资产、任务、指标与 SD;其中未恢复的环节应保留明确缺口。建议单独演练受限环境中的数据库恢复、Agent 中断以及单台任务失败,但不得把建议演练写成已完成结果。

实现依据可查 internal/api/router.gointernal/executor/task_runner.gointernal/model/database.gointernal/api/handler/monitor_handler.go。继续阅读使用指南批量初始化排障知识主机资源排障知识;参考资料不意味着对应功能已在 InfraGuard 中集成。

DOUYA OPS ECOSYSTEM

完善文档,帮助更多运维人

把安装、配置、API 与运维方法沉淀为清晰文档,让工具和项目更容易被正确使用。