|Index|SUSE Edge 文档|查错|常规故障排除原则
适用范围 SUSE Edge 3.6

34 常规故障排除原则

在深入研究特定组件的问题之前,请考虑以下常规原则:

  • 检查日志:日志是信息的主要来源。大多数情况下,错误是不言自明的,并包含有关失败原因的提示。

  • 检查时钟:系统之间的时钟差异可能导致各种不同的错误。确保时钟同步。可以指示 EIB 在引导时强制进行时钟同步,请参阅 配置操作系统时间 (第 2 章 “使用 Edge Image Builder 的独立集群”)。

  • 引导问题:如果系统在引导过程中卡住,请记下显示的最后几条消息。访问控制台(物理或通过 BMC)以观察引导消息。

  • 网络问题:验证网络接口配置 (ip a)、路由表 (ip route),测试与其他节点及外部服务之间的连通性 (ping, nc)。确保防火墙规则未阻止必要的端口。

  • 验证组件状态:使用 kubectl get 和 kubectl describe 查看 Kubernetes 资源。使用 kubectl get events --sort-by='.lastTimestamp' -n <namespace> 查看特定 Kubernetes 名称空间上的事件。

  • 验证服务状态:使用 systemctl status <service> 查看 systemd 服务。

  • 检查语法:软件对配置文件有特定的结构和语法要求。例如,对于 yaml 文件,请使用 yamllint 或类似工具来验证语法是否正确。

  • 隔离问题:尝试将问题缩小到特定的组件或层(例如,网络、存储、操作系统、Kubernetes、Metal3、Ironic,…​)。

  • 文档:请务必参考官方 SUSE Edge 文档 以及上游文档以获取详细信息。

  • 版本:SUSE Edge 是不同 SUSE 组件经过深思熟虑且经过全面测试的版本。每个 SUSE Edge 版本中各组件的版本可以在 SUSE Edge 支持矩阵 中查看。

  • 已知问题:对于每个 SUSE Edge 版本,发行说明中都有一个“已知问题”部分,其中包含将在未来版本中修复但可能会影响当前版本的问题的相关信息。