本文主要是介绍BIOS工程师标准作业书 之 PCIE 问题如何处理,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!
bios 工程师作为最基层的岗位,做事情一定要按部就班,肯定不能随意发挥。PCI 作为服务器中最主要的总线,也是最容易出bug 的地方。所以我整理了这篇文章。
当前x86系统PCIe架构中面临的挑战以及问题
系统设计中使用了不同供应商的硬件模块,不同的硬件模块都有各自的错误处理和报错机制。
在这么复杂的系统中,如何快速定位故障的模块,并使系统重新健康的上线工作
如何在复杂的系统中,找到问题的根因(root cause), 尤其是超时类的问题?
我们收集了日常工作中所遇到的问题。
PCIe 架构中所面临的问题:
PCIE 设备找不到
PCIE 设备没有跑在所期望的Link speed/ Link width
系统运行过程中,Pcie 设备产生了错误,要怎么处理
在做热插拔的时候,设备发生问题要怎么处理,有可能找不到,有可能
今天主题
服务器的PCIE 拓扑架构
先介绍一下背景知识:
root port:
就是我们说的根节点,pcie 的根节点,它能连接pcie的其他设备, 并且让其他设备在os 下能正常工作。
switch: 相当于usb hub, 就是作扩展作用的。比如32 进72 出。
retimer: 如果直接连,经过的链路太长,信号品质会下降,所以我们需要retimer.
从软件的角度,我们是如何发现这些pcie设备的:
我们用lspci 观察一下,上面pcie 这条链路上的设备。从根节点开始,一个switch 一个nvme 一个oam
1: root port, bus number 60, device 1 function 0.
2 pcie switch
3 gpu 卡 bus 号 63
4 smart nic device bus 号 64
5 nvme bus 号65
PCIE 问题的分类
林林总总的问题比较多,首先是和链路相关的部分,设备换不到, 降带宽,降速度。 RAS 错误。 对于错误类别,分为可纠正,不可纠正,热插拔的问题,
PCIE 设备找不到问题的诊断流程
在讲诊断流程之前,我们需要知道PCI 设备的初始化路线。
从主板上电开始,到pci reset , 进入LSTMM , LSTTM 经过两次到L0 状态,第一次我们要跑在gen1的状态, 然后通过recovery , 调整到gen3/4/5 状态。这个就是整个硬件的初始化,后面就是pci 枚举, 分配bus号,把真实的功能跑起来。
只要在上面,任意一个地方有问题,就会找不到
我们重点讲一下状态机。
绿色的L0 就是正常工作的状态。
detect phase: 发出一个检测脉冲, 就是在这个时候,查两端有没有设备,如果没有设备,就不会往下走。
bios 初始化过程:
检测RP 的link status 寄存器,确认LINK SPEED /WIDH 都是有效的值(ltssm 是在L0)
初始化RP设备的bus number 寄存器来构建pci topo /pcie tree
有递归算法找出整个pcie topo 上所有的pcie 设备
收集pcie 设备对资源的要求 内存和IO (大部分设备不需要IO).
决定最终的bus 号,并组每个pcie 设备分配所需要的资源
枚举示意图:
PCIE Advanced Error Reporting (AER ) 机制
这篇关于BIOS工程师标准作业书 之 PCIE 问题如何处理的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!