BIOS工程师标准作业书 之 PCIE 问题如何处理

2024-08-31 15:20

本文主要是介绍BIOS工程师标准作业书 之 PCIE 问题如何处理,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

bios 工程师作为最基层的岗位,做事情一定要按部就班,肯定不能随意发挥。PCI 作为服务器中最主要的总线,也是最容易出bug 的地方。所以我整理了这篇文章。

当前x86系统PCIe架构中面临的挑战以及问题

系统设计中使用了不同供应商的硬件模块,不同的硬件模块都有各自的错误处理和报错机制。

在这么复杂的系统中,如何快速定位故障的模块,并使系统重新健康的上线工作

如何在复杂的系统中,找到问题的根因(root cause), 尤其是超时类的问题?

我们收集了日常工作中所遇到的问题。

PCIe 架构中所面临的问题:

PCIE 设备找不到

PCIE 设备没有跑在所期望的Link speed/ Link width

系统运行过程中,Pcie 设备产生了错误,要怎么处理

在做热插拔的时候,设备发生问题要怎么处理,有可能找不到,有可能

今天主题

服务器的PCIE 拓扑架构

先介绍一下背景知识:

root port:

就是我们说的根节点,pcie 的根节点,它能连接pcie的其他设备, 并且让其他设备在os 下能正常工作。

switch: 相当于usb hub, 就是作扩展作用的。比如32 进72 出。

retimer: 如果直接连,经过的链路太长,信号品质会下降,所以我们需要retimer. 

从软件的角度,我们是如何发现这些pcie设备的:

我们用lspci 观察一下,上面pcie 这条链路上的设备。从根节点开始,一个switch 一个nvme 一个oam

1: root port, bus number 60, device 1 function 0.

2 pcie switch 

3 gpu  卡 bus 号 63

4 smart nic device bus 号 64

5 nvme bus 号65

PCIE 问题的分类

林林总总的问题比较多,首先是和链路相关的部分,设备换不到, 降带宽,降速度。 RAS 错误。 对于错误类别,分为可纠正,不可纠正,热插拔的问题,

PCIE 设备找不到问题的诊断流程

在讲诊断流程之前,我们需要知道PCI 设备的初始化路线。

从主板上电开始,到pci reset , 进入LSTMM , LSTTM 经过两次到L0 状态,第一次我们要跑在gen1的状态, 然后通过recovery , 调整到gen3/4/5 状态。这个就是整个硬件的初始化,后面就是pci 枚举, 分配bus号,把真实的功能跑起来。

只要在上面,任意一个地方有问题,就会找不到

我们重点讲一下状态机。

绿色的L0 就是正常工作的状态。

detect phase: 发出一个检测脉冲, 就是在这个时候,查两端有没有设备,如果没有设备,就不会往下走。

bios 初始化过程:

检测RP 的link status 寄存器,确认LINK SPEED /WIDH 都是有效的值(ltssm 是在L0)

初始化RP设备的bus number 寄存器来构建pci topo /pcie tree

有递归算法找出整个pcie topo 上所有的pcie 设备

收集pcie 设备对资源的要求  内存和IO  (大部分设备不需要IO).

决定最终的bus 号,并组每个pcie 设备分配所需要的资源

枚举示意图:

PCIE Advanced Error Reporting (AER ) 机制

这篇关于BIOS工程师标准作业书 之 PCIE 问题如何处理的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1124276

相关文章

Go标准库常见错误分析和解决办法

《Go标准库常见错误分析和解决办法》Go语言的标准库为开发者提供了丰富且高效的工具,涵盖了从网络编程到文件操作等各个方面,然而,标准库虽好,使用不当却可能适得其反,正所谓工欲善其事,必先利其器,本文将... 目录1. 使用了错误的time.Duration2. time.After导致的内存泄漏3. jsO

Python FastAPI+Celery+RabbitMQ实现分布式图片水印处理系统

《PythonFastAPI+Celery+RabbitMQ实现分布式图片水印处理系统》这篇文章主要为大家详细介绍了PythonFastAPI如何结合Celery以及RabbitMQ实现简单的分布式... 实现思路FastAPI 服务器Celery 任务队列RabbitMQ 作为消息代理定时任务处理完整

springboot循环依赖问题案例代码及解决办法

《springboot循环依赖问题案例代码及解决办法》在SpringBoot中,如果两个或多个Bean之间存在循环依赖(即BeanA依赖BeanB,而BeanB又依赖BeanA),会导致Spring的... 目录1. 什么是循环依赖?2. 循环依赖的场景案例3. 解决循环依赖的常见方法方法 1:使用 @La

C#使用SQLite进行大数据量高效处理的代码示例

《C#使用SQLite进行大数据量高效处理的代码示例》在软件开发中,高效处理大数据量是一个常见且具有挑战性的任务,SQLite因其零配置、嵌入式、跨平台的特性,成为许多开发者的首选数据库,本文将深入探... 目录前言准备工作数据实体核心技术批量插入:从乌龟到猎豹的蜕变分页查询:加载百万数据异步处理:拒绝界面

Springboot处理跨域的实现方式(附Demo)

《Springboot处理跨域的实现方式(附Demo)》:本文主要介绍Springboot处理跨域的实现方式(附Demo),具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不... 目录Springboot处理跨域的方式1. 基本知识2. @CrossOrigin3. 全局跨域设置4.

python+opencv处理颜色之将目标颜色转换实例代码

《python+opencv处理颜色之将目标颜色转换实例代码》OpenCV是一个的跨平台计算机视觉库,可以运行在Linux、Windows和MacOS操作系统上,:本文主要介绍python+ope... 目录下面是代码+ 效果 + 解释转HSV: 关于颜色总是要转HSV的掩膜再标注总结 目标:将红色的部分滤

SpringBoot启动报错的11个高频问题排查与解决终极指南

《SpringBoot启动报错的11个高频问题排查与解决终极指南》这篇文章主要为大家详细介绍了SpringBoot启动报错的11个高频问题的排查与解决,文中的示例代码讲解详细,感兴趣的小伙伴可以了解一... 目录1. 依赖冲突:NoSuchMethodError 的终极解法2. Bean注入失败:No qu

MySQL新增字段后Java实体未更新的潜在问题与解决方案

《MySQL新增字段后Java实体未更新的潜在问题与解决方案》在Java+MySQL的开发中,我们通常使用ORM框架来映射数据库表与Java对象,但有时候,数据库表结构变更(如新增字段)后,开发人员可... 目录引言1. 问题背景:数据库与 Java 实体不同步1.1 常见场景1.2 示例代码2. 不同操作

Python实现自动化接收与处理手机验证码

《Python实现自动化接收与处理手机验证码》在移动互联网时代,短信验证码已成为身份验证、账号注册等环节的重要安全手段,本文将介绍如何利用Python实现验证码的自动接收,识别与转发,需要的可以参考下... 目录引言一、准备工作1.1 硬件与软件需求1.2 环境配置二、核心功能实现2.1 短信监听与获取2.

Python使用date模块进行日期处理的终极指南

《Python使用date模块进行日期处理的终极指南》在处理与时间相关的数据时,Python的date模块是开发者最趁手的工具之一,本文将用通俗的语言,结合真实案例,带您掌握date模块的六大核心功能... 目录引言一、date模块的核心功能1.1 日期表示1.2 日期计算1.3 日期比较二、六大常用方法详