BIOS工程师标准作业书 之 PCIE 问题如何处理

2024-08-31 15:20

本文主要是介绍BIOS工程师标准作业书 之 PCIE 问题如何处理,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

bios 工程师作为最基层的岗位,做事情一定要按部就班,肯定不能随意发挥。PCI 作为服务器中最主要的总线,也是最容易出bug 的地方。所以我整理了这篇文章。

当前x86系统PCIe架构中面临的挑战以及问题

系统设计中使用了不同供应商的硬件模块,不同的硬件模块都有各自的错误处理和报错机制。

在这么复杂的系统中,如何快速定位故障的模块,并使系统重新健康的上线工作

如何在复杂的系统中,找到问题的根因(root cause), 尤其是超时类的问题?

我们收集了日常工作中所遇到的问题。

PCIe 架构中所面临的问题:

PCIE 设备找不到

PCIE 设备没有跑在所期望的Link speed/ Link width

系统运行过程中,Pcie 设备产生了错误,要怎么处理

在做热插拔的时候,设备发生问题要怎么处理,有可能找不到,有可能

今天主题

服务器的PCIE 拓扑架构

先介绍一下背景知识:

root port:

就是我们说的根节点,pcie 的根节点,它能连接pcie的其他设备, 并且让其他设备在os 下能正常工作。

switch: 相当于usb hub, 就是作扩展作用的。比如32 进72 出。

retimer: 如果直接连,经过的链路太长,信号品质会下降,所以我们需要retimer. 

从软件的角度,我们是如何发现这些pcie设备的:

我们用lspci 观察一下,上面pcie 这条链路上的设备。从根节点开始,一个switch 一个nvme 一个oam

1: root port, bus number 60, device 1 function 0.

2 pcie switch 

3 gpu  卡 bus 号 63

4 smart nic device bus 号 64

5 nvme bus 号65

PCIE 问题的分类

林林总总的问题比较多,首先是和链路相关的部分,设备换不到, 降带宽,降速度。 RAS 错误。 对于错误类别,分为可纠正,不可纠正,热插拔的问题,

PCIE 设备找不到问题的诊断流程

在讲诊断流程之前,我们需要知道PCI 设备的初始化路线。

从主板上电开始,到pci reset , 进入LSTMM , LSTTM 经过两次到L0 状态,第一次我们要跑在gen1的状态, 然后通过recovery , 调整到gen3/4/5 状态。这个就是整个硬件的初始化,后面就是pci 枚举, 分配bus号,把真实的功能跑起来。

只要在上面,任意一个地方有问题,就会找不到

我们重点讲一下状态机。

绿色的L0 就是正常工作的状态。

detect phase: 发出一个检测脉冲, 就是在这个时候,查两端有没有设备,如果没有设备,就不会往下走。

bios 初始化过程:

检测RP 的link status 寄存器,确认LINK SPEED /WIDH 都是有效的值(ltssm 是在L0)

初始化RP设备的bus number 寄存器来构建pci topo /pcie tree

有递归算法找出整个pcie topo 上所有的pcie 设备

收集pcie 设备对资源的要求  内存和IO  (大部分设备不需要IO).

决定最终的bus 号,并组每个pcie 设备分配所需要的资源

枚举示意图:

PCIE Advanced Error Reporting (AER ) 机制

这篇关于BIOS工程师标准作业书 之 PCIE 问题如何处理的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1124276

相关文章

MybatisGenerator文件生成不出对应文件的问题

《MybatisGenerator文件生成不出对应文件的问题》本文介绍了使用MybatisGenerator生成文件时遇到的问题及解决方法,主要步骤包括检查目标表是否存在、是否能连接到数据库、配置生成... 目录MyBATisGenerator 文件生成不出对应文件先在项目结构里引入“targetProje

C#使用HttpClient进行Post请求出现超时问题的解决及优化

《C#使用HttpClient进行Post请求出现超时问题的解决及优化》最近我的控制台程序发现有时候总是出现请求超时等问题,通常好几分钟最多只有3-4个请求,在使用apipost发现并发10个5分钟也... 目录优化结论单例HttpClient连接池耗尽和并发并发异步最终优化后优化结论我直接上优化结论吧,

Java内存泄漏问题的排查、优化与最佳实践

《Java内存泄漏问题的排查、优化与最佳实践》在Java开发中,内存泄漏是一个常见且令人头疼的问题,内存泄漏指的是程序在运行过程中,已经不再使用的对象没有被及时释放,从而导致内存占用不断增加,最终... 目录引言1. 什么是内存泄漏?常见的内存泄漏情况2. 如何排查 Java 中的内存泄漏?2.1 使用 J

numpy求解线性代数相关问题

《numpy求解线性代数相关问题》本文主要介绍了numpy求解线性代数相关问题,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧... 在numpy中有numpy.array类型和numpy.mat类型,前者是数组类型,后者是矩阵类型。数组

解决systemctl reload nginx重启Nginx服务报错:Job for nginx.service invalid问题

《解决systemctlreloadnginx重启Nginx服务报错:Jobfornginx.serviceinvalid问题》文章描述了通过`systemctlstatusnginx.se... 目录systemctl reload nginx重启Nginx服务报错:Job for nginx.javas

Go语言使用Buffer实现高性能处理字节和字符

《Go语言使用Buffer实现高性能处理字节和字符》在Go中,bytes.Buffer是一个非常高效的类型,用于处理字节数据的读写操作,本文将详细介绍一下如何使用Buffer实现高性能处理字节和... 目录1. bytes.Buffer 的基本用法1.1. 创建和初始化 Buffer1.2. 使用 Writ

Redis缓存问题与缓存更新机制详解

《Redis缓存问题与缓存更新机制详解》本文主要介绍了缓存问题及其解决方案,包括缓存穿透、缓存击穿、缓存雪崩等问题的成因以及相应的预防和解决方法,同时,还详细探讨了缓存更新机制,包括不同情况下的缓存更... 目录一、缓存问题1.1 缓存穿透1.1.1 问题来源1.1.2 解决方案1.2 缓存击穿1.2.1

Python视频处理库VidGear使用小结

《Python视频处理库VidGear使用小结》VidGear是一个高性能的Python视频处理库,本文主要介绍了Python视频处理库VidGear使用小结,文中通过示例代码介绍的非常详细,对大家的... 目录一、VidGear的安装二、VidGear的主要功能三、VidGear的使用示例四、VidGea

Python结合requests和Cheerio处理网页内容的操作步骤

《Python结合requests和Cheerio处理网页内容的操作步骤》Python因其简洁明了的语法和强大的库支持,成为了编写爬虫程序的首选语言之一,requests库是Python中用于发送HT... 目录一、前言二、环境搭建三、requests库的基本使用四、Cheerio库的基本使用五、结合req

使用Python处理CSV和Excel文件的操作方法

《使用Python处理CSV和Excel文件的操作方法》在数据分析、自动化和日常开发中,CSV和Excel文件是非常常见的数据存储格式,ython提供了强大的工具来读取、编辑和保存这两种文件,满足从基... 目录1. CSV 文件概述和处理方法1.1 CSV 文件格式的基本介绍1.2 使用 python 内