用linux perf命令来分析程序的cpu cache miss现象

2024-02-06 10:58

本文主要是介绍用linux perf命令来分析程序的cpu cache miss现象,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

     先来看一段简单的程序:

#include <stdio.h>
#include <unistd.h>int main(int argc, char **argv)
{int a[1000][1000];if(1 == argc){for(int i = 0; i < 1000; ++i){for(int j = 0; j < 1000; ++j){a[i][j] = 0;}}}else{for(int i = 0; i < 1000; ++i){for(int j = 0; j < 1000; ++j){a[j][i] = 0;}}}return 0;
}

       上面有两个小程序片段, 哪段效率高? 显然, 第一段效率高, 为什么呢? 因为在C/C++中,数组是按行存储的,程序的按行访问可以充分利用程序的局部性原理(空间局部性), 用time命令来看看结果:

taoge$ time ./a.out real    0m0.006s
user    0m0.004s
sys     0m0.000s
taoge$ time ./a.out real    0m0.006s
user    0m0.004s
sys     0m0.000s
taoge$ time ./a.out real    0m0.006s
user    0m0.004s
sys     0m0.000s
taoge$ time ./a.out 1real    0m0.009s
user    0m0.004s
sys     0m0.008s
taoge$ time ./a.out 1real    0m0.010s
user    0m0.004s
sys     0m0.004s
taoge$ time ./a.out 1real    0m0.010s
user    0m0.004s
sys     0m0.004s

        显然, 第二段程序的real time要大, 用perf分析下原因:

taoge$ perf stat -e L1-dcache-load-misses ./a.outPerformance counter stats for './a.out':101,870 L1-dcache-load-misses                                       0.005415735 seconds time elapsedtaoge$ 
taoge$ 
taoge$ perf stat -e L1-dcache-load-misses ./a.outPerformance counter stats for './a.out':100,231 L1-dcache-load-misses                                       0.005486385 seconds time elapsedtaoge$ 
taoge$ 
taoge$ perf stat -e L1-dcache-load-misses ./a.outPerformance counter stats for './a.out':103,496 L1-dcache-load-misses                                       0.005329914 seconds time elapsedtaoge$ 
taoge$ 
taoge$ perf stat -e L1-dcache-load-misses ./a.out 1Performance counter stats for './a.out 1':1,122,333 L1-dcache-load-misses                                       0.012910445 seconds time elapsedtaoge$ 
taoge$ 
taoge$ perf stat -e L1-dcache-load-misses ./a.out 1Performance counter stats for './a.out 1':1,093,971 L1-dcache-load-misses                                       0.009197791 seconds time elapsedtaoge$ 
taoge$ 
taoge$ perf stat -e L1-dcache-load-misses ./a.out 1Performance counter stats for './a.out 1':1,099,561 L1-dcache-load-misses                                       0.009234823 seconds time elapsedtaoge$ 

       显而易见了,  cache miss太多了。

       理论联系实际地理解一下, 有好处。

 

 

 

 

这篇关于用linux perf命令来分析程序的cpu cache miss现象的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/684090

相关文章

Linux中压缩、网络传输与系统监控工具的使用完整指南

《Linux中压缩、网络传输与系统监控工具的使用完整指南》在Linux系统管理中,压缩与传输工具是数据备份和远程协作的桥梁,而系统监控工具则是保障服务器稳定运行的眼睛,下面小编就来和大家详细介绍一下它... 目录引言一、压缩与解压:数据存储与传输的优化核心1. zip/unzip:通用压缩格式的便捷操作2.

Linux中SSH服务配置的全面指南

《Linux中SSH服务配置的全面指南》作为网络安全工程师,SSH(SecureShell)服务的安全配置是我们日常工作中不可忽视的重要环节,本文将从基础配置到高级安全加固,全面解析SSH服务的各项参... 目录概述基础配置详解端口与监听设置主机密钥配置认证机制强化禁用密码认证禁止root直接登录实现双因素

在Linux终端中统计非二进制文件行数的实现方法

《在Linux终端中统计非二进制文件行数的实现方法》在Linux系统中,有时需要统计非二进制文件(如CSV、TXT文件)的行数,而不希望手动打开文件进行查看,例如,在处理大型日志文件、数据文件时,了解... 目录在linux终端中统计非二进制文件的行数技术背景实现步骤1. 使用wc命令2. 使用grep命令

postgresql数据库基本操作及命令详解

《postgresql数据库基本操作及命令详解》本文介绍了PostgreSQL数据库的基础操作,包括连接、创建、查看数据库,表的增删改查、索引管理、备份恢复及退出命令,适用于数据库管理和开发实践,感兴... 目录1. 连接 PostgreSQL 数据库2. 创建数据库3. 查看当前数据库4. 查看所有数据库

Linux如何快速检查服务器的硬件配置和性能指标

《Linux如何快速检查服务器的硬件配置和性能指标》在运维和开发工作中,我们经常需要快速检查Linux服务器的硬件配置和性能指标,本文将以CentOS为例,介绍如何通过命令行快速获取这些关键信息,... 目录引言一、查询CPU核心数编程(几C?)1. 使用 nproc(最简单)2. 使用 lscpu(详细信

linux重启命令有哪些? 7个实用的Linux系统重启命令汇总

《linux重启命令有哪些?7个实用的Linux系统重启命令汇总》Linux系统提供了多种重启命令,常用的包括shutdown-r、reboot、init6等,不同命令适用于不同场景,本文将详细... 在管理和维护 linux 服务器时,完成系统更新、故障排查或日常维护后,重启系统往往是必不可少的步骤。本文

基于Linux的ffmpeg python的关键帧抽取

《基于Linux的ffmpegpython的关键帧抽取》本文主要介绍了基于Linux的ffmpegpython的关键帧抽取,实现以按帧或时间间隔抽取关键帧,文中通过示例代码介绍的非常详细,对大家的学... 目录1.FFmpeg的环境配置1) 创建一个虚拟环境envjavascript2) ffmpeg-py

nginx启动命令和默认配置文件的使用

《nginx启动命令和默认配置文件的使用》:本文主要介绍nginx启动命令和默认配置文件的使用,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录常见命令nginx.conf配置文件location匹配规则图片服务器总结常见命令# 默认配置文件启动./nginx

Linux脚本(shell)的使用方式

《Linux脚本(shell)的使用方式》:本文主要介绍Linux脚本(shell)的使用方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录概述语法详解数学运算表达式Shell变量变量分类环境变量Shell内部变量自定义变量:定义、赋值自定义变量:引用、修改、删

基于Python实现一个Windows Tree命令工具

《基于Python实现一个WindowsTree命令工具》今天想要在Windows平台的CMD命令终端窗口中使用像Linux下的tree命令,打印一下目录结构层级树,然而还真有tree命令,但是发现... 目录引言实现代码使用说明可用选项示例用法功能特点添加到环境变量方法一:创建批处理文件并添加到PATH1